COBRA-Skills提出智能体技能优化新范式:50个样本降低55%至58%成本

COBRA-Skills 仅用 50 个优化样本,就将优化成本降低了 55%~58%,并在 6 个跨领域 Benchmark 上实现了对现有主流方法的全面超越。

来自香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队近日在论文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》中提出了一种面向智能体技能优化的新方法。该方法将技能优化转化为带预算控制的情境多臂老虎机问题,在真实评估前引入收益预判机制,仅用50个优化样本即实现优化成本降低55%至58%,并在6个跨领域Benchmark上超越现有主流方法。

过去,智能体技能大多依赖人类专家手动撰写,难以覆盖海量复杂场景。借助大模型自动化生成与优化技能成为新范式,但随之而来的是高昂的Token账单。验证一个自动生成的技能是否有效,必须让智能体带入真实任务执行,每次试错都意味着实打实的Token消耗与多轮交互时间成本。同时,许多候选技能在生成时即自带缺陷,现有框架缺乏事前筛选能力,大量预算被低质候选消耗。后续精炼流程频繁调用高阶大模型,即使缺乏有效新证据,“反思—重写”流水线仍在机械重复。

COBRA-Skills的设计可概括为老虎机负责“选”、进化负责“改”,两者形成持续运转的闭环。系统维护固定规模的技能种群,每轮由老虎机算法为每个技能打分并挑选最高分者,目标智能体搭载该技能在优化集上执行任务并返回奖励与执行轨迹,评估结果写入历史数据用于更新打分模型。种群定期触发进化更新,淘汰低分技能并生成新技能填补空缺。

在收益预测环节,团队采用轻量级两层MLP,将技能转化为语义嵌入向量后输出标量奖励预测值。随着评估数据积累,预测精度稳步提升。为解决“探索与利用”困境,团队对比了NeuralUCB与LinearUCB,最终选择“神经网络预测收益+LinearUCB量化探索”的组合,最终优先级分数为预测奖励与探索奖励之和。系统每轮仅挑选得分最高者送入评估,综合分值垫底的技能在后续进化中被淘汰,将有限评估预算引导至预测表现极佳或信息增量巨大的技能。

进化机制立足评估产生的实战证据,采用对数调度策略按需触发,避免高频调用高昂大模型。每次进化淘汰评估得分最低的m个技能,由再生算子、轨迹变异和交叉重组三种算子生成新技能填补空缺。论文第一作者卢平琛表示,若整个框架只能保留一个算子,再生算子无疑是绝对核心,因为初始技能种群正是基于它构建而来。

该研究为智能体技能自动化优化提供了一条低成本、可控制的工程路径。在Token成本日益成为AI应用规模化瓶颈的背景下,将经典情境多臂老虎机算法与大模型驱动的技能演化相结合,或为后续智能体自主进化研究提供新的效率参照。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
AI Box赛道升温:苹果、英伟达、AMD、微软、英特尔竞相布局本地大模型推理设备
上一篇 1天前
吉安高新区视听设备集群产值突破300亿元,入选国家级中小企业特色产业集群
下一篇 1天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部