9月12日上午,2026 Inclusion·外滩大会“Agent Post-Training:智能本质与下一个Scaling Law”见解论坛在上海举行。论坛围绕智能体后训练的算法、环境、基础设施及自我进化等议题展开,来自CAMEL AI、蚂蚁百灵、英伟达、美团LongCat等机构的研究者与产业实践者分享了最新探索。
CAMEL AI创始成员谢钰溱在开场分享中,将Agent的Scaling Law拆解为三个维度:智能体数量、所处环境与自身进化。在数量维度,研究重点并非简单增加参与任务的Agent,而是解决多智能体之间的通信、共识与去中心化自组织问题。在环境维度,她提出环境之于Agent如同数据之于模型,随着任务从简单推理走向跨设备操作、长流程工作乃至机器学习研发,环境复杂度不断提高,结果验证与防止奖励机制被利用变得更加重要。在进化维度,她认为利用当前模型加速研发、推动下一代模型训练,可能成为探索下一个Scaling Law的关键。
蚂蚁百灵大模型负责人周俊以《Agent后训练的产业化全景:让模型走出实验室》为题,提出高质效、可专业化与可信执行三个关键词。他以医疗和金融投研场景为例指出,模型需要识别缺失信息、开展循证检索、说明数据来源并区分事实与假设。周俊强调,现阶段目标并非假设模型不会犯错,而是建立能够识别风险、明确边界的执行体系。“一个好的agent,他不是知道下一步应该做什么,他更加重要的是知道下一步哪些不能擅自去做。”他指出,场景不会自动转化为模型能力,真正重要的是从实际使用中沉淀可复盘的失败案例、更符合专业要求的评测体系以及可交互的训练环境。
英伟达研究员胡健介绍了面向研究的强化学习框架Molt。该框架采用基于PyTorch原生能力的设计,核心代码约9000行,旨在降低框架理解与修改成本,缩短从提出想法到完成实验的距离。胡健表示,代码规模过大时,编程智能体难以完整理解训练框架,容易在实现研究想法时出错,更精简的代码与清晰的接口有助于降低人和Agent共同参与研究的门槛。框架已支持多种主流模型及大参数规模训练。
美团LongCat主任研究员、通用Agent团队负责人顾奇将讨论推进到长程任务。他将长程任务分为循环迭代型与系统性两类,后者包含多层级子任务与复杂依赖关系,反馈稀疏,需要探索任务分段、过程指导和中途更新等机制。围绕支撑Agent运行的外部框架Harness,顾奇将其拆解为交互界面、信息管理机制和推理脚手架三部分,并认为随着模型能力增强,预先规定推理步骤的脚手架可能逐渐减少,但环境交互与信息管理仍将长期存在。在环境建设方面,他指出任务难度不能只用工具数量衡量,工具间的依赖关系、推理深度与交互噪声同样重要。
从论坛分享来看,Agent后训练正从单一模型能力提升转向环境构建、信息管理与训练算法的协同设计。如何让智能体在真实任务中积累经验、验证成果并持续进化,已成为探索下一个Scaling Law的核心命题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。