小米开源MiMo-V2.6:1M上下文与2.5万条轨迹背后的Agent强化学习重构

模型能够比较高效地产生长轨迹,异步系统也能够持续吞吐不同环境,真正稀缺的东西开始变成轨迹里的有效反馈。

小米正式发布并开源MiMo-V2.6系列模型。该系列包含Pro和Flash两个版本:Pro拥有1.02T总参数、42B激活参数,Flash为309B总参数、15B激活参数。两款模型均支持1M token上下文,覆盖文本、图像、视频和音频输入。从参数规模看,这是一次常规的模型升级,但小米在技术文档中投入更多篇幅讨论的,是模型完成预训练之后如何通过后训练继续提升能力。

MiMo-V2.6的核心变化在于后训练阶段。小米将代码、通用Agent、视觉和网络安全任务整合进同一套强化学习系统,单次RL更新使用1568个prompt,每个prompt生成16条rollout,一次更新对应25088条trajectory。与普通问答任务不同,Agent在这些场景中需要持续读取环境、搜索信息、调用工具、执行操作,并根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。

为支撑长轨迹场景下的计算效率,MiMo-V2.6-Pro在注意力结构上做了针对性设计。70层Transformer中,60层采用Sliding Window Attention,窗口仅为128 token,另外10层使用Global Attention。这一设计的逻辑在于:Agent长时间运行时,当前决策频繁使用的往往只是正在处理的代码、最近几轮工具结果和局部状态,早期读取的大量内容需要保留在上下文中,但不必每一层都参与完整交互。局部信息通过SWA高频流动,远处的信息则由少量全局层完成长距离通信。

参数侧采用类似思路。Pro虽然拥有1.02T总参数,每个token实际只激活约42B参数。每个MoE层包含384个routed expert,其中仅调用8个。模型因此可以维持较大的专家容量,又不需要让每个token穿过全部参数。在RL阶段,这一设计的意义更为突出:一次训练同时生成数万条rollout,每条轨迹持续几十轮,任何单token计算量的增加都会被迅速放大。此外,模型还加入5层MTP speculative decoder,drafter一次前向可尝试预测后续7个token,再交由主模型并行验证。

当单次更新产生超过两万条轨迹时,计算压力从模型内部蔓延至整个训练系统。这25088条轨迹不会按照统一节奏结束:有的代码任务几轮操作即可定位问题,有的需要反复运行测试、读取报错再修改;网络安全任务可能经历多次环境验证,视觉Agent又有不同的执行链路。轨迹长度、工具延迟和环境响应混合后,batch内部容易出现明显长尾。若采用严格同步方式,已完成任务的计算资源需等待少数仍在运行的轨迹,规模越大浪费越明显。

MiMo-V2.6采用fully asynchronous GRPO,将rollout、环境执行、grader和模型更新拆开运行。生成侧完成一条轨迹后可继续领取任务,环境执行与评分各自推进,训练侧消费已准备好的数据,不再要求整个batch同时跨过每个阶段。这一工程优化直接影响了RL数据的组织方式。小米没有为代码、通用Agent、视觉和网络安全分别训练独立策略,而是将多领域任务及不同Agent harness混入同一次RL,内部称为You Only RL Once。多个领域一起训练,行为策略可以在同一个policy中发生迁移;多个harness则改变system prompt、工具定义和上下文组织方式,使模型更难将某一种固定接口当作解题捷径,训练压力逐渐落到状态理解、工具选择和环境反馈等更底层的能力上。

在奖励机制方面,传统可验证RL依赖binary reward,代码通过测试得到正向奖励,失败则没有。对于短任务,这种反馈足够清晰,但放进几十步甚至更长的Agent轨迹后,大量过程差异会被压成同一个数字。同一道任务生成16条rollout,其中5条通过测试,一条可能快速定位根因只修改必要代码,另一条经历大量无效搜索,还有一条虽通过测试却引入许多额外修改。仅看pass/fail,这几条成功轨迹难以拉开差距。MiMo-V2.6因此将grader从结果检查器进一步变为组内比较器,通过Groupwise Reward Synthesis同时观察同一道任务产生的多条rollout,从差异中构造task-specific rubric,将过程质量与测试结果结合。Groupwise Advantage Redistribution则进一步影响策略更新,即使多条trajectory全部完成任务,grader仍会继续比较其执行路径的差异。

从行业视角看,MiMo-V2.6的技术路线反映出Agent强化学习正从单一结果奖励向过程感知奖励演进。当模型能够以较低成本持续生成大量长轨迹,异步训练系统能够吞吐不同环境时,瓶颈开始转移到轨迹中的有效反馈密度。如何从数万条轨迹中提取高质量训练信号,而非简单依赖通过或失败的二值判断,正在成为Agent能力持续提升的关键问题。小米此次开源模型及训练方法,为这一方向提供了可参考的工程实践。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
报告显示AI替代入门级任务导致年轻员工领导力培养机会减少
上一篇 22小时前
摩根士丹利分享MCP时代API项目改造实践:以架构即代码推进智能体集成
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部