9月17日,小米MiMo大模型负责人罗福莉发文披露,自4月开源MiMo-v2.5后,小米MiMo团队沉寂近半年,期间集中研究强化学习的扩展边界。目前MiMo-V2.6正处于强化学习的中间阶段,团队同步开启了模型训练直播,公开训练过程与算力消耗情况。
据罗福莉介绍,MiMo-V2.6在强化学习阶段扩展了三项能力。在计算层面,每步训练约消耗20亿个Token,采用1568个Prompt乘以16条Rollout的配置,且完全异步执行。在环境和工具层面,团队引入多任务智能体强化学习,支持在一次运行中混合多个框架。在评分环节,团队增加了Grader Compute,即为打分和评分过程本身分配算力,采用Agentic In-group Credit Assignment机制,奖励信号包含测试案例与评分标准。
直播页面显示,MiMo-V2.6的训练总花费已超过125万美元,按当前汇率约合840.3万元人民币,模型即将推出。小米MiMo团队表示,将在接下来的几周内逐步开源上述技术细节。
MiMo是小米自研的大模型系列,此前通过开源方式对外发布版本。此次以直播形式公开强化学习训练过程,在国产大模型团队中较为少见,训练成本与工程细节的同步披露,也为外界观察大模型强化学习阶段的算力投入提供了参考样本。
从行业角度看,强化学习已成为提升大模型推理与智能体能力的关键路径,但训练成本高、工程复杂度大。小米选择公开训练直播并计划开源技术细节,或将在开发者社区中形成一定的技术外溢效应,其后续版本的实际表现值得关注。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。