北京时间9月15日晚,小米两款新模型MiMo-V2.6的Pro和Flash版本先后启动训练,训练过程通过公开页面实时展示。截至9月17日下午,不到两天时间内,页面显示的累计算力成本已超过130万美元。该页面由小米大模型负责人、前DeepSeek研究员罗福莉在X平台公布。
根据公开页面信息,截至北京时间9月17日15时47分,Pro版本已训练约45小时,累计花费约93万美元,完成第14步训练,正在进行第15步;Flash版本训练约40.5小时,花费约41.6万美元,完成第17步,正在进行第18步。Pro的算力支出约为Flash的两倍多。
页面同时公布了阶段性测试成绩。在一项名为DeepSWE v1.1的软件开发测试中,模型需在真实开源项目中增加功能、修复问题,并确保不破坏原有功能。目前Pro通过率为65.78%,Flash为60.77%,Pro领先约5个百分点。相关成绩将随训练推进持续更新。
该页面还承担了故障通报功能。公告显示,Pro因一个计算节点出现显存问题需要重启;Flash在一组数据上遇到基础设施错误,约3小时内未能正确识别,最终从第15步重新启动。训练过程中的故障与重启记录均对外公开。
罗福莉在推文中表示,团队过去近半年一直在研究强化学习能扩展到什么程度,未来几周将逐步开源相关细节。她此前在访谈中提到,国内团队正在加快探索Agent的后训练,重点之一是扩大强化学习规模,但当时未披露具体进展。
此次公开的训练配置显示,小米每个训练步骤安排1568条提示词,每条对应16次尝试,合计25088条轨迹,单步涉及约20亿token。编程任务在训练中占比较大,Pro第14步的代码类提示词占比达67.7%,此外还混合了视觉、聊天等任务。
训练过程的公开引发了同行关注。Meta研究员、前OpenAI研究员卢卡斯·拜尔对小米公开训练成本表示称赞;加州大学圣迭戈分校副教授Yu-Xiang Wang表示希望团队记录训练中遇到的各种问题;曾参与Cursor模型研发的Sasha Rush也在关注训练数据的实时变化。
小米此前曾在今年3月通过匿名模型Hunter Alpha在OpenRouter平台进行早期测试,一周后揭晓为MiMo-V2-Pro。此次直接公开训练过程,为外界观察大模型强化学习训练的算力消耗、故障处理和任务构成提供了少有的实时样本。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。