8月19日,世界机器人大会的一场分论坛上,生数科技创始人兼首席科学家朱军提出了关于通用世界模型的五级划分标准。按照这一路线图,生数科技目前的研发和落地实践覆盖至第三级。这一划分试图为业界关于世界模型形态的争论提供一个系统性框架。
朱军从第一性原理出发定义了通用世界模型。他以人学骑自行车、学开车的过程作比,认为大脑并非死记硬背动作,而是在与外部世界持续互动中建立关于世界运转规律的内部模型。映射到机器上,通用世界模型需要三项彼此关联的能力:理解世界、预测未来、采取行动。朱军强调,这三者不是割裂能力的简单线性串联,而是耦合在一起的闭环反馈系统。
在数据层面,朱军给出了一个多层金字塔结构:底层是海量网络视频,向上依次为领域视频、第一视角人类视频、带动作记录的人类示范,塔尖是真实机器人交互数据。越往上数据越稀缺、成本越高,但与任务动作和物理结果的联系也越直接。架构上,生数科技采用Mixture-of-Transformers(MoT)方案,不同模态各配专属参数,通过共享注意力打通跨模态交互,使环境理解、状态预测、动作生成能在同一模型中运行。基于该架构的世界动作模型Motubrain,将理解、预测与行动整合进单一模型。
按照生数科技的五级路线图,L1为世界生成,模型学习生成连贯的世界演化过程,视频是典型载体;L2为与世界交互,模型能接收实时输入并产生相应变化;L3为在世界中行动,模型直接输出机器人可执行动作,并通过真实反馈持续修正;L4为自主世界智能体,围绕长期目标主动感知、拆解任务并持续规划;L5为世界组织者,统筹调度机器人、数字智能体、人及工具,完成多智能体任务分配与协作。
生数科技披露的数据显示,Motubrain推理速度较此前版本提升约10倍,更换机器人本体仅需50至100条人类示范数据即可完成适配,在RoboTwin 2.0基准测试中以96.1分位居榜首,并已在银河通用、星尘智能、千寻智能等近十种机器人本体上完成验证。不过,朱军也指出,L1至L3的技术实践距离高阶世界智能仍有差距,视频模型的生成质量、可控性和时空一致性有待提升,世界动作模型在更复杂开放的真实环境中的稳定性、泛化能力和执行效率也需要优化。
对于L4和L5的进阶,朱军列出了六项关键挑战:建立覆盖理解、预测、行动和迁移能力的联合评测体系;学习接触、摩擦、作用力等真实物理规律;形成持久且可修订的记忆;通过真实交互实现在线学习与自我进化;满足现实延迟与资源约束的高效闭环部署;以及安全性与可控性。他表示,当理解、预测与行动真正形成闭环,世界模型将成为连接数字世界与物理世界、迈向通用具身智能的重要基础。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。