近日,由清华大学孵化、专注具身智能的创业公司星动纪元(Robot Era)宣布,其研发的具身智能模型在全球权威评测榜单中登顶第一,超越GPT-6及英伟达等机构提交的模型方案。值得关注的是,该模型在训练过程中未借助外挂模块或额外数据,仅依靠自研训练方法实现性能突破。
据星动纪元方面介绍,此次登顶的核心技术路线在于对视频预测与动作学习进行分阶段训练。与当前主流方案将视频生成与动作控制混合训练的思路不同,星动纪元选择将两者解耦,并重新排序训练流程。这一方法使模型在理解物理世界动态规律的同时,更高效地映射到具体动作执行,从而在评测中取得领先表现。
具身智能被视为继大语言模型之后人工智能领域的重要方向,其核心挑战在于让模型理解物理世界的时空关系,并转化为可执行的动作指令。当前行业普遍采用视频预训练加动作微调的技术路径,但视频数据与动作数据在模态和时序上的差异,往往导致模型泛化能力受限。星动纪元的分阶段解耦方案,为这一难题提供了新的解决思路。
星动纪元成立于2023年,由清华大学交叉信息研究院助理教授陈建宇创立,团队核心成员来自清华大学、谷歌、微软等机构。公司主要研发具身智能通用模型及人形机器人产品,此前已获得来自多家头部机构的投资。此次登顶全球榜单,标志着国内具身智能团队在基础模型层面已具备与国际一线团队同台竞争的能力。
从行业影响来看,具身智能的竞争正从硬件本体向基础模型迁移。英伟达、谷歌DeepMind及多家国内创业公司均在推进相关研究,但训练数据依赖和泛化能力仍是共性瓶颈。星动纪元此次验证了不依赖额外数据的分阶段训练路径的可行性,若该方法可复现并扩展至更多任务场景,将降低具身模型对大规模动作标注数据的依赖,对行业训练范式产生参考价值。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。