原力灵机DM0.5在RoboColiseum四榜登顶,仿真真机一致性达89.5%

四榜同时第一比单项第一难得多,因为这四个维度考的是不同层次的能力,彼此之间并不互相加持。

在具身智能领域,一个模型同时占据四个能力子榜单的榜首并不常见。由智元机器人发起,联合高校、科研机构、开源社区及机器人企业共同建设的评测平台RoboColiseum,将评测拆分为指令跟随、空间理解、扰动适应、通用操作四个维度。原力灵机的通用具身基础模型DM0.5在四个子榜上全部排名第一,目前是唯一做到这一点的模型。

具身评测行业长期面临多重挑战。首先是仿真跑分与真机落地之间的差距,仿真环境中的物理参数和视觉渲染与真实世界差异显著,多数评测基准并未进行系统的真机-仿真对比实验。RoboColiseum通过空间智能技术在仿真环境中高保真重建真实世界,配合激光雷达还原几何信息,并对物体质量、重心、碰撞几何、摩擦力、转动惯量及机器人本体参数逐项校准。验证结果显示,仿真与真机的模型表现一致性达到89.5%,单个任务成功率差异均小于10%。

其次是评测基准生命周期短的问题。具身模型迭代速度快,头部模型往往在半年内就能将榜单分数堆满。RoboColiseum现有78个评测任务、超过3000个泛化case,训练集与评测集完全隔离,评测集对每个任务做了充分的泛化配置,使轨迹回放类方案失效。此外,单点能力强并不代表真实场景好用,真实任务几乎都是多能力复合题,RoboColiseum围绕四个维度展开评测,构成从语义到物理、从感知到执行的完整考察链条。

DM0.5在四个子榜单上的成绩分别为:指令跟随0.8444、空间理解0.6146、扰动适应0.7344、通用操作0.6370,全部排名第一。四个维度考察不同层次的能力,彼此之间并不互相加持,任何短板都会直接体现在对应排名上。

在技术层面,DM0.5在预训练阶段设计了具身思维链,动作生成前需完成目标定位、历史状态判断、终止条件评估等内部推理流程,11项推理任务覆盖任务规划与动作生成两个层面。空间理解方面,预训练数据包含10万小时Egocentric视频,支持毫米级精度的3D空间标注生成。原力灵机与天津大学、清华大学合作的论文《GeoVLA: Empowering 3D Representations in Vision-Language-Action Models》入选IROS 2026认知机器人最佳论文奖提名,核心工作是将三维几何表征显式引入VLA模型的决策过程。

扰动适应方面,DM0.5通过工程优化将核心延迟从534毫秒压缩至57.49毫秒,加速9.29倍,同时在2000个LIBERO测试episode上成功率几乎无损。模型还具备原生60秒记忆能力,任务中断后可续接执行。通用操作方面,在物流分拣场景中,DM0.5不依赖预设脚本,纯靠实时视觉识别和决策,平均3秒一件,准确率超99%;在亚毫米积木拼装场景中,出现接错时可自主感知失败并在半秒内调整姿态重新抓取纠错。

值得注意的是,DM0.5在RoboColiseum上的成绩并非针对评测任务做专项优化,而是通过常规监督微调将预训练底座能力迁移到评测平台的机器人构型和任务上。这一路径使成绩更接近对底座模型真实能力的测量,而非对评测优化技巧的测量。在具身领域,针对特定任务的定向优化容易导致泛化能力下降,DM0.5仅靠SFT即可登顶,表明其预训练底座在指令理解、空间感知、历史记忆和动作生成上已形成较为坚实的通用能力基础。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
阿尔伯塔大学提出FAME框架,为持续强化学习建立可求解的遗忘最小化目标
上一篇 4小时前
百家号App更名为百度直播伴侣,图文创作迁入百度App创作中心
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部