9月16日,WorldArena 2.0 Challenge全球终榜揭晓。视启未来(Visincept)的WorldIncept以72.33分获得Track 1冠军,同济大学空间智能团队的BWM-Turbo以71.49分位列第二,两者相差0.84分。同属JEPA路线的晨昏线科技在Track 2总分排名第二。三条赛道独立排名,按官网公布金额计算,总奖金为7000美元。
WorldArena是由清华大学团队联合多所海内外高校推出的世界模型评测体系。1.0版本已将评测从视频生成延伸至数据生成、策略评估和动作规划等具身任务,但整体仍集中在视觉输入、离线任务和仿真环境,真实机器人执行、在线强化学习闭环、视触觉多模态感知以及真实部署中的噪声与延迟问题缺少系统性评测。
2.0版本沿模态、功能、平台三个方向升级:模态从纯视觉扩展至视触觉,功能从离线任务扩展至在线强化学习,平台从仿真环境延伸至真实机器人。基于这一评测方向,挑战赛设置三条赛道——Track 1评测视频质量,Track 2评测世界模型作为强化学习环境的能力,Track 3评测真实机器人操作。Track 2和Track 3为2.0新增赛道。
Track 1设置70个正式任务,其中50个为白色桌面ID场景,20个为彩色或带纹理桌面的OOD场景,所有模型在同一数据集上接受测试。最终成绩由15项指标共同决定,覆盖画面质量、运动质量、内容一致性、交互准确性、3D几何和指令执行等维度,JEPA表征相似度也被纳入评测。终榜显示,WorldIncept在物理遵循性和3D准确性两项维度排名第一,语义对齐得分90.11,同样位列单项第一。
Track 2要求世界模型作为强化学习环境,策略在其中反复执行动作、获得新状态和奖励并持续更新,训练完成后回到RoboTwin 2.0中测试任务成功率。这要求模型在多轮交互中保持稳定和动作可控,正确反映不同动作带来的状态变化,并为策略提供有效奖励信号。Track 3将评测直接置于真实机器人操作中,设置纯视觉和视触觉两类任务,涵盖擦桌、倒水、叠衣服等视觉驱动操作,以及夹薯片、削黄瓜、插两孔插头等需要接触信息的任务,重点考察模型在真实环境中的泛化鲁棒性和动作偏离后的自恢复能力。
三条赛道的前两名中,学院派与产业派各占一席。从Track 1到Track 3,评测逐步从“能不能预测”推进到“能不能支撑学习”,最终指向“能不能在真实机器人上完成任务”。世界模型赛道的竞争,正在进入学术与工程能力正面对撞的阶段。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。