考拉悠然无界世界模型登WorldArena 2.0全球第二,背景一致性与JEPA相似度两项指标位列第

两项第一叠加指向同一个结论——模型不只是画得像,而是学到了物理世界随时间演化的规律。

9月16日,WorldArena 2.0全球终榜正式揭晓。考拉悠然旗下悠然无界世界模型在Track 1视频质量赛道中综合得分位列全球第二,并在Background Consistency(背景一致性)与JEPA Similarity两项核心指标中位列全球第一。本次评测汇集了来自阿里巴巴、中国科学院等科技企业、科研机构及具身智能公司的80个模型,围绕世界模型的视频生成质量、时序一致性与物理演化能力展开统一评估。

WorldArena 2.0的评测体系并非仅考察生成画面的清晰度,而是从视觉质量、运动质量、内容一致性、物理遵循性、3D空间准确性、可控性等6大维度、15项指标进行综合评估。视频质量赛道的核心命题是模型在长时推演中能否保持场景几何、纹理外观、物体与交互状态的物理一致性,即理解物理世界如何随时间演化。

在Background Consistency指标上位列第一,意味着模型能在整段生成过程中稳定维持全局环境与场景布置。长视频生成最常见的失效模式是场景漂移——推演到几十帧后,背景的纹理、光照或物体摆放在无声中发生改变。JEPA Similarity指标则更具含金量:该指标不比对像素,而是在高层表征空间中度量生成结果与真实世界演化过程的距离,考察场景语义、物体状态与动作变化是否被正确保留。两项第一叠加,指向的结论是模型学到了物理世界随时间演化的规律。

考拉悠然的技术路线以“世界模型+智能体+场景复制”为核心架构:底层是悠然无界世界模型,上层是Geek Mind极客心智具身大脑,中间由跨空间、跨任务、跨本体的“三跨”能力打通。在技术实现层面,团队将问题拆解为长时推演中的误差累积与面对未见环境时的分布漂移两个具体挑战,并做了两层针对性架构设计。

其一是结构化4D世界建模,协同建模首帧3D场景几何与运动轨迹,把静态空间结构与动态动作过程建立关联,为后续每一帧生成提供持续的几何与运动约束,抑制物体位置漂移、轨迹发散与误差随时间累积。其二是动态场景记忆,持续保持并更新场景的纹理、外观、布局等关键环境特征,避免长时生成中模型逐渐“忘记”场景自身的样子并向训练分布回缩,从而提升长程一致性与域外泛化能力。

训练策略上,悠然无界采用由粗到精两阶段方案:第一阶段用大规模、多样化数据学习通用场景表征与运动规律,建立基础生成与泛化能力;第二阶段筛选高质量数据精细化微调,强化几何一致性、时序连贯性与运动准确性,完成从广泛学习到精确推演的跃迁。在Track 1赛道上,该模型在场景、运动与交互层面展现出高度一致的未来推演能力,能够应对分布外泛化任务、长程任务以及包含双臂协同与长程操作的复杂综合任务。

基于悠然无界世界模型构建的Geek Mind,已在工业场景实现落地。考拉悠然将通用具身智能体Geek Mind集成于四足机器人平台,面向大型央企制造车间提供巡检解决方案。该方案不依赖产线改造,通过预训练模型与场景自适应机制实现巡检路线的快速配置与任务切换;基于世界模型驱动的感知—推理闭环,系统不仅采集温度、振动、仪表等状态数据,还能对异常现象进行因果分析,输出可追溯的判定依据;四足平台具备跨楼层、跨地形机动能力,覆盖人工难以抵达的高空、狭小与危险区域。

从行业视角看,空间智能领域正迎来三个条件的同步成熟:算力成本下行让边端部署具备可行性,具身硬件供给趋于充足,行业客户从看演示转向看产出。考拉悠然目前持有的是一个架构原创、经国际榜单验证的世界模型底座,一套把技术复用到多本体的“三跨”机制,以及一个把技术变成低门槛产品的平台。其面临的真正考验在于,跨本体泛化的上限能否在更多极端场景中保持稳定,这将决定世界模型从“能推演”走向“能执行、能复制”的速度。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
阶跃星辰发布Step 5 Preview,AA综合智能指数跻身全球开源前三
上一篇 8小时前
阿里云王朝阳:中国不缺电,AI的真正瓶颈在电与算力的协同
下一篇 7小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部