World Labs发布多模态世界模型Atlas,以少量图像实现3D重建并瞄准具身智能训练

依托大模型的先验知识与生成能力,Atlas仅需少量普通手机拍摄的图像即可实现高保真3D重建,将3D内容创作的门槛大幅拉低。

李飞飞创办的World Labs近日发布新一代世界模型Atlas,官方称其为全球首个能同时处理文字、图片、视频和3D的多模态世界模型。该模型的核心突破在于,将相机位姿参数作为原生输入引入模型架构,使镜头轨迹和空间坐标可以直接控制,而非依赖提示词的随机生成。

在World Labs展示的演示中,输入三到五台普通手机从不同角度拍摄的同一场景照片,Atlas能够重建出完整的三维场景,并将镜头移动至拍摄者从未站立过的位置。另一段演示中,模型将牛奶溅起的瞬间冻结,镜头围绕这一时刻旋转,实现了此前需要上百台相机环绕拍摄才能完成的子弹时间效果。在3D重建方面,斯坦福主方庭的航拍重建仅需输入2至25张游客在地面随手拍摄的照片,而传统三维重建方法通常需要围绕场景进行数百次多角度采集。

World Labs将这一机制称为空间上下文。每一张送入模型的图片都会被锁定在三维空间的具体坐标上,相机姿态和深度信息连同图像一起进入模型,使模型处理的不是孤立的照片集合,而是一张带坐标的世界草图。这一路径改变了传统3D重建对密集拍摄的依赖,使海量旧照片和旧影像具备转化为可用3D资产的可能。

Atlas的另一个应用方向是机器人训练。传统AI生成模型主要服务于影视和游戏等创意产业,核心目标是生成看起来逼真的内容。而Atlas通过构建可交互、可推演的世界模拟器,将生成能力拓展至机器人领域,即Real-to-Sim。机器人可以在AI生成的模拟环境中进行大规模试错与策略训练,通过想象预测不同动作的后果,在虚拟世界中积累经验后再迁移到真实世界。这一路径直指机器人真实世界训练数据匮乏、采集成本高昂的核心瓶颈。

李飞飞在发布后的访谈中表示,机器人当前最大的瓶颈是数据,芯片尚排不上号。互联网上现成的文字、图片和视频资源充足,但机器人需要的是从这个角度、用这个力度捏下去会发生什么这类带有物理后果的经验。真实采集的成本极高,World Labs创始团队曾举例,过去重建一个空间,专业采集员需要拍摄数百上千张照片,普通人则可能需要在房间内转悠一两个小时。World Labs今年7月收购了专攻机器人仿真的SceniX,Atlas是这一战略首次以模型形态落地。

不过,Atlas当前的能力主要集中在几何层面。几何回答的是物体在哪、长什么样、换个角度是否保持形状;物理则回答推它一下会怎么动、会不会倒、施加多大力会碎裂。Atlas的演示基本落在几何范畴,碰撞、摩擦、形变等涉及真实物理的交互几乎没有体现。World Labs在今年6月发布的世界模型梳理文章中,将各类产品划分为三档:只会输出画面的渲染器、能输出经得起检验的物理状态的模拟器、直接输出动作的规划器。按此标准,Atlas是从渲染器向模拟器方向迈出了一步,但距离真正理解物理仍有明显差距。

行业评测标准也在发生变化。面向具身智能的评测WorldArena将轨迹准确度和物理遵循度单独列为考核项。今年8月底WorldArena2.0首版榜单中,国内影溯的InSpatio-Curious在77个参评模型中总分第一,其画面质量分比第二名低近9分,但轨迹精度、深度准确度和时空一致性等硬指标将其推至榜首。由UCLA、耶鲁、索尼AI与美国陆军研究实验室联合发布的WorldBench则将物理概念拆解为逐项测试,结论显示所有被测模型在生成可靠物理交互方面均未过关。

Atlas目前未发布论文和model card,对比数据来自官方自测,且同场比较的对手仅能通过文字描述运镜,Atlas则握有精确轨迹输入,在机位控制任务上具备天然优势。其在官方设定的任务中展示了当前最强的机位控制能力,但尚未经过第三方物理评测。

从行业角度看,物理是否正确是仿真数据能否用于机器人训练的前提。从仿真到现实的流程正从实验室话题转变为竞争焦点:先将真实环境快速搬入虚拟世界,再批量进行随机化处理,改变电线弯曲方向、杯子颜色和光照条件,让机器人在虚拟环境中完成大量试错。Atlas代表的路径若能在物理准确性上取得突破,有望成为具身智能的低成本训练基础设施,但这一目标的实现仍需经过严格的第三方评测验证。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
工信部:17家重点车企平均账期有所改善,但实际账期与名义账期仍存差
上一篇 21小时前
大模型Token均价三个月腰斩,厂商竞相推出Flash模型与缓存降价争夺用户
下一篇 21小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部