World Labs发布多模态世界模型Atlas,用3D重建打通仿真到真机链路

Sora交付的是「画面」,Atlas交付的是「世界」,一个机器人可以直接进去「干活」的数字空间。

2026年,世界模型正从学术概念加速走向产业落地。World Labs收购机器人仿真公司SceniX,英伟达Cosmos绑定算力主攻仿真,谷歌Genie系列持续迭代;国内Manifold AI发布自研世界模型WorldScape并登顶多个榜单,摩尔线程开源全栈仿真平台MT Lambda完成Sim2Real真机验证。在各大玩家加速布局的同时,路线分歧也日益明显:这些号称能「理解世界」的模型,究竟是在生成好看的画面,还是在搭建可用的空间?World Labs于九月发布的全球首个多模态世界模型Atlas,提供了一个可供剖析的样本。

Atlas发布后,外界常将其与Sora相提并论,但两者除都涉及「生成」外几乎没有共同点。Sora做的是视频生成:输入一段文字,输出一段视觉上连贯、运动平滑的画面,最终交付物是一个视频文件。Atlas则不同:输入几张照片,模型直接按照照片画面重建出相同的3D场景,照片被锚定在三维空间的具体坐标上,模型据此还原几何结构。其核心关注点是空间坐标是否正确、几何结构是否准确、程序能否直接读取。最终交付的不是画面,而是点云、3D高斯泼溅等可供计算机直接解析的几何数据——这些带坐标的空间点和带形状颜色的椭圆体并非给人看的图片,而是机器能直接读取和计算的「0和1」,程序可直接使用,机器人仿真器也可直接导入运行。简言之,Sora交付的是「画面」,Atlas交付的是「世界」。

从照片到三维空间,Atlas依靠的不是像素拼接,而是一套对空间关系的重新理解。传统视觉输入处理的是二维像素阵列,一张图就是一张图,没有深度、尺度和遮挡关系。Atlas的空间上下文让每一帧图像自带三维坐标,输入从「拍到了什么」变为「从哪拍的、和周围什么关系」。这一变化直接触及世界模型的底层结构。一个世界模型通常分为三个模块:视觉模块负责把摄像头、麦克风等原始信号翻译成模型能理解的内部格式;记忆模块负责学习环境变化规律,根据当前状态推算下一步;控制模块基于这些推算决定具体动作。Atlas将视觉模型和记忆模型两个环节向前推进了一大步。

其关键机制在于对空间上下文的理解方式。大语言模型用文字上下文预测下一个词,将输入文字编码成上下文再生成后续内容。Atlas思路一脉相承,但用的不是文字,而是带三维坐标的照片。每一张输入照片都被固定在三维空间位置上,模型能够识别这张图从哪个方向拍摄、与其他照片是什么关系。以一个房间为例:朝东、朝北、朝西拍五张照片,传统模型看到的是五张独立平面图,而Atlas能分析出它们来自同一房间的不同角度,并拼成一张完整的三维房间地图。这不是拼接画面,而是还原空间。

3D场景构建的核心门槛在于几何结构的还原精度。Atlas仅需最少2张、最多25张普通照片即可输出完整3D场景,并可被仿真器直接导入作为视觉环境基础。官方演示了一个逐步构建过程:初始只给一张办公桌局部特写,Atlas生成室内全景图,办公桌和电脑准确,但椅子和墙面为模型「脑补」;加入第二张房间整体视角照片后,办公桌和椅子正确,但右侧显示器区域仍为空;直到加入第三张侧面双屏工作台照片,整个办公场景才完整对齐。输入越多,需要「脑补」的部分越少。官方透露,Atlas通常只需两到三张图即可实现可用重建,也能处理超过一百张输入图做精细建模。另一案例中,仅靠几张地面拍摄的手机照片,Atlas就生成了斯坦福大学主方庭的连续高空俯瞰飞行画面。过去搭建机器人训练用3D场地需要专业设备环绕拍摄数百张照片并手工建模数天,如今一部手机、一段视频、几分钟即可完成。

在相机可控生成方面,Atlas允许用户输入1到6张参考图并设计相机运动轨迹,模型沿轨迹生成最高1440p、最长1分钟的视频。其本质是让用户不再「猜」下一帧,而是用坐标告诉模型「从哪个角度看」,模型按坐标渲染对应画面。World Labs的第三方盲测显示,Atlas以相机位姿作为原生输入控制运镜,对比模型通过文本提示描述运镜方式,Atlas对MiniMax H3胜率为75%,对阿里HappyHorse 1.1为86%,对字节Seedance 2.5为94%,且胜率随运镜复杂度增加进一步拉大。

时空模拟是Atlas的另一延伸能力。通过三五台普通手机同步录制视频,Atlas可实现时间冻结、多视角回看,即将时间暂停在某一帧并从任意角度回看同一瞬间。过去这种效果往往需要几十台同步摄像机,如今几台手机配合Atlas即可完成。对机器人行业而言更重要的是其仿真价值:World Labs曾用手机拍摄两个大型环境,各取24帧重建3D场景,模拟不同机器人沿不同路径行走,Atlas能实时生成机器人传感器应看到的RGB画面和深度数据。一个真实场景可生成上千种变体,改变路线、挪动障碍物、调整光照均无需重新搭建场地。这意味着数据采集主体从真实机器人变为虚拟机器人,物理世界行走只需一次,其余在数字世界完成,成本从「每次都要跑一趟」变为「跑一趟,用无数次」。同时,Atlas将环境重建与传感器渲染统一在同一模型内,消除了传统两套系统在接缝处的误差累积。

从几何重建到时空模拟,Atlas展示的路径表明,世界模型的竞争焦点正从视觉逼真度转向空间可用性。当模型交付的不再是供人观看的画面,而是机器可直接读取和运行的三维数据,世界模型与机器人仿真、具身智能之间的链路才真正打通。这一转向能否成为行业共识,将决定未来几年世界模型赛道的技术走向与商业落地节奏。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
华为退后一步,赛力斯能否站到台前
上一篇 2小时前
HR SaaS新战事:头部企业竞速IPO,跟随者欲换道超车
下一篇 2023年3月7日 下午10:14

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部