李飞飞创企World Labs发布多模态世界模型Atlas,支持像素级相机控制与3D场景重建

Atlas 通过像素精确的相机控制从一张或多张图像生成图像和视频,输出最长 1 分钟的 1440p 视频。

9月2日,由斯坦福大学计算机科学教授李飞飞联合创立的World Labs公司发布了其首款多模态世界模型Atlas。该公司宣称,该模型能够以像素级精度控制相机,生成图像和视频帧,并将其在三维空间中重建。这一产品被视为世界模型赛道的重要进展,将生成式AI的能力从二维平面拓展至三维空间理解与模拟。

据World Labs官方介绍,Atlas从零开始进行预训练,能够接收包括相机移动在内的多模态输入,并将其转化为3D视图。通过在模型的空间上下文中定位多个输入视图,Atlas允许用户生成具有精确控制的图像和视频帧。与传统的生成模型不同,Atlas并不局限于像素层面的预测,而是试图在理解场景几何结构的基础上进行内容生成,从而实现对输出视角的精准操控。

在技术实现上,Atlas能够从一张到多张输入图像输出明确的3D模型。官方称,其重建能力超越了当前顶级的开源重建模型。用户可以根据指定的任意摄像机位置和角度,生成一个或多个参考图像。生成的视图与输入图像的内容和几何形状相匹配,并且能够平滑地扩展图像,自主想象输入中看不到的场景部分。这一特性使得Atlas在图像外推和场景补全方面具备显著优势。

具体来看,Atlas能够执行涵盖世界生成、重建和模拟的广泛任务。在相机控制生成方面,Atlas通过像素精确的相机控制从一张或多张图像生成图像和视频,输出最长1分钟的1440p视频。这意味着用户可以在保持场景一致性的前提下,自由规划镜头运动路径,为影视预可视化、虚拟制片等应用场景提供了新的工具。

在空间重建任务中,Atlas能够重建从一张到数十张输入图像的真实场景。它既能从新颖视角生成图像帧,也能生成显式三维输出。World Labs表示,在这一任务上,Atlas的表现优于专门用于三维重建的先进模型。对于需要高保真场景数字化的行业,如建筑可视化、文化遗产保护和电子商务,该能力有望降低3D内容制作的门槛。

此外,Atlas还支持时空模拟功能。通过输入视频建模空间和时间,Atlas能够重新构图视频以增强戏剧性视觉效果,并支持机器人的真实到模拟工作流程。这一功能对于机器人领域尤为重要,它允许开发者将真实世界的视觉数据转化为可操作的模拟环境,用于训练和验证自主系统的决策算法。

在图像生成方面,Atlas支持从文本生成图像和360度全景。它能够跟随复杂的提示,渲染文本,并生成各种视觉风格。这一功能使得Atlas不仅限于处理已有视觉输入,还能作为独立的创意生成工具,应用于广告设计、游戏美术和虚拟现实内容生产等领域。

World Labs成立于2024年,由李飞飞与三位联合创始人共同创立。该公司在成立之初便获得了包括英伟达、安德森·霍洛维茨基金等机构的投资,估值迅速攀升。李飞飞此前曾表示,世界模型的目标是让AI具备对物理世界的空间智能,而不仅仅是语言或图像的统计建模。Atlas的发布被视作该公司将这一理念产品化的第一步。

在商业化路径上,World Labs表示,部分合作伙伴已获得Atlas的抢先体验资格,并将在未来几周内开放早期访问。该公司尚未公布具体的定价模式,但考虑到其面向企业级应用的技术定位,业界普遍预期其将采用API调用或订阅制的SaaS模式进行交付。随着早期访问的开放,Atlas在影视制作、游戏开发、机器人仿真等垂直行业的实际表现将受到进一步检验。

从行业视角来看,Atlas的发布标志着生成式AI竞争从文本和图像向三维空间理解延伸。目前,包括OpenAI、谷歌DeepMind在内的多家机构也在推进类似的世界模型研究,但World Labs率先以产品形态公开亮相。多模态世界模型若能在真实场景中稳定运行,将可能重塑3D内容生产、自动驾驶仿真和具身智能训练等领域的开发流程。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
艺卓发布首款ColorEdge系列OLED专业显示器CG3200X,面向创意工作流市场
上一篇 1小时前
谷歌即将发布Gemini 3.8 Flash模型 编程能力对标Anthropic与OpenAI
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部