生成式AI的竞争正在从平面内容快速延伸至三维空间。过去一周内,Anthropic、World Labs、OpenAI相继发布新一代模型,字节跳动亦被曝出正在研发实时空间视频生成模型。四场发布指向同一方向——可实时交互的3D空间,三条技术底色不同的路线在同一点上集结。
9月1日,Anthropic推出新一代旗舰模型Claude Fable 5.1,同日李飞飞创办的World Labs发布新一代原生世界模型Atlas。9月3日,OpenAI发布GPT-6 Astra,其智能体直接操作专业软件生成3D交互场景的能力引发开发者社区广泛关注。9月7日,彭博社援引知情人士消息称,字节跳动正基于Seedance视频模型研发实时空间视频生成模型,创始人张一鸣亲自跨部门协调资源,最快10月推出,目标直指可响应用户动作、声音的实时虚拟环境,覆盖直播、互动短剧、游戏场景,并计划适配Pico VR头显。
三条技术路线正在逐渐清晰:OpenAI与Anthropic同属LLM阵营,字节跳动Seedance代表视频模型路线,World Labs则是原生世界模型派。三者起点各异,路径不同,最终指向同一个产业拐点:内容产业的形态正在转向“可进入、可交互的空间”。
OpenAI与Anthropic两家头部大模型公司选择了相似的技术路径:依靠大语言模型的通用推理、任务规划与工具调用能力切入虚拟内容生产管线,将AI能力嵌入创作者沿用的专业软件体系,产出可编辑、可交互的3D场景。GPT-6 Astra被OpenAI定位为新一代通用智能体模型,能力覆盖计算机操作、编程、网络安全与科学研究,其中包括对Blender、Unreal Engine等三维创作软件的完整操作权限。在官方演示中,Astra能独立完成从概念到交付的全链路:根据文字描述在Blender中完成建筑建模、材质贴图与光影渲染,再自动编写导出脚本,将成品导入Unreal Engine 5生成可自由漫游的交互场景,期间无需人工分步介入。
Astra开放测试后,开发者社区涌现出大量实测案例。有开发者仅凭一张房屋照片即在Blender中还原出完整室内空间,重建结果能以接近游戏的帧率在本地运行;亦有开发者在虚幻引擎中逐街区搭建可自由漫游的城区场景。游戏开发领域反馈集中:有工作室进行对照测试,让Astra从同一灰模基础产出三款可玩原型,人工修复工作量较传统流程减少约一半。这些案例背后依赖Astra的Computer Use能力——不依赖专属API或定制连接器,而是通过多模态视觉识别界面、模拟键鼠操作直接驱动软件,最终产出可编辑的工程文件,可直接接入现有生产流程。
Anthropic则早在半年前布局MCP连接器生态,将Claude接入Blender、Adobe Creative Cloud等九款专业创作软件,通过Python API直接读写场景数据、批量处理素材。与OpenAI通过Computer Use模拟键鼠操作不同,Anthropic的MCP方案直接嵌入工具内核。Fable 5.1发布后,社区内亦出现大量3D游戏、场景建模实测案例。两家公司思路一致:以LLM为核心,将智能体能力嵌进工业软件管线,服务于专业创作者既有流程,最终产出符合工业标准的可交互三维内容。
GPT-6 Astra发布后,开发者社区迅速跑出一套影视级工作流。开发者Higgsfield进行测试:仅给Astra一句总指,在Blender中完成预演,再调用Seedance 2.5生成镜头,最后剪辑成片,全程保持角色与场景一致。Astra先写出完整故事脚本,随后在Blender中搭出日式街巷简化3D白模,规划不同镜头下的站位与走位,完成影视前期预演。预演完成后,Astra敲定每个镜头的机位与运镜轨迹,导出参考帧,将角色形象、场景画面和动作参考一并交给Seedance 2.5渲染成片。这套组合玩法预示了一种行业趋势:如果视频模型只停留在画面渲染环节,未来可能沦为LLM的下游——创意、分镜、流程调度皆由上游大语言模型决定。
这正是字节推动Seedance向上延伸的核心逻辑:不甘心只做视频生成器,而是向空间理解、实时交互的上游走,直接产出可交互的虚拟空间,从“生成内容的工具”变成“承载体验的平台”。彭博社9月7日报道称,字节跳动正在开发实时空间视频生成模型,项目由张一鸣亲自跨部门协调,调集模型研发、云基础设施、Pico硬件与内容业务线资源,算力优先保障,最快于10月推出。该产品瞄准的是能随用户声音、动作实时变化的虚拟环境:用户向前走视角同步推进,转过头四周场景依然连贯。应用场景直接指向直播、互动短剧和游戏,并计划适配Pico系列VR头显。技术路径上,项目以Seedance视频生成能力为基础,将空间渲染计算放在云端完成,再把画面串流到终端设备,借此压低头显硬件门槛。据报道援引的测试数据,模型可按需生成每秒20帧视频,端到端延迟约50毫秒,已接近人类感知阈值,足以支撑流畅沉浸式体验。
这条路线此前已有伏笔。7月底发布的Seedance 2.5已加入Clay Render白模参考能力,支持基于3D白模生成贴合空间结构的画面,配套Blender插件在创作者群体中被广泛使用。此次实时空间模型相当于将Seedance能力向前推进一步,脱离纯渲染工具定位,转向承载体验的平台。与LLM智能体派对比,差异在于一个面向生产端,一个面向消费端。OpenAI、Anthropic做的是替代人工操作软件,产出符合工业标准的工程文件,服务专业创作者的生产流程;字节的空间模型直接产出可观看、可交互的体验,服务直播、短剧、游戏等大众内容场景,离终端用户更近。
三条路线的交汇意味着3D内容生成正从单一技术验证走向产业落地阶段。LLM路线依托通用智能体调度全流程,占据生产链路上游;视频模型路线向空间理解延伸,直指消费端体验;原生世界模型路线则从底层构建可交互空间。随着各路线产品陆续发布,3D空间生成领域的竞争格局将在未来数月内逐步明朗。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。