影眸Hyper3D发布世界生成模型WorldGen,3D生成从物体级迈入场景级

场景级生成带来的更大变化,并不只是让不同生成模型和生产工具多了一层连接,而是让3D场景成为整个内容生产流程的共同底座。

9月1日,影眸Hyper3D正式发布世界生成模型WorldGen。用户上传一张场景图片,系统可在两三分钟内生成一个由多个独立物体组成的3D场景。该模型将3D生成的基本单位从「物体」推进到「场景」,并已在影视制作、空间展示与机器人仿真等领域进入真实生产流程。

此前,图生3D技术虽能将一张照片转为完整3D模型,但桌椅、电脑、水杯等物体往往与背景整体「黏」合,结果更接近只能观看的立体布景,无法单独编辑或替换。WorldGen改变了这一模式:系统分别生成画面中的主要物体,再将其放回对应位置。桌子、椅子、水杯各自独立,可单独提取、编辑或替换,并具备质量、摩擦系数等基础物理属性,能够在真实物理引擎中被推动、拿起和交互。

这项能力源自影眸Hyper3D在2025年发表的场景级生成研究CAST。CAST获得国际图形学顶会SIGGRAPH 2025最佳论文,同期获此荣誉的商业公司全球仅有谷歌、Meta和影眸Hyper3D。此后团队用一年多时间推进后续模型、算法与工程系统演进,将论文中的场景生成能力产品化。

WorldGen的技术难点在于让模型理解物体之间的物理关系。一张图片中桌上放着一瓶水,人可以凭常识判断是桌子支撑水瓶,但图片本身不会告诉模型水瓶的质量、摩擦系数、重心和碰撞体。遇到遮挡、透视畸变和信息缺失,模型还需补全看不见的几何结构。WorldGen在后台建立物体关系图,识别接触、支撑、悬挂等关系,预测物体在同一空间中的位置、尺度和朝向,并进行基础物理校正,减少穿模、悬浮和不合理堆叠。开启SimReady后,系统还会估计质量、摩擦系数、恢复系数和碰撞体等属性。团队表示,这些物理属性更接近人看到物品时的直觉判断,属于「猜测的估计值」,暂不能作为精密工业测量结果,但已足以支撑基础物理仿真需求。

在技术路线上,WorldGen采用Mesh与3D Gaussian Splatting的混合表达。需要移动、编辑和交互的主要物体用Mesh生成,具备实体结构,可附加物理属性,也更容易进入主流3D管线;天空、远景和不需要交互的背景则由3D Gaussian Splatting补全,保留更多环境信息和沉浸感。生成效率方面,基于Hyper3D Rodin Gen-2.5的thinking effort架构,模型最快4秒生成一个资产,用户也可根据需求花40秒或80秒补充更多表面细节,先以低时延模式查看整体结构,再挑出关键物体继续Refine。现阶段WorldGen主要擅长生成刚体,关节化资产、柔性体和动态交互将是后续路线图上的方向。

生成后的资产可直接进入Blender、Unity、PlayCanvas、团结引擎、Unreal Engine等DCC与实时引擎环境,衔接既有工作流。目前已有创作者将WorldGen与Seedance 2.5等视频模型结合,用于商业宣传片等影视制作,以及空间展示与XR内容创作。影眸Hyper3D同时与地瓜机器人、谋先飞合作,探索WorldGen在机器人仿真领域的应用。

影眸Hyper3D创始人兼CEO吴迪、联合创始人兼CTO张启煊表示,场景级生成带来的更大变化,并不只是让不同生成模型和生产工具多了一层连接,而是让3D场景成为整个内容生产流程的共同底座。在影视制作中,视频模型已能生成高质量单个镜头,但多镜头叙事的一致性仍是难题——镜头切换后飞船结构可能变化,道具可能移位。若在3D场景中操作,把画面左侧盘子里的苹果移到右侧只是一次简单移动。WorldGen提供的工作流是先建立空间结构稳定、资产彼此独立的3D场景,创作者在其中调整镜头、构图、角色和道具,确定空间关系后再交给视频生成模型补充人物表现、材质、光影和整体风格。3D负责保存世界状态和提供控制,视频模型负责最终视觉表现。

从行业视角看,WorldGen的发布标志着3D生成赛道正从单物体资产生成向场景级、可交互、可进入生产管线的方向演进。当场景中的物体可拆开、修改并进入后续工具,3D生成的价值将不再局限于节省建模时间,而可能成为连接视频生成、游戏开发、XR内容与机器人仿真的空间数据底座。这一路径能否在精度、效率与工作流兼容性上持续验证,将决定场景级3D生成从演示走向规模化生产的速度。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
DHH 推出 Agent 原生 Linux 系统 Omarchy,Quattro 版本新功能代码全部由 Agent 编
上一篇 55分钟前
Lovart国内中文版正式上线,设计类Agent竞争转向完整交付能力
下一篇 51分钟前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部