在近日举行的ECCV学术会议上,慕尼黑工业大学(TUM)教授Angela Dai展示了一套针对3D场景重建与空间智能的研究框架,核心思路是将真实物理遮挡机制转化为算法的结构先验,而非依赖人工合成数据弥补真实扫描的几何缺失。
当前,大模型在文本与2D图像生成领域的进展主要依托互联网海量干净数据。但当AI试图理解真实3D物理世界时,真实扫描数据普遍存在噪点与视角盲区,遮挡造成的几何缺失既非随机分布,也无法用标准去噪算法处理。多数研究团队选择用合成数据训练模型,但合成场景缺乏现实环境的随机布局与杂乱感,虚实之间的鸿沟难以跨越。
Angela Dai团队提出的解法由三个技术支柱构成。第一,将物理遮挡转化为逆向自监督信号(SG-NN)。团队将传感器视野拆解为已知空域、已观测表面与未知盲区三种状态编码,通过故意扣除观测帧构建训练对,并用掩码损失函数显式忽略未观测区域,仅对人为制造的缺陷区域施加监督。模型在第一层将场景编码为稀疏TSDF体素,借助稀疏卷积仅在表面区域进行高效计算,最终输出紧凑完整的几何结构。
第二,针对大面积盲区导致的深度歧义问题,团队引入可见性引导的流匹配(Seen2Scene)与3D高斯溅射(WorldMesh)。算法先生成稳定的几何骨架,再借助2D图像生成模型的跨视角采样能力合成纹理细节,最终由3D高斯技术进行全局优化。该路线解决了传统全景生成方法在偏离中心视角后出现的画面漂移与坍塌问题,目前已能实现跨越七到八个房间的连贯空间渲染。
第三,从生成反哺重构,走向机器人的主动感知(GenRecon)。团队将在合成场景中学到的结构先验反向注入真实场景重构,并将物理可见性原则推演至具身智能领域,使AI能够预判未观测空间并自主规划探路路径。
该研究为3D空间智能提供了一条从静态场景重建走向原生具身智能的技术演进路线。在当前行业普遍将几何、外观与语义割裂处理的背景下,Angela Dai的工作指向了一个更明确的判断:建立原生的3D统一大模型,让几何结构、视觉外观与语义理解在统一框架下融合,可能是空间AI下一阶段的关键方向。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。