港科大谭平在ECCV 2026提出几何与学习融合框架,解决3D视觉大模型全局一致性问

学习模型擅长从大规模数据中获得强大的局部先验,3D 几何则为跨视角、长距离场景提供全局结构约束。

在近日举行的欧洲计算机视觉国际会议(ECCV 2026)上,香港科技大学教授谭平围绕3D视觉与空间智能中的核心问题发表演讲,提出将学习模型的局部先验与3D几何的全局约束相结合的技术框架,以提升大规模3D重建与场景生成的全局一致性。

当前,以Sora为代表的视频和图像扩散模型已展现出强大的视觉生成能力。大规模2D数据使模型学到了丰富的视觉与语义先验,在单帧和局部视频生成上取得显著进展。然而,当任务要求多视角、长距离的3D一致性时,仅依赖数据驱动的局部先验仍面临挑战。谭平指出,现有视觉大模型在某些场景中会出现跨视角结构不一致、物体数量或布局不合理等现象,例如提示词为“卧室”时模型可能生成多张床,虚拟相机长距离漫游时建筑结构可能逐渐扭曲。这些现象表明,模型对全局3D结构的约束仍然不足。

针对前馈网络在3D重建中的计算瓶颈,谭平团队借鉴传统SfM与视觉SLAM的关键帧思想,提出大规模SfM方法。该方法从海量输入图像中均匀采样锚点帧,送入前馈网络获取初始3D结构,并通过“Token采样”策略为每张图像随机保留20%至50%的Token,聚合成全局场景表示,显著降低显存开销,使系统可扩展至更大规模输入。在Tanks and Temples等数据集测试中,约70%的情况下相对旋转和相对平移误差可控制在5度以内。

团队进一步提出Global 3R方案,将前馈网络的鲁棒性与传统全局SfM优化的几何精度结合。该方案通过滑动窗口提取局部信息,利用匹配网络计算相对运动与点云,构建位姿图并依次执行旋转平均、平移平均和集束调整,最终生成全局一致的3D结果。该方案无需指定固定参考帧,可灵活选择任意局部窗口作为参考。

谭平强调,这场演讲的核心并非学习方法与几何方法的二选一,而是二者的互补性。学习模型擅长从大规模数据中获取局部先验,3D几何则为跨视角、长距离场景提供全局结构约束。对于空间计算、世界模型和具身智能而言,“学习先验+几何约束”的结合值得进一步探索。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
OPPO 发布全天候主动式 AI 硬件“心力球”,今年晚些时候到来
上一篇 4小时前
SkyProduction天工工作台联合火山引擎推出中秋国庆促销 首购积分加赠70%
下一篇 4小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部