AI正从看懂画面,走向理解空间、预测变化、执行动作。在近期举行的ECCV 2026上,这一趋势在投稿分布、Workshop主题与论文奖项中均有体现。大会程序主席Anna Rohrbach公布的数据显示,本届ECCV共收到10473篇投稿,最终接收2834篇。按研究主题划分,图像与视频合成以超过1400篇位居第一,视觉、语言与推理第二,3D则从此前的主导方向退居第三。
3D主题排名的后退并不等于3D退潮。过去主要集中在3D视觉和图形学中的三维表示、几何与物理一致性、动态建模、可交互生成与空间推理等基础问题,正在向视频生成、机器人、具身智能、世界模型等方向扩散。93场Workshop中,约10场与3D直接相关,11场涉及空间智能,9场指向物理AI,5场以世界模型为主题。
在具体研究方向上,香港科技大学教授谭平围绕可扩展的3D场景重建与生成展开;斯坦福大学助理教授吴佳俊从二维视觉走向随时间变化的三维点云轨迹;中山大学教授梁小丹强调世界模型需推演接下来可能发生的状态变化;哈佛大学助理教授杜逸伦则从生成式AI和世界模型出发,让模型先想象不同动作带来的未来,再通过搜索完成规划。
论文奖项同样反映这一风向。最佳论文《Heat Kernel Textures — the Geodesic Gaussians That Do Not Splat》由帝国理工学院的Simone Foti、Caner Korkmaz、Stefanos Zafeiriou和Tolga Birdal完成,提出用各向异性热核在曲面测地空间中直接表达纹理,避开传统UV映射的接缝、拉伸等问题。两篇最佳论文荣誉提名分别落在Meta Reality Labs Research的物体三维重建工作与Stony Brook University的偏振光表面法线估计工作上。Koenderink时间检验奖中,一项颁给了斯坦福李飞飞团队的《Perceptual Losses for Real-time Style Transfer and Super-Resolution》。
Poster区的变化同样直观。首个Poster Session中,3D Reconstruction、Gaussian Splatting与Neural Rendering占据相当大篇幅。3DGS已不只用于追求更好的渲染效果,也开始被用于长序列建图、动态重建和更复杂的真实场景。研究对象从静态三维表示转向动态4D时空场景建模。
理解一个会变化的世界,还需解决时空记忆问题。机器人在房间中移动,相机视角不断变化,物体被遮挡后再次出现,模型需要把不同时间、不同视角看到的内容连起来,维持空间关系与自身轨迹的一致性。群核科技联合浙江大学等团队针对现有评测基准多停留在静态图片或预录视频的问题,提出了交互式空间智能相关研究。
从三维表示、几何重建到动态场景建模、状态预测与行动执行,空间智能正在成为串联这些问题的共同主线,也是AI走向物理世界所需的核心能力基座。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。