9月27日,全球规模最大的机器人学术会议之一IROS 2026将在匹兹堡开幕,这是该会议时隔31年重回这座钢铁之城。今年进入正式议程的论文达到1933篇,覆盖强化学习、模仿学习、路径规划、视觉感知、运动控制、灵巧操作、人形机器人、触觉和大模型等几乎所有重要技术路线。
对1933篇论文进行多标签梳理后可以看到,Robot Learning / Embodied AI相关论文约809篇,Navigation / Planning 564篇,Perception / Vision 556篇,Control / Dynamics 546篇,Manipulation 520篇,Humanoid / Legged相关论文约213篇。由于一篇论文可能同时涉及多个方向,这些数字不能简单相加,但反映出学习、感知、规划、控制和操作正在以前所未有的密度交织在一起。
大模型进入机器人领域后,学习方法并未挤压掉原有技术模块,反而越来越深地嵌入传统问题之中。Robot Learning与Manipulation同时出现的论文约276篇,与Perception交叉269篇,与Navigation / Planning交叉225篇,与Control / Dynamics交叉221篇。
这一趋势在规划领域表现明显。石溪大学的Jorge Mendez-Mendez在《A Systematic Study of Large Language Models for Task and Motion Planning with PDDLStream》中,系统测试了大语言模型嵌入传统Task and Motion Planning框架后的表现。研究并未指向大模型可以直接取代规划器,反而显示几何约束、运动可行性和执行逻辑仍需传统规划体系参与。LLM可以理解“把杯子拿到桌子另一边”的含义,但机器人执行时仍需回答机械臂是否碰撞、关节是否可达、路径能否执行等问题,问题因此从“LLM能否替代Planner”转变为两者如何分工。
感知端也出现类似现象。入围IROS 2026 Cognitive Robotics最佳论文候选的GeoVLA,由天津大学、原力灵机和清华大学团队合作完成,针对现有VLA过度依赖二维视觉的问题,显式加入深度和三维几何信息,将3D representation与视觉语言特征共同用于动作生成。
控制端同样如此。来自中佛罗里达大学、印度理工学院坎普尔分校、巴斯大学和马里兰大学帕克分校团队的Training Fast Robot Policies with Slow Foundation Models,让大型模型更多参与训练,再学习一个更轻、更快的机器人策略负责实际执行,以解决Foundation Model推理速度过慢、不适合高频控制环的问题。
触觉研究也呈现相似方向。科罗拉多大学丹佛分校方新民等人与肯尼索州立大学团队合作完成的DexTact,将视觉和触觉同时放入灵巧手抓取问题,研究手接触物体后系统还能感知到什么。
VLA相关研究同样进入新阶段。多标签统计中,VLA、VLM、LLM和Foundation Model相关论文约162篇,占全部论文的8.4%,其中明确涉及VLA的论文约82篇。研究重点已从“模型能不能做”转向效率、三维理解、长时记忆、视角变化、现实环境适应和安全等问题。来自42dot、首尔大学和Samsung Research的Shallow-π进入IROS 2026 Best Paper / Best Student Paper Award候选,其通过知识蒸馏压缩VLA,解决模型过大、推理过慢的问题,以适配真实机器人和边缘设备部署。
从1933篇论文的整体分布来看,机器人研究并未因大模型进入而被重新归并成单一的AI问题。在经历两年的端到端狂奔后,机器人研究正通过三维几何、符号推理和底层控制的中间层复兴,进入一个更复杂的系统阶段。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。