在ECCV 2026主题为“Visual Perception and Reasoning in the Interactable World”的Workshop上,NVIDIA Research科学家、UC Berkeley研究者李柏依(Boyi Li)通过线上连线分享了两项针对具身智能数据瓶颈的研究工作:MultiGen和DexImit。前者利用生成模型为物理仿真视频补上同步音频,后者尝试从人类操作视频中提取双手灵巧操作数据,转化为机器人可学习的训练样本。
机器人进入真实世界需要处理的信息远不止视觉。倒水时,声音可以帮助判断杯子是否快满;物体碰撞时,不同材质会发出不同声音;空间回声也能提供环境信息。然而,这些人类习以为常的多模态感知,以及切苹果、叠杯子等双手灵巧操作,在机器人训练阶段面临高昂的数据采集壁垒。传统物理仿真虽能生成逼真的视觉画面,却无法提供与画面对应的音频数据。
MultiGen的思路是“不只模拟物理过程,还要生成感知”(Don’t just simulate physics – generate perception)。团队收集YouTube等来源的含视频与音频的真实数据,训练了一个基于diffusion model的音频生成模型,使其能够根据视频内容生成时间对齐的声音。随后,团队将物理模拟器生成的视频输入该模型,补上对应音频,构建出Simulated Multimodal Dataset,用于训练同时利用视觉和声音的多模态机器人策略。
实验显示,在不透明容器倒水任务中,仅使用视觉的策略误差较大,加入声音后误差明显下降;在透明容器场景下,视觉信息已较充分,但加入声音后性能仍有提升。研究团队还进行了对比实验:两组机器人分别仅用视觉和同时使用视觉与声音,在倒水过程中关闭灯光。仅用视觉的机器人未能及时停止,导致水溢出,而多模态策略仍能完成任务。李柏依指出,机器人在感知层面非常脆弱,一旦视觉受干扰,系统容易失效,声音可以发挥关键作用,帮助系统变得更加鲁棒。
DexImit则针对另一类数据瓶颈:双手灵巧操作。这类数据对通用机器人至关重要,抓取、倒水、使用工具及长时序操作均依赖双手协同,但真实机器人上的采集成本极高。团队尝试利用人类操作视频,恢复其中手与物体的交互信息,再将这些交互转化为机器人能够学习和执行的双手操作数据。
两项工作背后的思路一致:机器人训练不仅需要更真实的物理模拟,还需要将难以直接获得的感知和交互信息转化为可学习的数据。在具身智能数据采集成本高企的背景下,生成模型与人类视频的再利用,正在成为补充训练数据的重要路径。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。