大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室近日发布人-场景交互重建研究框架HSImul3R。该框架的核心能力在于,从单目人类视频中重建出可仿真的三维人-场景交互过程,使人类视频能够被转化为机器人可用的技能学习数据。研究团队将HSImul3R定位为全球首个可仿真的人-场景交互重建框架。
机器人技能学习长期面临数据获取瓶颈。传统路径依赖真实机器人遥操作采集数据,成本高、效率低,且难以规模化。利用人类视频作为技能来源是一种更具扩展性的替代方案,但人类视频通常为单目拍摄,缺乏深度信息和物理交互标注,难以直接用于机器人仿真训练。HSImul3R试图解决这一环节的断层问题:通过对单目视频进行三维重建,恢复人体运动与场景几何结构,并在此基础上构建可仿真的交互过程,使视频数据能够进入机器人仿真环境用于策略学习。
从技术路径看,该框架涉及人体运动重建、场景几何恢复以及人-场景接触建模等多个环节的协同。单目视频输入意味着对硬件采集条件的要求较低,普通拍摄设备即可作为数据来源,这在一定程度上降低了数据采集的门槛。研究团队与南洋理工大学S-Lab及上海人工智能实验室的合作,覆盖了学术研究与工程化落地的双重需求。S-Lab在计算机视觉与图形学领域有长期积累,上海人工智能实验室在人工智能基础研究方面具备资源,大晓机器人则承担从研究成果向机器人应用转化的角色。
在机器人学习领域,仿真环境中的技能迁移一直是研究热点。英伟达的Isaac Sim、谷歌的MuJoCo等仿真平台为机器人策略训练提供了基础设施,但从真实人类视频到仿真可用数据的转换仍缺乏成熟方案。HSImul3R的发布意味着这一环节出现了新的技术选项。如果该框架能够在重建精度和仿真一致性上达到可用水平,机器人技能数据的来源将从遥操作采集扩展至互联网上已有的大量人类视频,数据规模的天花板将被显著抬高。
从行业影响角度,机器人技能数据的获取方式直接关系到具身智能的进展速度。当前具身智能领域的主流路线中,数据采集成本是制约模型迭代的关键因素之一。特斯拉Optimus、Figure等公司采用遥操作与真实数据采集相结合的方式积累机器人操作数据,而学术界则更多探索从人类视频中提取技能知识的路径。HSImul3R的发布为后一条路径补充了基础设施层面的能力,其后续在真实机器人任务上的验证效果值得关注。
该研究目前处于框架发布阶段,研究团队尚未披露其在具体机器人平台上的迁移实验结果。从人类视频到机器人技能的完整链路涉及重建、仿真、策略学习与真机部署多个环节,HSImul3R解决的是其中重建与仿真衔接的部分。这一环节的效率提升能否传导至下游任务,取决于后续与机器人学习流程的整合程度。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。