斯坦福与加州理工发布HomeBody项目,将GPT Astra接入宇树G1实现分层机器人控制

当VLM已经能理解环境、调用技能并处理长任务以后,语言到动作之间那层原本很重的任务策略,还需要保留多少?

斯坦福大学The Movement Lab与加州理工学院近日公开了一项名为HomeBody的研究项目,将GPT Astra接入宇树G1人形机器人,使其能够在陌生厨房环境中自主探索,并根据人类指令完成找东西、拿药、扔垃圾和开抽屉等连续任务。

该项目的核心设计思路并非让大模型直接控制机器人关节。导航、轨迹规划、碰撞检测、视觉伺服和全身控制仍运行在机器人本地,GPT Astra仅负责任务理解、技能选择和失败后的重新决策。系统通过结构化tool call将大模型的语义判断转化为具体技能调用,不同动作对应不同的命令空间:Pick接收图像中归一化到0-1000的二维点并指定执行手,Navigate接收地图坐标系中的二维目标点和朝向点,Place使用机器人躯干坐标系中的三维释放位置,抽屉操作则被封装为包含视觉对准、挂住把手和向后行走的完整技能。

为解决跨房间任务中的空间记忆问题,G1在执行任务前先探索环境,同步保存相机观测、D435i双目数据、LiDAR与SLAM信息、机器人关节姿态以及Astra选择过的航点。系统通过Super Odometry获取G1在现实SLAM地图中的状态,再利用ICP算法将SLAM点云与Isaac Sim中的重建环境配准,使现实地图与数字环境共享同一套空间关系。空间记忆由此被拆分为语义记忆和度量几何两层,前者保存关键帧中的物体信息,后者记录拍摄时的机器人位置。

在抓取操作层面,系统将二维图像点经分割模块和Fast-FoundationStereo深度计算投影为三维几何,通过解析方法生成抓取姿态,并利用minimum-jerk timing约束的spline reference进行运动规划。针对运动过程中的视觉漂移,系统使用SAM 2.1结合SAMURAI的memory selection进行跨帧目标跟踪,通过visual servoing持续修正接近方向,形成小范围视觉误差由servo loop修正、局部失败由Pick技能更换抓取候选或调整站位的分层恢复机制。

在行业普遍探索端到端VLA模型的背景下,HomeBody选择了分层治理的技术路线。该方案将机器人扩展能力的难点从重新训练整条策略转移至接口设计本身,使抓取可由解析方法实现、导航可接传统规划器、新技能可来自强化学习策略,上层VLM无需理解底层具体采用何种控制方法。这一架构为具身智能的工程化落地提供了一种不同于端到端范式的参考路径。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
OpenAI DevDay发布常驻Agent Dot及多项更新,推出月费500美元Pro订阅
上一篇 3小时前
阿里字节腾讯密集调整组织架构,AI办公竞争转向企业上下文争夺
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部