斯坦福大学 The Movement Lab 与加州理工学院公开了一个名为 HomeBody 的研究项目,把 GPT Astra 接入宇树 Unitree G1 人形机器人。机器人先自行探索陌生厨房,记录环境与物体位置,随后根据人的指令完成找东西、拿药、扔垃圾和开抽屉等连续任务。

这套系统的关键不在于给 G1 加一个大模型助手,而在于重新设计了大模型与机器人身体之间的接口。机器人事先并不知道物体具体放在哪里,需要在探索阶段保存相机观测、双目数据、LiDAR 与 SLAM 信息、关节姿态以及大模型选择过的航点,任务开始后再从历史信息中找回目标,决定去哪、找什么、调用哪个技能。

GPT Astra 并不直接控制关节。导航、轨迹规划、碰撞检测、视觉伺服和全身控制依旧运行在机器人本地,大模型只负责任务理解、技能选择和失败后的重新决策。Astra 每次判断后通过结构化 tool call 选择一个技能,并给出该技能真正需要的参数:Pick 接收当前图像中归一化到 0–1000 的二维点并指定左右手,Navigate 接收地图坐标系中的二维目标点和朝向点,Place 使用躯干坐标系中的三维释放位置,抽屉操作则把视觉对准、挂住把手和向后行走封装成一个完整技能。

这一设计刻意不让 VLM 输出机械臂末端的连续轨迹。大模型只在语义空间里表达要操作哪个目标,技能接口再把这个意图逐层转成可执行的几何约束。Astra 不需要理解 G1 的每个自由度,也不需要知道逆运动学求解器如何工作。与端到端 VLA 相比,这里把中间层拆成显式接口后,抓取可由解析方法实现,导航可接传统规划器,新技能也可来自强化学习策略,只要输入输出遵循同一套协议,上层 VLM 并不需要知道底层用了哪种控制方法。

空间记忆是这套系统解决跨房间任务的关键。二维图像点可以告诉 Pick 抓什么,却无法告诉 Navigate 几分钟前看到的药瓶位于房间哪一侧。系统在探索阶段同步保存观测,随后让 Astra 参与 Real2Sim 流程,把数据整理成 Isaac Sim 中的数字环境。SLAM 提供实测几何约束,视觉数据补充语义,关节状态与航点把观测重新绑定到机器人自身视角。运行时先通过 Super Odometry 得到 G1 在现实 SLAM 地图中的状态,再利用 ICP 把 SLAM 点云与 Isaac Sim 重建环境配准,使现实地图与数字环境共享一套空间关系。空间记忆因此被拆成两层:一层保存某张关键帧里出现了什么,另一层保存拍摄这张图时机器人位于哪里。

抓取环节则把问题从米级导航收缩到厘米级操作。Pick 收到二维点后,先提示分割模块把目标从背景中切出,再由 Fast-FoundationStereo 根据双目图像计算深度,利用相机标定关系把像素投影成三维几何,通过解析方法生成抓取姿态。运动规划器生成 spline reference,并以 minimum-jerk timing 约束轨迹,逐点求逆运动学,同时检查整条 swept motion 的碰撞间隙。为应对运动中的视觉漂移,系统使用 SAM 2.1 跟踪目标,结合 SAMURAI 的 memory selection 维持跨帧状态,再通过 visual servoing 持续修正接近方向。

这里出现了明确的分层闭环:小范围视觉误差由 servo loop 修正;机械手闭合却未建立接触时,Pick 可换一个 grasp candidate 或改变站位后重新规划,且尝试次数有明确边界;只有局部恢复无法处理,技能才把失败原因返回 Astra,由大模型决定重新定位、换目标或调整任务顺序。控制频率也被分开:手臂和手部控制命令运行在 250 Hz,AMO 每 5 个控制 tick 更新一次,相当于 50 Hz,而 GPT Astra 的远端推理处在秒级。

抽屉操作把这种分层推到全身控制。机械手挂住把手后,若只让手臂向后移动,很快会遇到工作空间和身体平衡限制,系统会让机器人向后走,同时维持上肢操作目标。所用 AMO 是一套将 Sim2Real 强化学习与轨迹优化结合的全身控制框架,训练目标之一就是让 G1 在面对超出常规分布的上肢目标时,仍能通过下肢和躯干调整扩大可操作空间。

这套系统目前仍有明显的工程边界。Real2Sim 会增加部署准备和 API 成本,Astra 的远端推理会在技能之间产生停顿,本地感知和规划目前需要一台 RTX 4090 笔记本运行,更重的视觉模型会继续推高计算需求。长时间任务还受机械臂工作空间、手部舵机发热和硬件耐久度限制。更大的问题来自技能覆盖范围:Astra 可以重新安排 Pick、Place、Navigate 和 Open Drawer,却不能仅靠语言推理生成一种从未实现过的接触动力学;技能库没有擦桌子,就无法因为一句指令自动获得稳定的擦拭控制。

这些限制反过来也说明了架构方向。HomeBody 没有要求一个 VLA 同时学习空间记忆、任务分解、三维视觉、抓取、碰撞规避和全身动力学,而是把问题拆成各自适合的表示和控制频率,再通过显式接口连接。VLM 面对技能和状态,SLAM 面对几何空间,视觉模型面对像素与深度,运动规划器面对轨迹约束,AMO 面对整具身体的动力学。人形机器人由此呈现出更接近复杂软件系统的结构:高层模型负责离散决策,空间系统维护外部状态,技能提供标准化调用接口,高频控制层承担物理稳定性。