斯坦福大學 The Movement Lab 與加州理工學院公開了一個名為 HomeBody 的研究專案,把 GPT Astra 接入宇樹 Unitree G1 人形機器人。機器人先自行探索陌生廚房,記錄環境與物體位置,隨後根據人的指令完成找東西、拿藥、扔垃圾和開抽屜等連續任務。

這套系統的關鍵不在於給 G1 加一個大模型助手,而在於重新設計了大模型與機器人身體之間的介面。機器人事先並不知道物體具體放在哪裡,需要在探索階段儲存相機觀測、雙目資料、LiDAR 與 SLAM 資訊、關節姿態以及大模型選擇過的航點,任務開始後再從歷史資訊中找回目標,決定去哪、找什麼、呼叫哪個技能。

GPT Astra 並不直接控制關節。導航、軌跡規劃、碰撞檢測、視覺伺服和全身控制依舊執行在機器人本地,大模型只負責任務理解、技能選擇和失敗後的重新決策。Astra 每次判斷後通過結構化 tool call 選擇一個技能,並給出該技能真正需要的引數:Pick 接收當前影像中歸一化到 0–1000 的二維點並指定左右手,Navigate 接收地圖座標系中的二維目標點和朝向點,Place 使用軀幹座標系中的三維釋放位置,抽屜操作則把視覺對準、掛住把手和向後行走封裝成一個完整技能。

這一設計刻意不讓 VLM 輸出機械臂末端的連續軌跡。大模型只在語義空間裡表達要操作哪個目標,技能介面再把這個意圖逐層轉成可執行的幾何約束。Astra 不需要理解 G1 的每個自由度,也不需要知道逆運動學求解器如何工作。與端到端 VLA 相比,這裡把中間層拆成顯式介面後,抓取可由解析方法實現,導航可接傳統規劃器,新技能也可來自強化學習策略,只要輸入輸出遵循同一套協議,上層 VLM 並不需要知道底層用了哪種控制方法。

空間記憶是這套系統解決跨房間任務的關鍵。二維影像點可以告訴 Pick 抓什麼,卻無法告訴 Navigate 幾分鐘前看到的藥瓶位於房間哪一側。系統在探索階段同步儲存觀測,隨後讓 Astra 參與 Real2Sim 流程,把資料整理成 Isaac Sim 中的數字環境。SLAM 提供實測幾何約束,視覺資料補充語義,關節狀態與航點把觀測重新繫結到機器人自身視角。執行時先通過 Super Odometry 得到 G1 在現實 SLAM 地圖中的狀態,再利用 ICP 把 SLAM 點雲與 Isaac Sim 重建環境配準,使現實地圖與數字環境共享一套空間關係。空間記憶因此被拆成兩層:一層儲存某張關鍵幀裡出現了什麼,另一層儲存拍攝這張圖時機器人位於哪裡。

抓取環節則把問題從米級導航收縮到釐米級操作。Pick 收到二維點後,先提示分割模組把目標從背景中切出,再由 Fast-FoundationStereo 根據雙目影像計算深度,利用相機標定關係把畫素投影成三維幾何,通過解析方法生成抓取姿態。運動規劃器生成 spline reference,並以 minimum-jerk timing 約束軌跡,逐點求逆運動學,同時檢查整條 swept motion 的碰撞間隙。為應對運動中的視覺漂移,系統使用 SAM 2.1 跟蹤目標,結合 SAMURAI 的 memory selection 維持跨幀狀態,再通過 visual servoing 持續修正接近方向。

這裡出現了明確的分層閉環:小範圍視覺誤差由 servo loop 修正;機械手閉合卻未建立接觸時,Pick 可換一個 grasp candidate 或改變站位後重新規劃,且嘗試次數有明確邊界;只有區域性恢復無法處理,技能才把失敗原因返回 Astra,由大模型決定重新定位、換目標或調整任務順序。控制頻率也被分開:手臂和手部控制命令執行在 250 Hz,AMO 每 5 個控制 tick 更新一次,相當於 50 Hz,而 GPT Astra 的遠端推理處在秒級。

抽屜操作把這種分層推到全身控制。機械手掛住把手後,若只讓手臂向後移動,很快會遇到工作空間和身體平衡限制,系統會讓機器人向後走,同時維持上肢操作目標。所用 AMO 是一套將 Sim2Real 強化學習與軌跡最佳化結合的全身控制框架,訓練目標之一就是讓 G1 在面對超出常規分佈的上肢目標時,仍能通過下肢和軀幹調整擴大可操作空間。

這套系統目前仍有明顯的工程邊界。Real2Sim 會增加部署準備和 API 成本,Astra 的遠端推理會在技能之間產生停頓,本地感知和規劃目前需要一台 RTX 4090 筆記本執行,更重的視覺模型會繼續推高計算需求。長時間任務還受機械臂工作空間、手部舵機發熱和硬體耐久度限制。更大的問題來自技能覆蓋範圍:Astra 可以重新安排 Pick、Place、Navigate 和 Open Drawer,卻不能僅靠語言推理生成一種從未實現過的接觸動力學;技能庫沒有擦桌子,就無法因為一句指令自動獲得穩定的擦拭控制。

這些限制反過來也說明了架構方向。HomeBody 沒有要求一個 VLA 同時學習空間記憶、任務分解、三維視覺、抓取、碰撞規避和全身動力學,而是把問題拆成各自適合的表示和控制頻率,再通過顯式介面連線。VLM 面對技能和狀態,SLAM 面對幾何空間,視覺模型面對畫素與深度,運動規劃器面對軌跡約束,AMO 面對整具身體的動力學。人形機器人由此呈現出更接近複雜軟體系統的結構:高層模型負責離散決策,空間系統維護外部狀態,技能提供標準化呼叫介面,高頻控制層承擔物理穩定性。