斯坦福大學與加州理工學院的研究團隊構建了一套名為 HomeBody 的系統,讓一台 宇樹 G1 人形機器人能夠在完全陌生的廚房環境中自主導航、整理物品,並從抽屜中取出目標物件。相關程式碼已釋出在 GitHub 上。這是又一項測試 GPT-6 Astra 與機器人結合效果的研究。

HomeBody 的核心設計思路,是去掉語言模型與機器人之間通常存在的、經過專門訓練的控制層。取而代之的是一個可替換的視覺語言模型——此處即 GPT Astra——直接呼叫一個可擴充套件的技能庫,技能涵蓋抓取、導航、開啟抽屜等模組化動作。這意味著語言模型不再只是高層規劃者,而是直接向底層技能發出呼叫指令。

在任務執行流程上,機器人會先對房間進行探索,在 輝達 Isaac Sim 中建立一個數字孿生,並將物體及其位置記錄進空間記憶。這一機制使機器人即便在物品離開視野後,仍能定位到它們。對於“整理廚房”這類長程任務,語言模型會逐步規劃每一步動作,並在出現錯誤時進行自我糾正。

研究同時列出了若干侷限。Astra 的延遲問題、手指伺服電機的過熱現象,以及較高的算力成本,都是當前系統面臨的現實約束。這些限制提示,從實驗室演示到穩定可用的家用機器人,仍有工程層面的距離。

從更廣的背景看,此前已有基準測試顯示 Astra 的空間推理能力有大幅提升,但另一項測試則指出,當 Astra 控制機器人時存在安全問題。與此同時,OpenAI 已宣佈計劃重返機器人領域,包括面向個人使用的產品。這一動向與 HomeBody 所代表的路線形成對照:一方是讓通用大模型直接驅動機器人本體,另一方是重新投入專用機器人硬體的開發。兩條路徑的競爭,將影響具身智慧從研究走向消費級應用的節奏。

對於關注馬斯克生態的讀者而言,這項研究的價值在於它提供了一個觀察視窗:當大模型的空間推理與任務規劃能力被直接接入機器人執行層,家務場景的自動化邊界正在被重新測試。而延遲、散熱與算力成本這些工程瓶頸,恰恰是決定這類系統能否走出實驗室的關鍵變數。