斯坦福大学与加州理工学院的研究团队构建了一套名为 HomeBody 的系统,让一台 宇树 G1 人形机器人能够在完全陌生的厨房环境中自主导航、整理物品,并从抽屉中取出目标物件。相关代码已发布在 GitHub 上。这是又一项测试 GPT-6 Astra 与机器人结合效果的研究。

HomeBody 的核心设计思路,是去掉语言模型与机器人之间通常存在的、经过专门训练的控制层。取而代之的是一个可替换的视觉语言模型——此处即 GPT Astra——直接调用一个可扩展的技能库,技能涵盖抓取、导航、打开抽屉等模块化动作。这意味着语言模型不再只是高层规划者,而是直接向底层技能发出调用指令。

在任务执行流程上,机器人会先对房间进行探索,在 英伟达 Isaac Sim 中建立一个数字孪生,并将物体及其位置记录进空间记忆。这一机制使机器人即便在物品离开视野后,仍能定位到它们。对于“整理厨房”这类长程任务,语言模型会逐步规划每一步动作,并在出现错误时进行自我纠正。

研究同时列出了若干局限。Astra 的延迟问题、手指伺服电机的过热现象,以及较高的算力成本,都是当前系统面临的现实约束。这些限制提示,从实验室演示到稳定可用的家用机器人,仍有工程层面的距离。

从更广的背景看,此前已有基准测试显示 Astra 的空间推理能力有大幅提升,但另一项测试则指出,当 Astra 控制机器人时存在安全问题。与此同时,OpenAI 已宣布计划重返机器人领域,包括面向个人使用的产品。这一动向与 HomeBody 所代表的路线形成对照:一方是让通用大模型直接驱动机器人本体,另一方是重新投入专用机器人硬件的开发。两条路径的竞争,将影响具身智能从研究走向消费级应用的节奏。

对于关注马斯克生态的读者而言,这项研究的价值在于它提供了一个观察窗口:当大模型的空间推理与任务规划能力被直接接入机器人执行层,家务场景的自动化边界正在被重新测试。而延迟、散热与算力成本这些工程瓶颈,恰恰是决定这类系统能否走出实验室的关键变量。