OpenAI 的 GPT-6 Astra 在一項名為 StationeryBench 的新機器人基準測試中,展現出空間推理能力的顯著提升。該測試將 GPT-6 Astra 與 Ai2 的 MolmoAct2 進行對比,兩者分別控制同一款雙臂 YAM 機器人,在開筆帽、倒出回形針、在兩臂間傳遞尺子等五類桌面物體任務上展開較量,共計 200 次試驗。
結果顯示,GPT-6 Astra 在 100 項任務中完整完成了 7 項,而 MolmoAct2 一項都未能完成。在任務進度評分上,Astra 的中位分為 46 分(滿分 100),MolmoAct2 僅為 12 分。所有結果、影片和程式碼均已釋出在 GitHub 上。
康奈爾大學兼谷歌 DeepMind 的 AI 研究員 Yoav Artzi 將 Astra 的表現稱為空間推理的「階躍式變化」。他指出,在尚未公開發布的 REMAP 基準測試中,GPT-Astra 的準確率已接近人類水平,但他同時提醒,「即便 ASTRA 在其他場景下也達不到人類的表現」。Artzi 推測 OpenAI 可能使用了大量 3D 資料(如 Blender 場景)來訓練該模型,這與 Astra 在 3D 任務上的突出進步相吻合。
這一基準測試的意義在於,它首次以可量化的方式展示了大模型在機器人空間操作任務上的能力邊界。長期以來,讓語言模型驅動物理機器人完成精細操作一直是具身智慧領域的核心難題,StationeryBench 的結果表明,至少在某些受控桌面場景下,模型的空間理解能力正在快速逼近實用門檻。
從競爭格局看,OpenAI 與 Ai2 在機器人基礎模型方向的路線差異值得關注。OpenAI 此前已公開表示有長期計劃打造自有消費級機器人,而 Ai2 的 MolmoAct2 則更偏向開源研究導向。此次基準測試中兩者差距懸殊,可能反映出訓練資料規模與多模態融合策略上的分野。
不過,7% 的完整任務完成率也說明,當前模型在長程規劃、精細力控和錯誤恢復等方面仍有明顯短板。Artzi 的謹慎表態同樣提示,基準測試的高分並不等同於通用場景下的可靠表現。對於關注大模型向物理世界延伸的觀察者而言,StationeryBench 提供了一個早期但有限的參照視窗。