OpenAI 的 GPT-6 Astra 在一项名为 StationeryBench 的新机器人基准测试中,展现出空间推理能力的显著提升。该测试将 GPT-6 Astra 与 Ai2 的 MolmoAct2 进行对比,两者分别控制同一款双臂 YAM 机器人,在开笔帽、倒出回形针、在两臂间传递尺子等五类桌面物体任务上展开较量,共计 200 次试验。

结果显示,GPT-6 Astra 在 100 项任务中完整完成了 7 项,而 MolmoAct2 一项都未能完成。在任务进度评分上,Astra 的中位分为 46 分(满分 100),MolmoAct2 仅为 12 分。所有结果、视频和代码均已发布在 GitHub 上。

康奈尔大学兼谷歌 DeepMind 的 AI 研究员 Yoav Artzi 将 Astra 的表现称为空间推理的「阶跃式变化」。他指出,在尚未公开发布的 REMAP 基准测试中,GPT-Astra 的准确率已接近人类水平,但他同时提醒,「即便 ASTRA 在其他场景下也达不到人类的表现」。Artzi 推测 OpenAI 可能使用了大量 3D 数据(如 Blender 场景)来训练该模型,这与 Astra 在 3D 任务上的突出进步相吻合。

这一基准测试的意义在于,它首次以可量化的方式展示了大模型在机器人空间操作任务上的能力边界。长期以来,让语言模型驱动物理机器人完成精细操作一直是具身智能领域的核心难题,StationeryBench 的结果表明,至少在某些受控桌面场景下,模型的空间理解能力正在快速逼近实用门槛。

从竞争格局看,OpenAI 与 Ai2 在机器人基础模型方向的路线差异值得关注。OpenAI 此前已公开表示有长期计划打造自有消费级机器人,而 Ai2 的 MolmoAct2 则更偏向开源研究导向。此次基准测试中两者差距悬殊,可能反映出训练数据规模与多模态融合策略上的分野。

不过,7% 的完整任务完成率也说明,当前模型在长程规划、精细力控和错误恢复等方面仍有明显短板。Artzi 的谨慎表态同样提示,基准测试的高分并不等同于通用场景下的可靠表现。对于关注大模型向物理世界延伸的观察者而言,StationeryBench 提供了一个早期但有限的参照窗口。