据 Epoch AI 的家具组装基准测试(Furniture Assembly Benchmark,FAB),OpenAI 的 GPT-6 Astra 现在能够通过照片判断宜家家具是否组装错误,准确率达到 80%,每张照片耗时约 三分钟。这一成绩较 2025 年 11 月时最佳模型的 28% 有大幅提升。
该基准测试的流程是:对三件宜家家具在组装过程中拍照,并故意引入错误;模型将照片与说明书进行比对,找出错误并描述问题所在。在最新一轮测试中,OpenAI 的 GPT-6 Astra 以 80% 的准确率领先,Claude Fable 5.1 以 70% 位居第二,Claude Opus 5 以 61% 排在第三。中国开源权重模型如 Kimi K3 则落后领先者至少 七个月。
Epoch AI 的研究人员指出,目前的速度还不够快,无法用于实时组装指导,但这项技术最终可能帮助进行汽车维修或家电修理。考虑到不久前模型在更简单的视觉任务上还频频失败,整体进展——尤其是 Astra 的表现——值得关注。此外,Astra 在视觉机器人任务上也表现出色。
从更广的视角看,这一基准测试反映了大模型在真实世界视觉推理与多步骤指令遵循方面的能力演进。宜家组装场景要求模型理解空间关系、识别零件方向、比对说明书步骤,并定位具体错误,这比单纯的图像分类或物体识别更复杂。准确率从 28% 跃升至 80% 仅用了约十个月,显示出模型在复杂视觉推理任务上的迭代速度。
不过,三分钟一张照片的处理速度意味着当前技术更适合离线检查或事后复核,而非实时引导。若未来速度提升,类似能力或可迁移至更广泛的维修、装配与操作指导场景。对于关注 AI 落地应用的读者而言,这一进展提供了一个观察模型从“看懂图片”到“理解操作流程”的窗口。