據 Epoch AI 的傢俱組裝基準測試(Furniture Assembly Benchmark,FAB),OpenAI 的 GPT-6 Astra 現在能夠通過照片判斷宜家傢俱是否組裝錯誤,準確率達到 80%,每張照片耗時約 三分鐘。這一成績較 2025 年 11 月時最佳模型的 28% 有大幅提升。
該基準測試的流程是:對三件宜家傢俱在組裝過程中拍照,並故意引入錯誤;模型將照片與說明書進行比對,找出錯誤並描述問題所在。在最新一輪測試中,OpenAI 的 GPT-6 Astra 以 80% 的準確率領先,Claude Fable 5.1 以 70% 位居第二,Claude Opus 5 以 61% 排在第三。中國開源權重模型如 Kimi K3 則落後領先者至少 七個月。
Epoch AI 的研究人員指出,目前的速度還不夠快,無法用於即時組裝指導,但這項技術最終可能幫助進行汽車維修或家電修理。考慮到不久前模型在更簡單的視覺任務上還頻頻失敗,整體進展——尤其是 Astra 的表現——值得關注。此外,Astra 在視覺機器人任務上也表現出色。
從更廣的視角看,這一基準測試反映了大模型在真實世界視覺推理與多步驟指令遵循方面的能力演進。宜家組裝場景要求模型理解空間關係、識別零件方向、比對說明書步驟,並定位具體錯誤,這比單純的影像分類或物體識別更復雜。準確率從 28% 躍升至 80% 僅用了約十個月,顯示出模型在複雜視覺推理任務上的迭代速度。
不過,三分鐘一張照片的處理速度意味著當前技術更適合離線檢查或事後複核,而非即時引導。若未來速度提升,類似能力或可遷移至更廣泛的維修、裝配與操作指導場景。對於關注 AI 落地應用的讀者而言,這一進展提供了一個觀察模型從“看懂圖片”到“理解操作流程”的視窗。