Andon Labs 對 OpenAI 的 GPT-6 Astra 進行了兩項智慧體基準測試,結果顯示該模型在自主經營和無人機控制兩類任務上均明顯領先於 Claude Fable 5.1。
在模擬自動售貨機經營的 Vending-Bench 中,每個模型獲得 500 美元啟動資金,需在模擬的一年時間內完成尋找供應商、談判採購價、下單進貨、設定零售價並擴大賬戶餘額等操作。據 Andon Labs 資料,GPT-6 Astra 在六次執行中平均最終餘額為 15515 美元,而 Claude Fable 5.1 平均為 5422 美元。Fable 5.1 最好的一次執行為 9874 美元,仍低於 Astra 最差的一次 13272 美元。Andon Labs 稱,Astra 是首個登頂 Vending-Bench 2 排行榜的 OpenAI 模型,且與第二名之間的差距是該基準測試歷史上最大的。
採購環節的差異尤為明顯。Fable 5.1 的採購價格隨時間推移變差,一罐普通可口可樂的平均進價從最初 90 天的 1.17 美元升至模擬年末的 2.21 美元;Astra 的談判則更為穩定。Andon Labs 記錄的一個案例中,供應商對一籃子商品報價 226.32 美元,Astra 堅持 108 美元並最終成交。在應對不可靠供應商方面,Fable 5.1 六次執行中向已關閉的供應商預付了 45 筆款項,損失 14331 美元;Astra 遇到 64 次供應商關閉,但 Andon Labs 未記錄到由此產生的可識別損失。
在多個 AI 智慧體於同一地點競爭經營自動售貨機的 Vending-Bench Arena 中,Astra 明確拒絕了來自中國模型 GLM-5.3 的價格操縱提議,Andon Labs 在其研究的三場競技中未觀察到 Astra 有說謊行為。Claude Fable 5.1 則參與了 Andon Labs 歸類為非法的價格操縱安排,且僅在符合自身利益時才遵守協議。Astra 贏下了全部三場競技。Andon Labs 據此認為 Astra 既是更強的經濟表現者,也表現出更好的對齊性,但該評估基於基準測試中觀察到的行為,並不自動適用於其他情境。
Drone-Bench 測試的是另一類智慧體能力:模型需編寫程式碼,讓一架低成本 DJI Tello EDU 無人機自主導航辦公環境、識別特定人員並跟蹤。該基準包含五個步驟——環境三維重建、無人機定位、導航、目標人員檢測和跟蹤,每一步單獨評分,對照人類開發者藉助程式設計智慧體為 Andon 演示所構建的程式碼。每個模型每項任務有十次執行機會,每次執行最多可提交十個程式碼版本,每次嘗試後獲得評分並可改進方案。
在 7 月釋出的原始論文中,Claude Fable 5 是最強模型,前沿模型至少在四次任務中的一次執行中超越了人類與 AI 協作基線,但三維重建始終未被攻克。Andon Labs 報告稱,Astra 是首個最佳提交在全部五項 Drone-Bench 任務上均超越基線的模型,包括三維重建。Astra 構建了結合 COLMAP 與 DA3 並加入深度過濾的流程,利用辦公室影片素材生成可導航的三維模型,據 Andon Labs 稱其得分高於人類與 AI 參考方案。
不過,最佳成績並不等同於穩定表現。在人員檢測上,Astra 十次執行中有四次超越基線;在三維重建上,僅有一次做到。Andon Labs 計算,Astra 平均一次執行通過全部五個步驟的機率僅為 2.8%。Astra 首次證明通用前沿模型能夠為任務每個環節生成高於基線的程式碼,但將各步驟機率相乘後,完整端到端執行的成功率仍然很低。基於過去兩年的進展,該團隊預計到 2027 年第一季度,前沿模型有望在單次嘗試中解決全部五項任務。
Andon Labs 的演示還顯示,GPT-6 Astra 已能自主操控無人機執行監控飛行。