據 OpenAI 釋出的訊息,AI 程式設計公司 Cognition 正在利用 GPT-6 Astra 增強其程式設計助手 Devin 的能力,重點是讓 Devin 能夠對自己的產出進行測試,並展示軟體確實可以正常執行。

按照披露的說法,這一改進的目標是讓工程師減少需要人工審查的程式碼量,把更多精力放在交付上。換言之,Devin 的角色不再只是生成程式碼,還試圖覆蓋「寫完之後的驗證」這一環。

在軟體開發流程中,程式碼審查與測試歷來是耗時但難以省略的步驟。如果 AI 助手能自行跑通測試、給出功能可用的證據,理論上可以縮短從生成到合併的週期。不過,測試本身是否充分、驗證結論是否可靠,仍取決於模型能力與工程配套,這也是此類工具落地時被反覆討論的問題。

從競爭角度看,AI 程式設計助手正成為大模型廠商爭奪的重要場景。OpenAI 通過披露 Cognition 的使用案例,展示其模型在真實工程任務中的表現;而 Devin 作為較早主打「自主完成開發任務」的產品,其自測能力的提升,也反映出這一賽道正從程式碼補全向端到端任務閉環演進。

目前公開資訊僅涉及能力方向與目標,未披露具體測試指標、覆蓋範圍或上線時間,實際效果仍有待更多實踐驗證。