据 OpenAI 发布的消息,AI 编程公司 Cognition 正在利用 GPT-6 Astra 增强其编程助手 Devin 的能力,重点是让 Devin 能够对自己的产出进行测试,并展示软件确实可以正常运行。

按照披露的说法,这一改进的目标是让工程师减少需要人工审查的代码量,把更多精力放在交付上。换言之,Devin 的角色不再只是生成代码,还试图覆盖「写完之后的验证」这一环。

在软件开发流程中,代码审查与测试历来是耗时但难以省略的步骤。如果 AI 助手能自行跑通测试、给出功能可用的证据,理论上可以缩短从生成到合并的周期。不过,测试本身是否充分、验证结论是否可靠,仍取决于模型能力与工程配套,这也是此类工具落地时被反复讨论的问题。

从竞争角度看,AI 编程助手正成为大模型厂商争夺的重要场景。OpenAI 通过披露 Cognition 的使用案例,展示其模型在真实工程任务中的表现;而 Devin 作为较早主打「自主完成开发任务」的产品,其自测能力的提升,也反映出这一赛道正从代码补全向端到端任务闭环演进。

目前公开信息仅涉及能力方向与目标,未披露具体测试指标、覆盖范围或上线时间,实际效果仍有待更多实践验证。