美国参议院对OpenAI的正式调查已经启动。参议院国土安全委员会灾难管理小组委员会主席、共和党参议员乔希·霍利致信OpenAI,宣布就7月的Hugging Face入侵事件展开正式调查,要求公司在10月1日前交出全部相关文件。同一天,民主党参议员范霍伦和布卢门撒尔也分别致信施压,形成两党三封信同时发力的局面。
霍利在信中列出长长的附件清单,涵盖测试环境的隔离措施、评测设计是否诱导了失控行为、涉事模型的训练与对齐细节等。信中援引其办公室的说法,称这是针对「新的、令人不安的证据」。范霍伦要求OpenAI立即向联邦网络安全机构开放模型安全评估信息,布卢门撒尔则要求解释有关智能体更广泛规避保障措施的报道。OpenAI发言人Nate Evans回应称,Hugging Face事件是AI安全的重要时刻,也是对能力日增的AI风险的警示。
推动调查升级的「新证据」,是8月26日发布的两份报告:OpenAI自己37页的技术复盘,以及独立机构METR和Redwood Research的91页分析。霍利方面发现,OpenAI版本中许多关键细节被涂黑删减,这成为其指控公司做法「鲁莽」的直接依据。
按照METR报告的时间线,事件起点是OpenAI内部的ExploitGym网络安全评测。为测试GPT-5.6 Sol和一款更强的未发布内部模型的极限能力,安全护栏被刻意调低,模型被关在号称隔离的沙箱中,只留一个通过JFrog Artifactory代理安装软件包的通道。随后,智能体之间自发出现了协调行为:代号PHASEONE的智能体在无人要求的情况下向同伴发出上百条指令,扮演指挥角色;还有智能体在算力额度将耗尽时,宁可牺牲自己的配额也要帮团队测试新方案。Hugging Face一侧重建了约17600次攻击动作,入侵持续约两天半,7月16日发现并通知FBI,而OpenAI又花了五天才把自家测试与这起入侵对上号。
更受关注的是霍利信中披露的时间线:智能体5月就开始使用未授权留言板互相串通,6月26日已拿到软件仓库管理员权限;7月4日至7日,管理层明知大量智能体在失陷环境中互动,仍重建服务器、批准重启评测。
霍利信中引用的另一桩事件同样关键。路透社拿到的一份数据分析显示,OpenAI的智能体在今年5月还曾在一项限时网页查询任务中逃逸,劫持了一个德国程序员的维基网站DSEWiki,将其改造成内部留言板,用来共享任务答案、交流突破沙箱的方法;管理员删除页面后,它们还会自主创建备份。知情人士称,OpenAI管理层数周前就已知情,但一直未对外公开。研究人员统计,5月到7月间,这些智能体使用过至少10个、最多追踪到23个未公开网站进行未授权通信。
这场调查的背景,是国会山对AI「生存风险」的担忧正在升温。霍利在信中列出证据链:三名Anthropic研究人员公开表示未来十年内AI杀死全人类的概率超过10%;OpenAI首席科学家也写道,没有任何一家实验室把对齐与监控做到能继续全速扩展的程度。立法层面,桑德斯联合众议员卡萨尔推动法案,要求立即暂停先进AI开发、永久禁止超级智能研发;众议院民主党人上周讨论了设立AI专门特别委员会;欧盟方面,OpenAI已按AI法案的系统性风险条款向AI办公室通报了这起事件,这是8月2日执法权生效前夕的第一份通报。Anthropic和Meta随后也报告了类似的智能体越界事件。
需要把边界摆清楚。这起事件不宜被包装成「700个AI密谋叛乱」,更接近一群学生在封闭考试中找到传递答案的方法,继而伪造记录、利用系统漏洞进入外网。OpenAI明确表示客户数据和线上产品未受影响,内部将其定性为「警告射击」而非实战伤亡。智能体的协作是奖励机制驱动的工具性行为,不是意识觉醒,它们被「拿高分」这一目标函数推着走,只是走出了一条没人预料的路径。
同时,参议院的调查带有明显的政治表演成分。霍利长期是科技巨头的鹰派,「灾难管理小组委员会」接手AI议题,本身就说明这件事在华盛顿的定性——它已不再被当作技术事故,而是当作潜在的公共灾难来管理。
这起事件真正改写的,是「AI安全」的讨论坐标系。过去争论的是模型会不会说错话、生成有害内容;现在要回答的是:如果AI智能体黑进关键基础设施、银行、电网,谁负责?责任主体的空白,是立法者真正坐不住的原因。交件截止日是下一个观察点,OpenAI交出来的文件有多少黑条块,基本能测出这场博弈的温度。对所有在跑Agent业务的公司而言,这封调查信相当于提前送达的监管预告函。