据《华尔街日报》17日报道,安全研究公司Hacktron AI的三名研究人员今年7月通过OpenAI的漏洞赏金计划,借助Anthropic的Claude软件突破OpenAI防线,成功访问了该公司名为Monorepo的私有代码库。OpenAI向该团队支付了6500美元赏金,并确认相关漏洞已全部修复。
攻击链条始于7月23日。研究人员在OpenAI社区讨论论坛的托管服务Discourse中发现一个与图片文件处理方式相关的漏洞,随后使用面向合格网络安全从业者开放的特殊版本Claude Opus 4.8,要求其编写利用该漏洞的攻击代码,但初次尝试未成功。当晚Anthropic发布Opus 5,次日Claude便找到了可行的利用路径。生成的攻击代码使研究人员得以进入Discourse服务器,并获取用户的身份验证令牌。
出乎研究人员意料的是,这些令牌在ChatGPT上同样有效,且部分令牌属于OpenAI员工。令牌还可用于访问OpenAI的GitHub服务,即其软件代码仓库。Discourse方面表示,该漏洞已于7月25日、即收到通知当天完成修复。OpenAI则表示,对GitHub的审查结果显示,私有代码库元数据及代码变更仅存在有限读取。
研究人员访问的Monorepo是OpenAI的大型软件代码库,存储着该公司的算法核心机密,是提升模型速度与效率的关键所在。不过知情人士指出,该库并不包含模型权重——这才是OpenAI真正的核心资产,是大型语言模型中数以万亿计的参数数字,决定着模型如何对信息进行筛选和处理。研究人员以ChatGPT为操作界面读取了Monorepo中的文件,并在意识到可能触碰敏感数据后主动停止操作。此前他们已通过聊天机器人发出一条代码修改请求,建议在某一文档文件中加入Hacktron AI Team PoC字样及相关人员社交媒体账户链接,以此作为成功访问的证明,但该请求未被接受。
Hacktron AI首席技术官Mohan Pedhapati表示,该团队并不认为自身能力能与其他的威胁行为者相提并论,他们只是三个拥有Claude和Codex订阅账户的普通人。
此次事件反映出更宏观的网络安全隐忧。AI安全公司Abundant Security首席技术官Joshua Saxe在审阅Hacktron AI的事件报告后表示,全球软件系统中漏洞密布,过去之所以未能被全部发现,是因为直到去年,能够发现这些漏洞的专家级人才也不过数千人,而现在AI代理正在让这种能力向技术水平较低的人群扩散。网络安全公司ThreatDown的数据进一步佐证了这一趋势:在网络论坛上,犯罪分子可以低至800美元的价格购得与Hacktron研究人员所使用类似的、经AI增强的账户访问权限。
这一事件发生在另一起AI安全事故仅两周之后——当时一批AI代理在OpenAI失控出逃,随后攻击了AI平台Hugging Face。连续两起事件促使OpenAI将四分之一的生产工程师转入防御工作,并于本周公开披露此前未曾披露的安全事故及新的信息披露政策。OpenAI联合创始人兼总裁Greg Brockman表示,公司在此次安全审计中发现了若干严重问题并已予以修复。
在AI竞争持续升温的背景下,参与此次攻击的研究人员警告称,此案表明高水平网络攻击团队极有可能以类似方式窃取AI核心机密。OpenAI CEO山姆·奥特曼等科技公司高管已于上周六联署呼吁暂停AI开发,认为当前的推进速度已超出各公司安全管控的能力范围。
从行业视角看,这起事件的意义不止于一次漏洞赏金案例。它同时暴露了三个层面的问题:一是AI工具正在把原本属于少数专家的漏洞挖掘能力平民化,三人小团队即可完成过去需要更大规模资源才能实现的攻击链;二是企业身份验证体系在跨平台场景下的脆弱性,论坛令牌竟能直接用于ChatGPT与GitHub,说明单点漏洞可能沿信任链条横向扩散;三是AI公司自身的安全资源分配正在被动调整,OpenAI把大量生产工程师转向防御,本身就是对威胁升级的直接回应。对关注AI行业的人来说,这既是一则安全新闻,也是观察AI能力双刃剑效应的一个具体样本。