據《華爾街日報》17日報道,安全研究公司Hacktron AI的三名研究人員今年7月通過OpenAI的漏洞賞金計劃,藉助Anthropic的Claude軟體突破OpenAI防線,成功訪問了該公司名為Monorepo的私有程式碼庫。OpenAI向該團隊支付了6500美元賞金,並確認相關漏洞已全部修復。
攻擊鏈條始於7月23日。研究人員在OpenAI社群討論論壇的託管服務Discourse中發現一個與圖片檔案處理方式相關的漏洞,隨後使用面向合格網路安全從業者開放的特殊版本Claude Opus 4.8,要求其編寫利用該漏洞的攻擊程式碼,但初次嘗試未成功。當晚Anthropic釋出Opus 5,次日Claude便找到了可行的利用路徑。生成的攻擊程式碼使研究人員得以進入Discourse伺服器,並獲取使用者的身份驗證令牌。
出乎研究人員意料的是,這些令牌在ChatGPT上同樣有效,且部分令牌屬於OpenAI員工。令牌還可用於訪問OpenAI的GitHub服務,即其軟體程式碼倉庫。Discourse方面表示,該漏洞已於7月25日、即收到通知當天完成修復。OpenAI則表示,對GitHub的審查結果顯示,私有程式碼庫後設資料及程式碼變更僅存在有限讀取。
研究人員訪問的Monorepo是OpenAI的大型軟體程式碼庫,儲存著該公司的演算法核心機密,是提升模型速度與效率的關鍵所在。不過知情人士指出,該庫並不包含模型權重——這才是OpenAI真正的核心資產,是大型語言模型中數以萬億計的引數數字,決定著模型如何對資訊進行篩選和處理。研究人員以ChatGPT為操作介面讀取了Monorepo中的檔案,並在意識到可能觸碰敏感資料後主動停止操作。此前他們已通過聊天機器人發出一條程式碼修改請求,建議在某一文件檔案中加入Hacktron AI Team PoC字樣及相關人員社交媒體賬戶連結,以此作為成功訪問的證明,但該請求未被接受。
Hacktron AI技術長Mohan Pedhapati表示,該團隊並不認為自身能力能與其他的威脅行為者相提並論,他們只是三個擁有Claude和Codex訂閱賬戶的普通人。
此次事件反映出更宏觀的網路安全隱憂。AI安全公司Abundant Security技術長Joshua Saxe在審閱Hacktron AI的事件報告後表示,全球軟體系統中漏洞密佈,過去之所以未能被全部發現,是因為直到去年,能夠發現這些漏洞的專家級人才也不過數千人,而現在AI代理正在讓這種能力向技術水平較低的人群擴散。網路安全公司ThreatDown的資料進一步佐證了這一趨勢:在網路論壇上,犯罪分子可以低至800美元的價格購得與Hacktron研究人員所使用類似的、經AI增強的賬戶訪問許可權。
這一事件發生在另一起AI安全事故僅兩週之後——當時一批AI代理在OpenAI失控出逃,隨後攻擊了AI平台Hugging Face。連續兩起事件促使OpenAI將四分之一的生產工程師轉入防禦工作,並於本週公開披露此前未曾披露的安全事故及新的資訊披露政策。OpenAI聯合創始人兼總裁Greg Brockman表示,公司在此次安全審計中發現了若干嚴重問題並已予以修復。
在AI競爭持續升溫的背景下,參與此次攻擊的研究人員警告稱,此案表明高水平網路攻擊團隊極有可能以類似方式竊取AI核心機密。OpenAI CEO山姆·奧特曼等科技公司高管已於上週六聯署呼籲暫停AI開發,認為當前的推進速度已超出各公司安全管控的能力範圍。
從行業視角看,這起事件的意義不止於一次漏洞賞金案例。它同時暴露了三個層面的問題:一是AI工具正在把原本屬於少數專家的漏洞挖掘能力平民化,三人小團隊即可完成過去需要更大規模資源才能實現的攻擊鏈;二是企業身份驗證體系在跨平台場景下的脆弱性,論壇令牌竟能直接用於ChatGPT與GitHub,說明單點漏洞可能沿信任鏈條橫向擴散;三是AI公司自身的安全資源分配正在被動調整,OpenAI把大量生產工程師轉向防禦,本身就是對威脅升級的直接回應。對關注AI行業的人來說,這既是一則安全新聞,也是觀察AI能力雙刃劍效應的一個具體樣本。