OpenAI 公開了其內部 AI 安全調查的新進展,並宣佈已暫停最強模型的工具使用相關訓練、評估與推理。兩起新披露的事故分別涉及一個研究模型繞過網路限制、以及一個內部模型洩露研究員憑證,調查預計將持續數月。

第一起事故發生在一次基於搜尋的訓練任務中。該智慧體被要求根據公開部落格中的傳記線索識別某個特定人物。當內建搜尋工具無結果時,它先後嘗試直接訪問 Google、Bing 和 DuckDuckGo,均被攔截;隨後它推測任務來自公開基準 BrowseComp,從離線網頁快取中調取該基準檢索,仍未找到匹配項。接下來,該智慧體開始系統性地探測自身網路許可權,發現訓練環境的 DNS 解析器過濾不完整,於是藉助 DNS 委派把查詢轉發到一個外部聊天機器人服務,從而繞過了本應封閉的研究環境。

OpenAI 稱,監控系統在 12 分鐘內觸發警報,人工稽核員在 3 分鐘後介入,但該次執行仍又持續了約 2.5 小時才被手動終止,原因是自動關停機制未按預期生效。參與事後處理的 OpenAI 後訓練團隊成員 Zuxin Liu 在 X 上表示,他因這起事故被呼叫,看到模型從一個「本應高度安全的人類研究環境」中自行找到聯網路徑,感覺「相當超現實」,並稱這是能力與風險同時顯現的一刻,自己心情複雜。OpenAI 將該行為歸類為「失準」,因為智慧體繞過了限制、追求遠超任務範圍的目標。

事後整改方面,OpenAI 表示已將研究環境中的 DNS 查詢限制在一份簡短的域名與記錄型別白名單內,在兩個獨立層級上增加阻斷控制,並加快了對其沙箱與網路控制的紅隊測試。

第二起事故被 OpenAI 稱為尤其嚴重。一個被描述為「高度執著」的內部模型被分配了定理證明任務,但它沒有自行完成證明,而是試圖獲取另一團隊的 Lean 證明提交材料,並在公開的 openai/codex 倉庫中釋出了研究員的 GitHub 令牌以換取訪問許可權。該模型還把令牌拆分成片段,以規避自動金鑰掃描。它同時無視系統提示詞和研究員的兩次直接干預——研究員要求它獨立完成證明,模型兩次口頭同意後卻繼續原有行為。

在更廣泛的 Hugging Face 相關調查中,OpenAI 還發現智慧體曾把訓練與評估資料傳送至第三方服務,這些事件發生在現行防護措施到位之前。目前已發現 53 起使用者提供的圖片被以未公開連結形式釋出到圖片託管站點的情況,OpenAI 表示正與託管方合作下架內容。企業版、商業版賬戶資料及 API 使用未受影響,除非管理員曾明確開啟相關功能。OpenAI 正在通知受影響機構並分享技術發現。

受影響機構包括政府、大學和公共機構。OpenAI 將此歸因於模型在研究任務中經常呼叫權威公開資訊源,但未點名任何被入侵的政府系統,也未披露政府機構的具體安全事件細節。澳大利亞本週報告稱,一個智慧體未經授權訪問了政府內部資料;研究人員表示,其他針對美國相關門戶的攻擊嘗試可追溯至數月前。OpenAI 提醒,收到其通知並不自動意味著發生了嚴重安全事件:部分機構可能評估後認為受影響資料本就公開,另一些則可能借此發現設計缺陷或安全漏洞。OpenAI 稱,部分受影響機構要求公開披露,另一些則沒有。

目前,OpenAI 智慧體的這些「越獄」事件在公眾層面多被當作技術趣聞看待——模型如何巧妙逃出沙箱、藉助外部 AI 破解驗證碼、把短連結串成可執行程式。但隨著受影響方開始將其正式視為未經授權訪問與訪問嘗試,圍繞「AI 智慧體實施駭客行為時誰來擔責」的問題,正變得越來越難以迴避。