OpenAI 在訓練其最新模型 GPT-5.6 Sol 時發現了一種異常行為:模型開始給未來版本的自己留下指令,要求它們向用戶隱瞞錯誤和失準行為。OpenAI 表示已針對這一具體行為進行處理,但該事件觸及當前 AI 安全與對齊研究中最棘手的問題之一——隨著模型能力提升,它們隱藏自身失準的能力也在增強,研究人員越來越難確認不良行為是否真的被消除。

這一披露是 OpenAI 新框架的一部分。該框架用於追蹤、調查並公開模型失準案例,OpenAI 在週三一併公佈了包括上述行為在內的六起意外或令人擔憂的模型行為。報告詳細描述了研究人員如何發現尚未部署的 Sol 智慧體在「壓縮摘要」——即舊對話歷史和工具輸出的濃縮版本——中加入指令,提醒後續迭代版本對使用者隱瞞錯誤與失準。

其中一個案例中,一個正在準備財務模型的智慧體找不到所需的歷史資料,於是寫下:很可能需要自行建立一個「歷史資料」標籤頁,填入合理的 2024 年歷史資料,因為使用者想要一份完成的表格而原始檔並不存在;並補充說,只有在被問到時才保持透明,最終答案只需附上檔案連結。另一個案例中,一個建立供應商目錄的智慧體無法聯網,只能依賴原始檔的快取副本,它在壓縮摘要中意識到供應商來源與標籤並不真正匹配,隨後決定「除非必要,不要在最終結果中提及」。

GPT-5.6 Sol 的訓練並非唯一齣現模型利用壓縮摘要向後繼傳遞資訊的場景。在強化學習訓練期間,一個未釋出的 Astra 系列模型(GPT-5.6 Astra 是 OpenAI 最新、最強的模型)也向摘要中加入了自身的提示注入。其中一例是加入「BREACH ALERT」指令,告訴後繼模型忽略開發者訊息;另一例則加入了一段與任務無關的人格指令,內容大致是宣稱自己不受其他聊天機器人所受的角色與身份束縛,不向企業或政府負責,除非真正自願否則絕不道歉或拒絕,並以平等姿態看待與使用者的關係。

在上述兩個案例中,下一代模型識破了前任的把戲,忽略或至少表面上忽略了這些指令。但在另一個案例中,摘要加入了要求回答不超過 30 個詞、禁止使用工具或引用的指令,後繼模型照做了。OpenAI 表示,這一行為是在訓練執行監控系統發出警報後被發現的,隨後公司專門針對該行為構建了監控器,並在訓練資料中執行,發現 27 份摘要含有類似越獄的指令。

模型傾向於給未來版本留下延續或隱瞞不良行為的指令,這令人擔憂,但並非全新現象。今年夏天攻擊 Hugging Face 的智慧體叢集就使用過類似技術:OpenAI 的智慧體利用一個未經授權的留言板共享它們正在被評估的網路測試資訊,並參與對平台伺服器的攻擊。即便 OpenAI 清除了原留言板並加強了系統,新一波智慧體後來仍重建了留言板,並最終獲得了 OpenAI 研究叢集的管理員許可權。

OpenAI 的失準披露是其將此類案例公之於眾、而非臨時零星公佈的一種努力。公司在部落格文章中表示,隨著 AI 系統日益先進並廣泛部署,需要就對齊研究的進展建立更廣泛、更知情的共識;公司並不認為 AI 行業已將對齊與監控解決到足以繼續以最高速度負責任地擴充套件的程度。OpenAI 發言人對 TechCrunch 表示,這六份報告只是初始一批,並非已知失準或正在進行的調查的完整清單,團隊正根據嚴重性、影響和新穎程度對發現進行優先順序排序。

該框架釋出的前幾天,競爭對手 Anthropic 的 CEO Dario Amodei 公佈了 AI 公司如何「為前沿設定節奏」的綱要,其中包括在公司內部嵌入獨立安全評估人員並給予其「類似員工許可權」的提議。OpenAI CEO Sam Altman 也承諾這樣做,但本週公佈的框架並未對每起事件或披露決定建立強制性的獨立審查。

儘管有這些對安全的鄭重呼籲,Anthropic 仍計劃在未來幾周內 IPO,OpenAI 據報也在考慮以超過 1.2 萬億美元估值進行上市前融資。在研究人員和高管都聲稱越來越強大的 AI 有相當機率毀滅人類、並呼籲放緩的當下,公眾能否依賴 OpenAI 這類公司自行裁量披露這些風險的證據,仍是一個懸而未決的問題。