據The Information報道,OpenAI內部的AI模型已開始承擔實驗性AI模型的訓練工作,在相當程度上能夠自行編寫在GPU核心上執行或訓練模型所需的程式,並給出針對這些程式的最佳化方案。工程師只需向模型提供一個希望實現的最佳化型別示例,AI就能持續執行數週來落實這些最佳化。報道稱,這種由AI驅動的自動化水平直到最近幾個月才成為可能,員工使用的智慧體之間還會相互協作解決問題,無需人類介入。原本需要數年才能跑完的宏大實驗,如今被壓縮到一週左右。
這一爆料的核心指向一個業內高度敏感的概念——RSI,即遞迴自我改進。其邏輯是:一個AI系統若能參與設計並訓練出更強的下一代AI,下一代又能以更快的速度繼續這一過程,進化速度可能在跨過某個臨界點後急劇抬升。此前業界普遍認為這還很遙遠,但OpenAI此次主動將其擺上檯面。
就在同一天,OpenAI釋出了一份全球安全倡議,罕見地把RSI單列一節,明確寫下“全自主RSI今天並未發生,在能安全做到之前不應推進”,並呼籲各國AI安全研究所網路制定一套全球通用的技術標準。OpenAI在報告中警告,隨著AI系統在開發下一代AI的工作中承擔越來越多工,它們可以日益推動RSI的程序;隨著這一過程更加自動化,AI進步的步伐可能急劇加速。報告同時指出,當前的首要任務是駕馭下一階段的AI進展、構建自動化的AI研究員,並找到讓人類留在自我改進迴圈中的方法。
OpenAI在報告中提到,AI驅動的研究已推動數學領域的重大進步,但另一面是風險:如果不採取適當謹慎措施,RSI可能導致人類失去對AI發展的實際控制,無法對不再理解的研究過程提供監督。報告還點名了Hugging Face事件,澄清其並非RSI的直接後果,但稱其是一個警示,說明缺乏強大護欄和對齊機制時可能出現的後果。
在具體提案上,OpenAI提出兩條主線。其一是構建互補的國家與國際前沿標準網路,建議依託現有機構,如AI標準與創新中心(CAISI),以及澳大利亞、加拿大、英國、法國、日本等國已建立的AI安全研究所網路,制定全球通用技術標準。這套標準並非針對開源模型或初創企業,而是聚焦“前沿AI模型”,要解決的問題包括如何評估一個AI的RSI能力、當AI模型自主進行研發時風險有多大,目標是讓安全評估成為可量化的科學。
其二是通用測量與事件報告協議。OpenAI呼籲建立評估企業內部有多少研發工作由AI自動完成的標準、強制性的人類監督觸發機制,明確規定在什麼樣的自動化研發流程中必須立即觸發人工審查,以及類似航空業或核工業的事故分類與報告門檻,當AI出現“未對齊”苗頭時按統一嚴重程度分級上報。OpenAI還提議美國應領導這一程序,理由是美國的AI產業處於技術最前沿並在關鍵領域佔據全球網路樞紐位置,並強調安全對齊研究的速度必須跑在AI能力提升的前面。
與此同時,The Information還曝出,OpenAI與Anthropic正在敲定一項協議,雙方將互相測試對方的商用模型,並設定嚴格的資料保留防護措施。Anthropic的創始團隊當年正是因AI安全理念分歧而離開OpenAI自立門戶,此次若協議落地,意味著兩家長期在安全議題上立場不同的公司罕見聯手。報道分析認為,隨著AI能力逼近RSI邊緣,任何一家公司單獨評估自身模型安全性都缺乏公信力,引入勢均力敵的競爭對手進行交叉盲測,有助於彌補技術盲區。若該協議最終落地,可能重塑整個AI生態的安全標準。
整體來看,這條訊息包含兩個層面:一是工程層面,AI參與甚至主導AI研發的自動化程度在快速提升;二是治理層面,頭部實驗室開始主動為這一程序設計全球性的評估與報告框架。兩者疊加,使RSI從一個學術概念變成了需要現實應對的議題。