一則未經證實的爆料正在AI圈快速擴散:谷歌DeepMind可能已經實現RSI(遞迴自我改進,Recursive Self-Improvement)。據傳,谷歌生成式語言API的返回結果中出現了一個名為「rsi-model-liverl-le」的模型,顯示名稱為「RSI Model LiveRL LE」,輸入上限1048576個token、輸出上限65536個token。爆料者還稱,同一批標籤下掛著從00到09編號的10個專屬訓練槽位。谷歌當晚緊急收回了一批相關API金鑰,此後谷歌與DeepMind均未公開回應。
這起風波始於9月11日晚。爆料賬號lyra向Google DeepMind發帖祝賀,三個刻意大寫的字母拼出RSI。隨後另一賬號Lentils放出API返回的JSON截圖,並稱若內部真有這樣命名的模型與10個訓練槽位,情況將非常瘋狂。X上普遍猜測LiveRL指「線上強化學習」,即模型一邊執行一邊自我進化。lyra還公開@Google AI Studio負責人Logan Kilpatrick,稱這批金鑰來自GDM內部員工、可訪問超過1000個內部checkpoint。不過截圖真偽尚未獲第三方驗證,1048576與65536這兩個數字與Gemini現有系列規格一致,不排除內部測試名或惡作劇的可能。
傳言之所以迅速發酵,是因為它與谷歌近期的公開動向高度吻合。據Business Insider報道,谷歌聯合創始人Sergey Brin對Gemini進展速度不滿,力促員工聚焦遞迴自我改進;路透社此前也報道過Brin希望谷歌追趕前沿並將資源推向RSI。報道稱Brin迴歸後的辦公地點是總部Gradient Canopy大樓一間改造過的微廚房,與DeepMind負責人Kavukcuoglu相鄰而坐,劈柴哥每週會來幾次。他直接插手晶片分配,為Gemini團隊開闢算力特權通道,並推行監控部分員工編碼過程、用真實資料訓練Gemini程式碼能力的計劃。一名前員工形容他深度押注RSI、徹底被「AGI洗腦」。
背景是谷歌在前沿競賽中的壓力。Gemini 3曾短暫登頂,隨後被Anthropic和OpenAI反超,新一代旗艦模型因編碼能力不達標推遲兩個月;核心人才接連流失,包括Jeff Dean離職創業,Oriol Vinyals、John Jumper出走,Hassabis於8月5日卸任DeepMind負責人。Brin的賭注是切斷原有賽道,讓模型自己評估、修改自己,把按季度計算的迭代週期壓縮到按周計算。
更耐人尋味的是谷歌自己的部落格。9月2日釋出的Gemini 3.8 Flash與3.8 Flash Cyber中寫道,這些模型的進展「進一步被長時間執行的智慧體迴圈所加速,這些迴圈被設計用來遞迴地評估和精煉底層模型」。DeepMind的姚順宇評價稱,對模型是一小步,對RSI是巨大飛躍;研究RSI智慧體的Sicong Jiang稱這是RSI飛輪開始產生複利效應。3.8 Flash在HLE-Verified上取得54.9%,Cyber版在真實漏洞挖掘成功率突破70%。六週內釋出三個Flash版本、3.7 Flash釋出不到三週,這種節奏被支持者視為RSI已在執行的旁證。
RSI概念在AI圈流傳二十多年,核心是讓AI修改自身訓練程式碼與方法,訓出更強下一代。DeepMind今年6月《從AGI到ASI》將其列為通向超級智慧的四條必經之路之一。今年OpenAI表示GPT-5.6 Sol已能協助後訓練更小的模型;Anthropic發表《當AI構建自身》部落格;Anthropic CEO Dario Amodei公開宣佈RSI已在全行業發生、包括Anthropic內部,並建議放緩前沿AI研發速度。與這些表態相比,谷歌流出的訊號更直接:帶RSI命名的模型標籤與訓練槽位。
接下來值得觀察的是一個簡單時間點:若三週後3.9 Flash準時出現,部落格中「遞迴地評估和精煉底層模型」就不再只是修辭。AI競賽的衡量標準可能從「誰的模型最強」轉向「誰的迴圈轉得最快」,模型強弱變成中間量。人類研究員在迴圈中的位置也在後退,從寫程式碼到跑實驗,最後可能只剩看結果、按確認。若截圖屬實,AI研發史上第一個由模型自己訓出來的模型,或許已在谷歌機房中執行。