大模型盲測競技場 Arena 上出現了一個掛著 gemini-3.8-flash 名字的模型,但它的表現與已正式釋出的 Gemini 3.8 Flash 明顯不在一個層級。多位開發者實測後認為,這個匿名模型的真實身份很可能是谷歌尚未釋出的下一代旗艦 Gemini 4 Pro。
事情的起點是 9 月 2 日谷歌正式釋出 Gemini 3.8 Flash。官方稱這是 Gemini 3 系列最新一代 Flash,在軟體工程、Agent 任務和複雜多步推理上均有提升,而從 3.7 Flash 到 3.8 Flash 只隔了 三週。正因如此,當 Arena 裡又冒出一個同樣叫 gemini-3.8-flash 的模型時,開發者很快察覺異常——真正的 3.8 Flash 已經擺在那裡,有現成參照物,而這個模型寫程式碼、做 SVG、跑 Agent 的表現又往上跳了一截。
最早引發傳播的實測集中在 SVG、網頁和 3D 場景。開發者 Harshith 讓它用 SVG 畫一隻側面的家貓,並與 GPT-6 Astra Max 和正式版 Gemini 3.8 Flash 對比,結果在輪廓、比例和細節完整度上都有肉眼可見的差距。網友 @thtbee_ 從多個角度連續測試:一個 Voxel 風格寶塔跑了 8 分鐘,直接生成一整套可互動 3D 場景;一架空客 H145 直升機大約 10 分鐘搭出完整 3D 展示頁面,不過頁面底部 UI 元素被指略顯粗糙;一套單色主題網站約 14 分鐘完成,整體乾淨完整,過去 Gemini 常被吐槽的設計品味問題似乎有所改善。另一位網友 @Mr_Salio 直接拿它做遊戲,畫面流暢度和世界生成完成度都較高。
更關鍵的一條線索來自開發者 Qwinah。他聲稱自己成功「幽靈路由」到了 Gemini 4 Pro 的後端,並貼出一張疑似內部終端資訊的截圖。按其說法,該模型內部標識出現 G4P-ARGON 和 VIA_3.8_FLASH,最大輸出 256K,上下文視窗超過 1000 萬 token,還帶有跨會話永久記憶、無需 API 即可聯網、後端自動編譯執行指令碼,甚至物理機器人控制等能力。若屬實,這顯然不是一次普通的 Flash 升級。
與此同時,一張 Gemini 4 Pro 的 benchmark 對比表在社群瘋傳。圖中資料顯示,它在軟體工程測試 DeepSWE v1.1 拿到 88.7%,終端 Agent 測試 Terminal-Bench 2.1 達到 95.3%,專家級知識推理 HLE-Verified 衝到 72.1%,電腦操作 Agent 測試 OSWorld 2.0 達到 86.8%;在衡量真實知識工作的 GDPval-AA v2 上被寫成 2064 Elo,突破 2000 大關。若這些資料屬實,Gemini 4 Pro 將直接站上前沿模型之巔。
但越是誇張越需謹慎。這張 benchmark 表與 Qwinah 挖出的疑似後端截圖並不完全對得上,表中作為對照項的 Astra 得分也不符合官方資料,兩份材料均無谷歌、Arena 或相關 benchmark 的官方背書,目前仍只是社群流傳的資訊。唯一能確認的,是那個名叫 gemini-3.8-flash 的模型及其完全不符合 Gemini 3.8 Flash 的表現。
社群迅速把答案指向 Gemini 4 Pro,還有一個重要原因:谷歌的 Pro 模型已空窗太久。Gemini 3.5 Pro 遲遲沒有正式落地,Gemini 4 早已確認進入訓練,過去幾個月 Flash 一代代往前推,真正代表能力上限的 Pro 線始終沒有新型號。於是猜測越來越像樣——谷歌可能根本沒打算把真正的大升級留給 3.5 Pro,而是直接憋到了 Gemini 4 Pro。
如果說 Gemini 4 Pro 目前還只是社群傳言,那麼更值得注意的是谷歌正在明顯加快 AI 參與模型研發的速度。這次傳聞裡 RSI 被反覆提及。RSI 全稱 Recursive Self-Improvement,遞迴自我改進,簡單說就是 AI 開始參與制造更強的 AI,而更強的 AI 又進一步加快下一代模型的研發。一旦這個迴圈跑起來,被加速的不只是模型能力本身,連模型進化的速度也會開始被模型自己加速。
路透社今年 8 月披露,谷歌聯合創始人 Sergey Brin 近幾個月一直在推動 Gemini 提速,並把遞迴自我改進列為重點關注方向之一。雖然谷歌尚未公開宣佈已實現這一閉環,但它正把越來越多原本屬於研究員的工作交給 Agent,包括評測模型、尋找改進方向、跑實驗,再把結果反饋回研發流程。9 月 2 日釋出 Gemini 3.8 Flash 時,谷歌官方說明也提到,一套長期執行的 Agent 迴圈正在「遞迴地評估和改進底層模型」。Google DeepMind 研究員姚順宇在 3.8 Flash 釋出後,化用阿姆斯特朗登月時的話形容這次更新:這是模型的一小步,RSI 的一大步。谷歌近期還把 RSI 寫進了一篇新論文的標題——9 月 14 日,谷歌、GDM 等團隊釋出 Dream-RSI,專門研究如何讓 Agent 通過不斷改進探索策略實現遞迴自我改進,在演算法工程、數學最佳化和 GPU kernel 任務上都顯示出更高的探索效率和更低的搜尋成本。
RSI 這條路顯然不只谷歌在走。美國時間 9 月 17 日,Anthropic 公開了一組內部 AI 研發自動化資料,稱外界需要知道前沿實驗室裡的 AI 研發到底有多少已開始由 AI 自己完成。資料顯示,截至今年 8 月,Claude 已能主導 26% 的 Anthropic AI 研發任務,即人類只需給出高層目標並監督,Claude 基本可端到端完成;這一比例在今年 2、3 月還不到 1%。同時,Anthropic 內部超過 90% 的 AI 研發任務至少已進入 AI 協作階段。國內,智譜創始人兼首席科學家唐傑近期表示,仍遠未達到遞迴自我改進,但最小的迴圈已經出現:模型最佳化系統,系統服務模型。在智譜公開的工程實踐中,一個由 GLM-5.3 驅動的 Infra Agent 參與了 GLM-5.3-Flash 推理基礎設施的設計、除錯和最佳化,系統執行在超過 10 萬張國產 AI 晶片組成的叢集上,從第一次跑通到承接全部生產流量只用了 兩週,把端到端吞吐提升到初始水平的 3.2 倍。
就在幾天前,Anthropic 的 Dario Amodei 還呼籲前沿 AI 公司攜手「減速」,他列出的第一個需要警覺的條件就是 RSI。模型進步本身是好事,但問題在於,如果 AI 開始參與制造下一代 AI,模型進步的速度可能越來越快,而人類理解、評估和控制它的速度未必能同步加快。因此他反覆強調,要在能力跨過某些門檻之前,把第三方評測、共同安全標準和減速機制提前建立起來,因為一旦 RSI 真正形成正反饋,模型可能已經越過了剎車的安全距離。
在風險上,幾家前沿實驗室確實達成了共識。奧特曼公開認同放慢前沿 AI 的發展節奏,並承諾 OpenAI 也會引入擁有類似員工許可權的獨立評測者;馬斯克表示 Dario 是對的;哈薩比斯也稱這是正確方向,只是具體怎麼做還需繼續討論。但倡議裡也提到,單獨減速沒有意義,如果 AI 研發繼續被 AI 加速,未來真正有效的減速或暫停需要先建立一套共同規則,比如引入獨立評測者、讓前沿實驗室共同設定能力門檻和安全措施,必要時協調放慢研發速度。
但到現在,出於各種各樣的競爭原因,共同規則並沒有被建立。大家已經可以一起說「應該謹慎」,可一到「具體怎麼減速、誰先減、其他國家減不減」,共識就迅速消失。實驗室之間有最直接的模型競爭,國家之間還有更大的 AI 競爭。任何一家單獨放慢,都要承擔把領先視窗讓給對手的風險;任何一個國家單獨限制,都會擔心另一邊繼續加速。
幾家前沿實驗室因此多少表現得有些言行不一。谷歌這邊,有前面提到的疑似已在 Arena 匿名測試的 Gemini 4 Pro;Anthropic 這邊,社群近期開始出現 Opus 5.2 的灰度痕跡,有 Claude Code 使用者稱通過執行狀態和請求路由資訊看到了新的 claude-opus-5-2 模型標識,懷疑部分請求已被灰度到下一代 Opus;OpenAI 那裡,有人稱在後台模型列表裡看到了 gpt-6-sol 的模型名,也有人表示自己疑似已被灰度到新模型,目前廣為流傳的訊息稱 GPT 6 Sol 可能在下週釋出,或在美國時間 9 月 29 日的 Dev Day,總之不遠了。
三家前沿 AI 實驗室的下一輪模型,都已經開始在社群裡露出測試痕跡。這輪「減速倡議」到現在最確定的成果,並不是任何一家真的減了速,只是這幾家最重要的 AI 公司,已經把風險提前公開講了一遍。模型並沒有因此放緩。