大模型競技場Arena近日悄然上線一款名為gemini-3.8-flash的匿名模型,引發開發者社群廣泛討論。多位上手實測的開發者認為,這極有可能是谷歌DeepMind的下一代旗艦模型Gemini 4 Pro,而非同名舊版Flash。值得注意的是,Gemini 3.8 Flash早在9月初就已釋出,同名模型再次出現並不尋常。
從流傳於網路的基準測試圖來看,該模型在多項任務中表現突出。在AI智慧體編碼任務DeepSWE v1.1上,它拿下88%的分數,比Astra高出近2個百分點;在真實知識工作任務GDPval-AA v2中,它是唯一獲得2064 Elo的模型;終端編碼能力測試Terminal-bench 2.1中得分95.3%;計算機使用能力測試OSWorld-2.0中則斬獲86.8%,均領先於Astra和Fable。若這些分數屬實,Gemini 4 Pro在編碼、智慧體與推理等維度上已實現對競品的全面壓制。
定價方面,該模型每百萬Token輸入價格為2.25美元,輸出價格為11.25美元,在所謂「御三家」中據稱最具價效比。有AI研究員進入後端後發現,該模型支援1000萬輸入上限、25.6萬輸出上限,具備永久跨會話記憶,且無需API即可聯網。
比跑分更受關注的是開發者的實測反饋。開發者Bee表示,該模型在14分鐘內便搭建出一個以素描、鉛筆與石墨質感為主題的創意展示網頁,滾動時線條逐漸加深的互動效果流暢自然。另有測試顯示,它能生成兼具賽博朋克與復古未來主義風格的工作網站,首屏整合了3D網格、資料儀表盤與可互動3D模型。在經典的「鵜鶘騎腳踏車」SVG測試中,其輸出包含配色、日夜切換、車燈、解剖標註與踏頻控制,完成度被認為不輸頂尖模型。開發者Pankaj Kumar總結稱,該模型速度很快,SVG與3D生成明顯進步,一次提示即可較準確理解複雜要求。此外,它還能直接生成帶完整互動邏輯的小遊戲,例如「我的世界」風格頁面與3D卡丁車競速遊戲。
這一系列表現背後,谷歌DeepMind對RSI(遞迴自我改進)的押注值得關注。上個月,Google DeepMind首席戰略官Jasjeet Sekhon在伯克利的一場活動上表示,RSI已成為AI鉅額投資邏輯中的關鍵一環。近期網路流傳更激進的說法稱,Gemini 4之所以提前完成預訓練,正是因為DeepMind在訓練中實現了RSI閉環。14日,谷歌一項名為Dream-RSI的研究公開,研究方向是讓Agent在探索過程中不斷改進自身搜尋策略,從經驗中升級下一輪探索。可以確認的是,DeepMind已公開將RSI置於非常重要的位置,AI參與改進AI的跡象也在增多。
回顧時間線,谷歌上一個大版本更新Gemini 3.1 Pro已是7個月前(2月19日)的事。谷歌I/O大會上,劈柴曾預告Gemini 3.5 Pro將在6月上線,但該釋出一再推遲,最終據WSJ本月初獨家爆料被取消,原因是3.5 Pro的進化程度連Flash都比不上。好在Gemini 4在預訓練中評估優秀,後訓練仍在順利推進。
當前競爭格局已徹底改變。OpenAI有Astra,Anthropic有Fable 5.1,兩大巨頭已將競爭從單純聊天擴充套件到長任務、Agent、程式碼、推理乃至自主科研。谷歌若只做出一個「比Gemini 3.8更強」的模型已不夠,Gemini 4 Pro需要重新證明Gemini仍處於最前沿。對於市值高達4.23萬億美元的谷歌而言,保持AI實力在第一梯隊至關重要。