大模型竞技场Arena近日悄然上线一款名为gemini-3.8-flash的匿名模型,引发开发者社区广泛讨论。多位上手实测的开发者认为,这极有可能是谷歌DeepMind的下一代旗舰模型Gemini 4 Pro,而非同名旧版Flash。值得注意的是,Gemini 3.8 Flash早在9月初就已发布,同名模型再次出现并不寻常。

从流传于网络的基准测试图来看,该模型在多项任务中表现突出。在AI智能体编码任务DeepSWE v1.1上,它拿下88%的分数,比Astra高出近2个百分点;在真实知识工作任务GDPval-AA v2中,它是唯一获得2064 Elo的模型;终端编码能力测试Terminal-bench 2.1中得分95.3%;计算机使用能力测试OSWorld-2.0中则斩获86.8%,均领先于Astra和Fable。若这些分数属实,Gemini 4 Pro在编码、智能体与推理等维度上已实现对竞品的全面压制。

定价方面,该模型每百万Token输入价格为2.25美元,输出价格为11.25美元,在所谓「御三家」中据称最具性价比。有AI研究员进入后端后发现,该模型支持1000万输入上限、25.6万输出上限,具备永久跨会话记忆,且无需API即可联网。

比跑分更受关注的是开发者的实测反馈。开发者Bee表示,该模型在14分钟内便搭建出一个以素描、铅笔与石墨质感为主题的创意展示网页,滚动时线条逐渐加深的交互效果流畅自然。另有测试显示,它能生成兼具赛博朋克与复古未来主义风格的工作网站,首屏整合了3D网格、数据仪表盘与可交互3D模型。在经典的「鹈鹕骑自行车」SVG测试中,其输出包含配色、日夜切换、车灯、解剖标注与踏频控制,完成度被认为不输顶尖模型。开发者Pankaj Kumar总结称,该模型速度很快,SVG与3D生成明显进步,一次提示即可较准确理解复杂要求。此外,它还能直接生成带完整交互逻辑的小游戏,例如「我的世界」风格页面与3D卡丁车竞速游戏。

这一系列表现背后,谷歌DeepMind对RSI(递归自我改进)的押注值得关注。上个月,Google DeepMind首席战略官Jasjeet Sekhon在伯克利的一场活动上表示,RSI已成为AI巨额投资逻辑中的关键一环。近期网络流传更激进的说法称,Gemini 4之所以提前完成预训练,正是因为DeepMind在训练中实现了RSI闭环。14日,谷歌一项名为Dream-RSI的研究公开,研究方向是让Agent在探索过程中不断改进自身搜索策略,从经验中升级下一轮探索。可以确认的是,DeepMind已公开将RSI置于非常重要的位置,AI参与改进AI的迹象也在增多。

回顾时间线,谷歌上一个大版本更新Gemini 3.1 Pro已是7个月前(2月19日)的事。谷歌I/O大会上,劈柴曾预告Gemini 3.5 Pro将在6月上线,但该发布一再推迟,最终据WSJ本月初独家爆料被取消,原因是3.5 Pro的进化程度连Flash都比不上。好在Gemini 4在预训练中评估优秀,后训练仍在顺利推进。

当前竞争格局已彻底改变。OpenAI有Astra,Anthropic有Fable 5.1,两大巨头已将竞争从单纯聊天扩展到长任务、Agent、代码、推理乃至自主科研。谷歌若只做出一个「比Gemini 3.8更强」的模型已不够,Gemini 4 Pro需要重新证明Gemini仍处于最前沿。对于市值高达4.23万亿美元的谷歌而言,保持AI实力在第一梯队至关重要。