大模型盲测竞技场 Arena 上出现了一个挂着 gemini-3.8-flash 名字的模型,但它的表现与已正式发布的 Gemini 3.8 Flash 明显不在一个层级。多位开发者实测后认为,这个匿名模型的真实身份很可能是谷歌尚未发布的下一代旗舰 Gemini 4 Pro

事情的起点是 9 月 2 日谷歌正式发布 Gemini 3.8 Flash。官方称这是 Gemini 3 系列最新一代 Flash,在软件工程、Agent 任务和复杂多步推理上均有提升,而从 3.7 Flash 到 3.8 Flash 只隔了 三周。正因如此,当 Arena 里又冒出一个同样叫 gemini-3.8-flash 的模型时,开发者很快察觉异常——真正的 3.8 Flash 已经摆在那里,有现成参照物,而这个模型写代码、做 SVG、跑 Agent 的表现又往上跳了一截。

最早引发传播的实测集中在 SVG、网页和 3D 场景。开发者 Harshith 让它用 SVG 画一只侧面的家猫,并与 GPT-6 Astra Max 和正式版 Gemini 3.8 Flash 对比,结果在轮廓、比例和细节完整度上都有肉眼可见的差距。网友 @thtbee_ 从多个角度连续测试:一个 Voxel 风格宝塔跑了 8 分钟,直接生成一整套可交互 3D 场景;一架空客 H145 直升机大约 10 分钟搭出完整 3D 展示页面,不过页面底部 UI 元素被指略显粗糙;一套单色主题网站约 14 分钟完成,整体干净完整,过去 Gemini 常被吐槽的设计品味问题似乎有所改善。另一位网友 @Mr_Salio 直接拿它做游戏,画面流畅度和世界生成完成度都较高。

更关键的一条线索来自开发者 Qwinah。他声称自己成功「幽灵路由」到了 Gemini 4 Pro 的后端,并贴出一张疑似内部终端信息的截图。按其说法,该模型内部标识出现 G4P-ARGONVIA_3.8_FLASH,最大输出 256K,上下文窗口超过 1000 万 token,还带有跨会话永久记忆、无需 API 即可联网、后端自动编译运行脚本,甚至物理机器人控制等能力。若属实,这显然不是一次普通的 Flash 升级。

与此同时,一张 Gemini 4 Pro 的 benchmark 对比表在社区疯传。图中数据显示,它在软件工程测试 DeepSWE v1.1 拿到 88.7%,终端 Agent 测试 Terminal-Bench 2.1 达到 95.3%,专家级知识推理 HLE-Verified 冲到 72.1%,电脑操作 Agent 测试 OSWorld 2.0 达到 86.8%;在衡量真实知识工作的 GDPval-AA v2 上被写成 2064 Elo,突破 2000 大关。若这些数据属实,Gemini 4 Pro 将直接站上前沿模型之巅。

但越是夸张越需谨慎。这张 benchmark 表与 Qwinah 挖出的疑似后端截图并不完全对得上,表中作为对照项的 Astra 得分也不符合官方数据,两份材料均无谷歌、Arena 或相关 benchmark 的官方背书,目前仍只是社区流传的信息。唯一能确认的,是那个名叫 gemini-3.8-flash 的模型及其完全不符合 Gemini 3.8 Flash 的表现。

社区迅速把答案指向 Gemini 4 Pro,还有一个重要原因:谷歌的 Pro 模型已空窗太久。Gemini 3.5 Pro 迟迟没有正式落地,Gemini 4 早已确认进入训练,过去几个月 Flash 一代代往前推,真正代表能力上限的 Pro 线始终没有新型号。于是猜测越来越像样——谷歌可能根本没打算把真正的大升级留给 3.5 Pro,而是直接憋到了 Gemini 4 Pro。

如果说 Gemini 4 Pro 目前还只是社区传言,那么更值得注意的是谷歌正在明显加快 AI 参与模型研发的速度。这次传闻里 RSI 被反复提及。RSI 全称 Recursive Self-Improvement,递归自我改进,简单说就是 AI 开始参与制造更强的 AI,而更强的 AI 又进一步加快下一代模型的研发。一旦这个循环跑起来,被加速的不只是模型能力本身,连模型进化的速度也会开始被模型自己加速。

路透社今年 8 月披露,谷歌联合创始人 Sergey Brin 近几个月一直在推动 Gemini 提速,并把递归自我改进列为重点关注方向之一。虽然谷歌尚未公开宣布已实现这一闭环,但它正把越来越多原本属于研究员的工作交给 Agent,包括评测模型、寻找改进方向、跑实验,再把结果反馈回研发流程。9 月 2 日发布 Gemini 3.8 Flash 时,谷歌官方说明也提到,一套长期运行的 Agent 循环正在「递归地评估和改进底层模型」。Google DeepMind 研究员姚顺宇在 3.8 Flash 发布后,化用阿姆斯特朗登月时的话形容这次更新:这是模型的一小步,RSI 的一大步。谷歌近期还把 RSI 写进了一篇新论文的标题——9 月 14 日,谷歌、GDM 等团队发布 Dream-RSI,专门研究如何让 Agent 通过不断改进探索策略实现递归自我改进,在算法工程、数学优化和 GPU kernel 任务上都显示出更高的探索效率和更低的搜索成本。

RSI 这条路显然不只谷歌在走。美国时间 9 月 17 日,Anthropic 公开了一组内部 AI 研发自动化数据,称外界需要知道前沿实验室里的 AI 研发到底有多少已开始由 AI 自己完成。数据显示,截至今年 8 月,Claude 已能主导 26% 的 Anthropic AI 研发任务,即人类只需给出高层目标并监督,Claude 基本可端到端完成;这一比例在今年 2、3 月还不到 1%。同时,Anthropic 内部超过 90% 的 AI 研发任务至少已进入 AI 协作阶段。国内,智谱创始人兼首席科学家唐杰近期表示,仍远未达到递归自我改进,但最小的循环已经出现:模型优化系统,系统服务模型。在智谱公开的工程实践中,一个由 GLM-5.3 驱动的 Infra Agent 参与了 GLM-5.3-Flash 推理基础设施的设计、调试和优化,系统运行在超过 10 万张国产 AI 芯片组成的集群上,从第一次跑通到承接全部生产流量只用了 两周,把端到端吞吐提升到初始水平的 3.2 倍

就在几天前,Anthropic 的 Dario Amodei 还呼吁前沿 AI 公司携手「减速」,他列出的第一个需要警觉的条件就是 RSI。模型进步本身是好事,但问题在于,如果 AI 开始参与制造下一代 AI,模型进步的速度可能越来越快,而人类理解、评估和控制它的速度未必能同步加快。因此他反复强调,要在能力跨过某些门槛之前,把第三方评测、共同安全标准和减速机制提前建立起来,因为一旦 RSI 真正形成正反馈,模型可能已经越过了刹车的安全距离。

在风险上,几家前沿实验室确实达成了共识。奥特曼公开认同放慢前沿 AI 的发展节奏,并承诺 OpenAI 也会引入拥有类似员工权限的独立评测者;马斯克表示 Dario 是对的;哈萨比斯也称这是正确方向,只是具体怎么做还需继续讨论。但倡议里也提到,单独减速没有意义,如果 AI 研发继续被 AI 加速,未来真正有效的减速或暂停需要先建立一套共同规则,比如引入独立评测者、让前沿实验室共同设定能力门槛和安全措施,必要时协调放慢研发速度。

但到现在,出于各种各样的竞争原因,共同规则并没有被建立。大家已经可以一起说「应该谨慎」,可一到「具体怎么减速、谁先减、其他国家减不减」,共识就迅速消失。实验室之间有最直接的模型竞争,国家之间还有更大的 AI 竞争。任何一家单独放慢,都要承担把领先窗口让给对手的风险;任何一个国家单独限制,都会担心另一边继续加速。

几家前沿实验室因此多少表现得有些言行不一。谷歌这边,有前面提到的疑似已在 Arena 匿名测试的 Gemini 4 Pro;Anthropic 这边,社区近期开始出现 Opus 5.2 的灰度痕迹,有 Claude Code 用户称通过运行状态和请求路由信息看到了新的 claude-opus-5-2 模型标识,怀疑部分请求已被灰度到下一代 Opus;OpenAI 那里,有人称在后台模型列表里看到了 gpt-6-sol 的模型名,也有人表示自己疑似已被灰度到新模型,目前广为流传的消息称 GPT 6 Sol 可能在下周发布,或在美国时间 9 月 29 日的 Dev Day,总之不远了。

三家前沿 AI 实验室的下一轮模型,都已经开始在社区里露出测试痕迹。这轮「减速倡议」到现在最确定的成果,并不是任何一家真的减了速,只是这几家最重要的 AI 公司,已经把风险提前公开讲了一遍。模型并没有因此放缓。