一则未经证实的爆料正在AI圈快速扩散:谷歌DeepMind可能已经实现RSI(递归自我改进,Recursive Self-Improvement)。据传,谷歌生成式语言API的返回结果中出现了一个名为「rsi-model-liverl-le」的模型,显示名称为「RSI Model LiveRL LE」,输入上限1048576个token、输出上限65536个token。爆料者还称,同一批标签下挂着从00到09编号的10个专属训练槽位。谷歌当晚紧急收回了一批相关API密钥,此后谷歌与DeepMind均未公开回应。
这起风波始于9月11日晚。爆料账号lyra向Google DeepMind发帖祝贺,三个刻意大写的字母拼出RSI。随后另一账号Lentils放出API返回的JSON截图,并称若内部真有这样命名的模型与10个训练槽位,情况将非常疯狂。X上普遍猜测LiveRL指「在线强化学习」,即模型一边运行一边自我进化。lyra还公开@Google AI Studio负责人Logan Kilpatrick,称这批密钥来自GDM内部员工、可访问超过1000个内部checkpoint。不过截图真伪尚未获第三方验证,1048576与65536这两个数字与Gemini现有系列规格一致,不排除内部测试名或恶作剧的可能。
传言之所以迅速发酵,是因为它与谷歌近期的公开动向高度吻合。据Business Insider报道,谷歌联合创始人Sergey Brin对Gemini进展速度不满,力促员工聚焦递归自我改进;路透社此前也报道过Brin希望谷歌追赶前沿并将资源推向RSI。报道称Brin回归后的办公地点是总部Gradient Canopy大楼一间改造过的微厨房,与DeepMind负责人Kavukcuoglu相邻而坐,劈柴哥每周会来几次。他直接插手芯片分配,为Gemini团队开辟算力特权通道,并推行监控部分员工编码过程、用真实数据训练Gemini代码能力的计划。一名前员工形容他深度押注RSI、彻底被「AGI洗脑」。
背景是谷歌在前沿竞赛中的压力。Gemini 3曾短暂登顶,随后被Anthropic和OpenAI反超,新一代旗舰模型因编码能力不达标推迟两个月;核心人才接连流失,包括Jeff Dean离职创业,Oriol Vinyals、John Jumper出走,Hassabis于8月5日卸任DeepMind负责人。Brin的赌注是切断原有赛道,让模型自己评估、修改自己,把按季度计算的迭代周期压缩到按周计算。
更耐人寻味的是谷歌自己的博客。9月2日发布的Gemini 3.8 Flash与3.8 Flash Cyber中写道,这些模型的进展「进一步被长时间运行的智能体循环所加速,这些循环被设计用来递归地评估和精炼底层模型」。DeepMind的姚顺宇评价称,对模型是一小步,对RSI是巨大飞跃;研究RSI智能体的Sicong Jiang称这是RSI飞轮开始产生复利效应。3.8 Flash在HLE-Verified上取得54.9%,Cyber版在真实漏洞挖掘成功率突破70%。六周内发布三个Flash版本、3.7 Flash发布不到三周,这种节奏被支持者视为RSI已在运行的旁证。
RSI概念在AI圈流传二十多年,核心是让AI修改自身训练代码与方法,训出更强下一代。DeepMind今年6月《从AGI到ASI》将其列为通向超级智能的四条必经之路之一。今年OpenAI表示GPT-5.6 Sol已能协助后训练更小的模型;Anthropic发表《当AI构建自身》博客;Anthropic CEO Dario Amodei公开宣布RSI已在全行业发生、包括Anthropic内部,并建议放缓前沿AI研发速度。与这些表态相比,谷歌流出的信号更直接:带RSI命名的模型标签与训练槽位。
接下来值得观察的是一个简单时间点:若三周后3.9 Flash准时出现,博客中「递归地评估和精炼底层模型」就不再只是修辞。AI竞赛的衡量标准可能从「谁的模型最强」转向「谁的循环转得最快」,模型强弱变成中间量。人类研究员在循环中的位置也在后退,从写代码到跑实验,最后可能只剩看结果、按确认。若截图属实,AI研发史上第一个由模型自己训出来的模型,或许已在谷歌机房中运行。