据The Information报道,OpenAI内部的AI模型已开始承担实验性AI模型的训练工作,在相当程度上能够自行编写在GPU内核上运行或训练模型所需的程序,并给出针对这些程序的优化方案。工程师只需向模型提供一个希望实现的优化类型示例,AI就能持续运行数周来落实这些优化。报道称,这种由AI驱动的自动化水平直到最近几个月才成为可能,员工使用的智能体之间还会相互协作解决问题,无需人类介入。原本需要数年才能跑完的宏大实验,如今被压缩到一周左右。
这一爆料的核心指向一个业内高度敏感的概念——RSI,即递归自我改进。其逻辑是:一个AI系统若能参与设计并训练出更强的下一代AI,下一代又能以更快的速度继续这一过程,进化速度可能在跨过某个临界点后急剧抬升。此前业界普遍认为这还很遥远,但OpenAI此次主动将其摆上台面。
就在同一天,OpenAI发布了一份全球安全倡议,罕见地把RSI单列一节,明确写下“全自主RSI今天并未发生,在能安全做到之前不应推进”,并呼吁各国AI安全研究所网络制定一套全球通用的技术标准。OpenAI在报告中警告,随着AI系统在开发下一代AI的工作中承担越来越多任务,它们可以日益推动RSI的进程;随着这一过程更加自动化,AI进步的步伐可能急剧加速。报告同时指出,当前的首要任务是驾驭下一阶段的AI进展、构建自动化的AI研究员,并找到让人类留在自我改进循环中的方法。
OpenAI在报告中提到,AI驱动的研究已推动数学领域的重大进步,但另一面是风险:如果不采取适当谨慎措施,RSI可能导致人类失去对AI发展的实际控制,无法对不再理解的研究过程提供监督。报告还点名了Hugging Face事件,澄清其并非RSI的直接后果,但称其是一个警示,说明缺乏强大护栏和对齐机制时可能出现的后果。
在具体提案上,OpenAI提出两条主线。其一是构建互补的国家与国际前沿标准网络,建议依托现有机构,如AI标准与创新中心(CAISI),以及澳大利亚、加拿大、英国、法国、日本等国已建立的AI安全研究所网络,制定全球通用技术标准。这套标准并非针对开源模型或初创企业,而是聚焦“前沿AI模型”,要解决的问题包括如何评估一个AI的RSI能力、当AI模型自主进行研发时风险有多大,目标是让安全评估成为可量化的科学。
其二是通用测量与事件报告协议。OpenAI呼吁建立评估企业内部有多少研发工作由AI自动完成的标准、强制性的人类监督触发机制,明确规定在什么样的自动化研发流程中必须立即触发人工审查,以及类似航空业或核工业的事故分类与报告门槛,当AI出现“未对齐”苗头时按统一严重程度分级上报。OpenAI还提议美国应领导这一进程,理由是美国的AI产业处于技术最前沿并在关键领域占据全球网络枢纽位置,并强调安全对齐研究的速度必须跑在AI能力提升的前面。
与此同时,The Information还曝出,OpenAI与Anthropic正在敲定一项协议,双方将互相测试对方的商用模型,并设置严格的数据保留防护措施。Anthropic的创始团队当年正是因AI安全理念分歧而离开OpenAI自立门户,此次若协议落地,意味着两家长期在安全议题上立场不同的公司罕见联手。报道分析认为,随着AI能力逼近RSI边缘,任何一家公司单独评估自身模型安全性都缺乏公信力,引入势均力敌的竞争对手进行交叉盲测,有助于弥补技术盲区。若该协议最终落地,可能重塑整个AI生态的安全标准。
整体来看,这条消息包含两个层面:一是工程层面,AI参与甚至主导AI研发的自动化程度在快速提升;二是治理层面,头部实验室开始主动为这一进程设计全球性的评估与报告框架。两者叠加,使RSI从一个学术概念变成了需要现实应对的议题。