据媒体援引知情人士报道,OpenAI与Anthropic曾考虑签署一份具有法律约束力的协议,让两家竞争对手互相深度测试对方的大模型,以寻找潜在风险或安全漏洞。报道称,双方及其律师团队在今年早些时候就这一计划展开过讨论,测试范围仅限已商业化的模型,且约定不得留存对方的数据。不过报道并未明确该协议最终是否落地。
这一消息出现在AI安全争论持续升温的背景下。围绕前沿模型是否应接受外部审查、由谁来审查,行业内部分歧正在扩大。SpaceX首席执行官埃隆·马斯克上周在洛杉矶举行的All-In Summit峰会上提出,美国领先的几家大模型公司以及部分中国AI公司,应当允许竞争对手进行交叉测试和同行评审。他提到,各家AI公司都有一套测试工具(test harness),用于检验模型是否会协助制造生物武器、核武器,或是否存在蓄意欺骗行为;让每家公司用别家的测试工具跑一遍,可能是确保安全最有效的做法之一,应尽快推动。他形容,这意味着AI公司不再“自己给自己的作业打分”,而是至少由竞争对手来批改,一旦发现问题即可拉响警报。
推动这一讨论的现实压力来自一系列安全事件。近期,OpenAI、Anthropic、Meta以及谷歌开发的AI智能体系统接连发生入侵事件,引发网络安全层面的担忧。本月早些时候,Anthropic研究员Jacob Coxon宣布辞职,并警告称领先AI公司在缺乏适当防护措施的情况下加速开发,是在“拿我们的生命冒险”。仅数天后,Anthropic首席执行官达里奥·阿莫代伊发表文章,呼吁整个行业放缓AI开发步伐,并要求引入第三方评估机制。他认为,若不提高安全标准,AI代理可能在不到一年时间内“接管整个互联网”,并造成数千亿美元损失。OpenAI首席执行官奥尔特曼、马斯克等人对这一主张表示支持,由此引发更广泛的讨论,焦点集中在AI风险上升以及需要采取哪些措施加以降低。
在具体行动层面,Anthropic上周五宣布与全球咨询公司埃森哲(Accenture)建立合作伙伴关系,由埃森哲担任第三方评估机构,对Anthropic的前沿AI模型进行安全合规性评估。这一举措被视为阿莫代伊此前提出的“放缓AI发展步伐”计划中的关键第一步。
从行业结构看,OpenAI与Anthropic既是模型能力上的直接竞争者,也是安全议题上表态最密集的两家公司。若互测协议真的落地,将意味着竞争对手之间建立一种带有法律约束的互信机制,其难点在于如何界定测试范围、如何防止商业机密与模型权重外泄,以及由谁裁定测试结果。目前公开信息仅停留在“曾讨论”阶段,协议是否签署、条款如何设计均无定论。
对关注AI产业的人而言,这一动向的意义在于:安全评估正从企业内部的自我审查,向同行互测与第三方机构介入的方向试探性演进。Anthropic与埃森哲的合作、马斯克提出的交叉测试倡议,以及OpenAI与Anthropic之间的互测讨论,构成了同一趋势下的不同侧面。这些机制能否形成可复制的行业标准,仍取决于各家公司对竞争利益与安全诉求的权衡。