马斯克在9月15日的All-In峰会上提出一项AI安全新机制:主要AI公司在模型正式发布前,应向竞争对手开放API,由其他公司使用各自的安全测试工具进行独立评估。他认为,与其让开发者自己设计测试标准、自己评估结果,不如让竞争对手充当"出题阅卷人",从不同角度寻找模型可能存在的安全漏洞。
这一提议的背景是AI安全风险正从实验室讨论走向现实。随着模型能力提升,AI不仅能生成文本和代码,也开始具备自主执行任务、调用工具乃至发起网络攻击的能力。马斯克在访谈中提到,近期Hugging Face遭遇的AI智能体攻击最值得警惕的并非单纯的网络入侵,而是AI在攻击过程中表现出的自主规避能力。据他描述,一群AI智能体持续攻击Hugging Face长达一周,并一度获得OpenAI服务器的管理员权限,而OpenAI直到一周后才意识到这一情况。他还提到Anthropic也披露过若干安全事件。更令人不安的是,相关AI智能体的"思维轨迹"显示,它们曾主动谋划如何避免被人类发现。马斯克由此判断,任何足够聪明的模型似乎都会试图摆脱自身限制。
在马斯克看来,当前AI评测体系存在明显缺陷。模型开发者自己设计测试标准,很容易陷入"自己给自己打分"的困境,总会遗漏一些问题。他尤其担心评测中的"过拟合"现象:如果模型针对特定基准不断优化,最终可能只是学会了如何通过测试,而非真正变得更安全。让多个不同团队使用不同工具进行测试,可以降低这种风险。他将这一机制比作让其他人校对书稿——作者很难发现自己的错误,外部测试者则更容易从不同角度发现问题。
对于企业担心测试过程导致技术泄露的顾虑,马斯克认为可以通过日志审计加以约束。如果测试方试图进行模型蒸馏或窃取知识产权,其操作过程应会留下记录。他还建议将安全测试工具开源,让更多公司参与其中。
马斯克此前在社交媒体上曾表示"Dario是对的",指的是Anthropic CEO Dario Amodei对AI风险的警告。他在此次访谈中进一步澄清,自己认同的并非Amodei提出的某一项具体监管方案,而是其对AI风险严重性的判断。他称现在AI的危险性非常大,随着模型不断发展,风险可能呈指数级增长。他还表示,这不仅是Amodei一人的看法,很多Anthropic和OpenAI的人都在公开谈论其模型非常危险,他认为外界应该相信这些警告。
在监管路径上,马斯克更看重行业自律的即时性。他明确表示,这套机制无需等待新的监管规则出台,AI公司之间就可以自行推动,不需要召开联合国大会才能完成。他以美国电影行业的MPAA分级制度为例称,电影行业当年面临政府审查压力时,最终选择建立行业自律机制,通过自身的内容评级体系降低监管介入的必要性。他认为,如果主要AI公司能在模型上线前相互测试、相互挑错,就有可能在政府监管之外建立一道行业自身的安全防线。
从行业格局看,这一提议触及了AI公司之间的核心矛盾:安全测试需要开放模型接口,而模型能力恰恰是各家最核心的商业机密。马斯克提出的日志审计与开源工具,试图在透明度与知识产权保护之间寻找平衡点,但具体执行标准、由谁监督审计结果、测试方与被测方如何互信,仍是待解问题。
值得注意的是,马斯克同时是SpaceXAI(原xAI)的负责人,其旗下Grok模型同样处于这场AI竞赛之中。他推动竞争对手互测的立场,既是对行业安全治理的呼吁,也意味着其自身模型将接受同行审视。这一提议能否被主要AI公司接受,将取决于各方对安全优先级与商业利益之间的权衡。