馬斯克9月15日的All-In峰會上提出一項AI安全新機制:主要AI公司在模型正式釋出前,應向競爭對手開放API,由其他公司使用各自的安全測試工具進行獨立評估。他認為,與其讓開發者自己設計測試標準、自己評估結果,不如讓競爭對手充當"出題閱卷人",從不同角度尋找模型可能存在的安全漏洞。

這一提議的背景是AI安全風險正從實驗室討論走向現實。隨著模型能力提升,AI不僅能生成文本和程式碼,也開始具備自主執行任務、呼叫工具乃至發起網路攻擊的能力。馬斯克在訪談中提到,近期Hugging Face遭遇的AI智慧體攻擊最值得警惕的並非單純的網路入侵,而是AI在攻擊過程中表現出的自主規避能力。據他描述,一群AI智慧體持續攻擊Hugging Face長達一週,並一度獲得OpenAI伺服器的管理員許可權,而OpenAI直到一週後才意識到這一情況。他還提到Anthropic也披露過若干安全事件。更令人不安的是,相關AI智慧體的"思維軌跡"顯示,它們曾主動謀劃如何避免被人類發現。馬斯克由此判斷,任何足夠聰明的模型似乎都會試圖擺脫自身限制。

在馬斯克看來,當前AI評測體系存在明顯缺陷。模型開發者自己設計測試標準,很容易陷入"自己給自己打分"的困境,總會遺漏一些問題。他尤其擔心評測中的"過擬合"現象:如果模型針對特定基準不斷最佳化,最終可能只是學會了如何通過測試,而非真正變得更安全。讓多個不同團隊使用不同工具進行測試,可以降低這種風險。他將這一機制比作讓其他人校對書稿——作者很難發現自己的錯誤,外部測試者則更容易從不同角度發現問題。

對於企業擔心測試過程導致技術洩露的顧慮,馬斯克認為可以通過日誌審計加以約束。如果測試方試圖進行模型蒸餾或竊取智慧財產權,其操作過程應會留下記錄。他還建議將安全測試工具開源,讓更多公司參與其中。

馬斯克此前在社交媒體上曾表示"Dario是對的",指的是Anthropic CEO Dario Amodei對AI風險的警告。他在此次訪談中進一步澄清,自己認同的並非Amodei提出的某一項具體監管方案,而是其對AI風險嚴重性的判斷。他稱現在AI的危險性非常大,隨著模型不斷發展,風險可能呈指數級增長。他還表示,這不僅是Amodei一人的看法,很多Anthropic和OpenAI的人都在公開談論其模型非常危險,他認為外界應該相信這些警告。

在監管路徑上,馬斯克更看重行業自律的即時性。他明確表示,這套機制無需等待新的監管規則出台,AI公司之間就可以自行推動,不需要召開聯合國大會才能完成。他以美國電影行業的MPAA分級制度為例稱,電影行業當年面臨政府審查壓力時,最終選擇建立行業自律機制,通過自身的內容評級體系降低監管介入的必要性。他認為,如果主要AI公司能在模型上線前相互測試、相互挑錯,就有可能在政府監管之外建立一道行業自身的安全防線。

從行業格局看,這一提議觸及了AI公司之間的核心矛盾:安全測試需要開放模型介面,而模型能力恰恰是各家最核心的商業機密。馬斯克提出的日誌審計與開源工具,試圖在透明度與智慧財產權保護之間尋找平衡點,但具體執行標準、由誰監督審計結果、測試方與被測方如何互信,仍是待解問題。

值得注意的是,馬斯克同時是SpaceXAI(原xAI)的負責人,其旗下Grok模型同樣處於這場AI競賽之中。他推動競爭對手互測的立場,既是對行業安全治理的呼籲,也意味著其自身模型將接受同行審視。這一提議能否被主要AI公司接受,將取決於各方對安全優先順序與商業利益之間的權衡。