Anthropic於當地時間9月25日宣佈,其模型Claude完成了一項高難度的理論物理計算:平面(N=4)超楊-米爾斯理論中六粒子散射振幅的九圈計算。這一結果超過了美國SLAC國家加速器實驗室物理學家蘭斯·迪克遜(Lance Dixon)等人在2023年實現的八圈記錄。值得注意的是,迪克遜本人參與核驗了Claude的計算結果,並表示自己此前認為直接完成九圈計算難度過大,對Claude能夠直接完成感到意外。
據Anthropic披露,Claude分別採用兩種方法完成該計算,整個過程無需研究人員持續參與,每種方法的執行成本約1000至2000美元,其中一種計算使用了96個CPU持續執行約一週。需要說明的是,平面(N=4)超楊-米爾斯理論是一種高度理想化的理論模型,主要用於檢驗粒子物理中的計算方法,並非現實世界的完整物理模型。
從技術意義看,此次成果說明AI已經能夠在專家已建立方法框架的前提下,獨立完成過去需要頂尖理論物理學家和大量計算資源才能推進的複雜計算。但迪克遜也指出,Claude此次主要使用了人類物理學家過去多年建立的工具和方法,真正具備突破性的是AI開始提出新的物理原理和洞見——換言之,目前AI更多是在既有範式內加速執行,而非獨立開闢新方向。
這並非孤立事件。頭部模型廠商近期在科學領域持續加碼,投入方向覆蓋數學、生物科學、物理等。Anthropic公佈,Claude將黎曼ζ函式滿足黎曼猜想的零點比例下界從41.6%提高到67.2%;Claude還經過11天基本自主執行,完成了費馬大定理的完整Lean形式化。OpenAI方面,在公佈內部系統對納維-斯托克斯問題的解決方案並提供Lean形式化程式碼後,披露其8月28日開始訓練的一款內部模型已解決100多個長期開放數學問題。
另一則引發討論的訊息來自社交平台與GitHub。9月16日,一名匿名使用者Captain Sude發文稱,通過OpenAI的GPT-6 Astra模型完成了劉維爾版哥德巴赫猜想的證明。但需注意,此次研究物件並非原版哥德巴赫猜想,而是弱化版的劉維爾-哥德巴赫定理。原版哥德巴赫猜想(強猜想)要求任一大於2的偶數都可寫成兩個素數之和,即“1+1”,素數在加法結構中的分佈是數論中最核心的難題之一,至今未被證明;而弱化版只要求兩個加數的質因子總個數為奇數,完全不要求它們是素數。行業真正關注和認可的始終是原版猜想,劉維爾版本是一個衍生出的弱化命題,因其可驗證性而成為AI能力的試驗場,並未被視為對原版猜想的實質性推進。作者Captain Sude自己也稱,此次論證結果只有對數論極其痴迷的人才會覺得“很大”,實際在任何方面都無法與千禧年難題相提並論。此外,該技術報告只通過了數學上的形式化驗證(Lean4),即通過機器檢查每一步邏輯推導、確認報告內部推理鏈條沒有邏輯漏洞,並未得到數學領域專家或OpenAI官方的確認。
伴隨AI在科學領域的快速推進,傳統學術評價體系與人工智慧技術之間逐漸出現摩擦。9月11日,陶哲軒等25位菲爾茲獎得主聯署公開信《AI在數學中的嚴重錯位》,認為科技公司將“解決開放問題”作為模型能力指標,可能忽視數學研究中更重要的理解、原創性、知識傳承和學術歸屬等價值。作為回應,OpenAI成立了由9名數學家組成的獨立數學諮詢小組,負責協助評估成果重要性、協調發布以及學術規範等問題。
整體來看,頭部AI公司正以遠超傳統學術節奏的速度開拓科研邊界,但驗證速度並不等同於科學本身。當前待解決的難題是:傳統科學機構如何接納一個可以24小時不眠不休的研究者,並針對性地更新學術規範。對關注AI競爭格局的讀者而言,這一輪科研能力的比拼,既是模型廠商展示技術上限的舞台,也可能重塑科研產出、署名與評價的既有規則。