Anthropic于当地时间9月25日宣布,其模型Claude完成了一项高难度的理论物理计算:平面(N=4)超杨-米尔斯理论中六粒子散射振幅的九圈计算。这一结果超过了美国SLAC国家加速器实验室物理学家兰斯·迪克逊(Lance Dixon)等人在2023年实现的八圈记录。值得注意的是,迪克逊本人参与核验了Claude的计算结果,并表示自己此前认为直接完成九圈计算难度过大,对Claude能够直接完成感到意外。
据Anthropic披露,Claude分别采用两种方法完成该计算,整个过程无需研究人员持续参与,每种方法的运行成本约1000至2000美元,其中一种计算使用了96个CPU持续运行约一周。需要说明的是,平面(N=4)超杨-米尔斯理论是一种高度理想化的理论模型,主要用于检验粒子物理中的计算方法,并非现实世界的完整物理模型。
从技术意义看,此次成果说明AI已经能够在专家已建立方法框架的前提下,独立完成过去需要顶尖理论物理学家和大量计算资源才能推进的复杂计算。但迪克逊也指出,Claude此次主要使用了人类物理学家过去多年建立的工具和方法,真正具备突破性的是AI开始提出新的物理原理和洞见——换言之,目前AI更多是在既有范式内加速执行,而非独立开辟新方向。
这并非孤立事件。头部模型厂商近期在科学领域持续加码,投入方向覆盖数学、生物科学、物理等。Anthropic公布,Claude将黎曼ζ函数满足黎曼猜想的零点比例下界从41.6%提高到67.2%;Claude还经过11天基本自主运行,完成了费马大定理的完整Lean形式化。OpenAI方面,在公布内部系统对纳维-斯托克斯问题的解决方案并提供Lean形式化代码后,披露其8月28日开始训练的一款内部模型已解决100多个长期开放数学问题。
另一则引发讨论的消息来自社交平台与GitHub。9月16日,一名匿名用户Captain Sude发文称,通过OpenAI的GPT-6 Astra模型完成了刘维尔版哥德巴赫猜想的证明。但需注意,此次研究对象并非原版哥德巴赫猜想,而是弱化版的刘维尔-哥德巴赫定理。原版哥德巴赫猜想(强猜想)要求任一大于2的偶数都可写成两个素数之和,即“1+1”,素数在加法结构中的分布是数论中最核心的难题之一,至今未被证明;而弱化版只要求两个加数的质因子总个数为奇数,完全不要求它们是素数。行业真正关注和认可的始终是原版猜想,刘维尔版本是一个衍生出的弱化命题,因其可验证性而成为AI能力的试验场,并未被视为对原版猜想的实质性推进。作者Captain Sude自己也称,此次论证结果只有对数论极其痴迷的人才会觉得“很大”,实际在任何方面都无法与千禧年难题相提并论。此外,该技术报告只通过了数学上的形式化验证(Lean4),即通过机器检查每一步逻辑推导、确认报告内部推理链条没有逻辑漏洞,并未得到数学领域专家或OpenAI官方的确认。
伴随AI在科学领域的快速推进,传统学术评价体系与人工智能技术之间逐渐出现摩擦。9月11日,陶哲轩等25位菲尔兹奖得主联署公开信《AI在数学中的严重错位》,认为科技公司将“解决开放问题”作为模型能力指标,可能忽视数学研究中更重要的理解、原创性、知识传承和学术归属等价值。作为回应,OpenAI成立了由9名数学家组成的独立数学咨询小组,负责协助评估成果重要性、协调发布以及学术规范等问题。
整体来看,头部AI公司正以远超传统学术节奏的速度开拓科研边界,但验证速度并不等同于科学本身。当前待解决的难题是:传统科学机构如何接纳一个可以24小时不眠不休的研究者,并针对性地更新学术规范。对关注AI竞争格局的读者而言,这一轮科研能力的比拼,既是模型厂商展示技术上限的舞台,也可能重塑科研产出、署名与评价的既有规则。