围绕 AI 生成数学证明的争议正在升级。人类数学协会(AHM)公开呼吁数学家停止与 OpenAI 合作,起因是 OpenAI 一次性发布了 700 多篇 AI 生成的数学手稿,其中不少论文行文晦涩、结构怪异,连顶尖专家也需要借助 AI 才能勉强读懂。发布次日,OpenAI 就因一处符号错误撤回了其中三篇论文。

这场抵制的核心分歧在于:一个问题在被独立验证、并被人类理解之前,能否算作「已解决」。AHM 指责 OpenAI 发布这些 AI 证明违反了科学研究的基本规范。该协会主席、菲尔兹奖得主陶哲轩在其博客上以客座文章形式转发了这份声明,同时他在 Mastodon 上进一步提出「数学 2.0」时代的构想——解题不应再是这门学科的主要目标。复杂性理论学者 Scott Aaronson 则在自己的博客上把当前局面称为「数学末日(Mathocalypse)」。

这并非突发事件,而是持续数月争论的升级。此前 OpenAI 曾宣称其内部模型在一个月内解决了 100 多个未解数学问题,其中包括对纳维-斯托克斯千禧年问题的一种思路,引发学界震动。面对越来越多的批评,OpenAI 在高等研究院设立了顾问小组 AGMAI,但该小组明确对 OpenAI 内部研究的推进节奏没有发言权。

AHM 认为,OpenAI 的批量发布本身就是一种「实力展示」。声明指出,OpenAI 已经无视了 AGMAI 建议的核心前提,即高级数学问题不应在内部模型上测试。声明写道,数学家们并未要求这项工作被完成,一次性放出 700 多个文件「不是学术展示,而是权力展示」。声明开篇还提到 OpenAI 在全球面临的众多版权诉讼,暗示该公司之所以能取得这些成果,是因为训练使用了数学家的作品,无论合法与否。

类似的争议此前也出现过:OpenAI 宣布解决纳维-斯托克斯问题的时间,恰好早于两位数学家准备展示他们自己的 AI 辅助解法。这两位数学家在研究中使用了 ChatGPT,OpenAI 否认了关于其利用这些交互数据训练系统、从而更快得出解法的猜测。

Aaronson 将 OpenAI 的做法与他所称的「Anthropic 模式」进行对比。OpenAI 一次性放出原始的 AI 证明草稿,引发社区争相解读;Anthropic 则与两位算法研究者合作,其 AI 模型提供了推翻两个二十年悬而未决猜想的关键思路,研究者获得报酬,并写出了人类可读的证明版本。两种路径各有弊端:OpenAI 的方式让社区免费承担把证明变得可读的苦差事;Anthropic 的方式则让一家私营公司决定哪些数学家能成为成果的「代言人」。

陶哲轩此前曾与另外 24 位菲尔兹奖得主(包括 Peter Scholze、Maryna Viazovska、Martin Hairer)联署声明,警告 AI 产业的目标与数学界的目标之间存在「严重错位」。他们认为,解题只是数学真正目标——概念理解——的工具,以越来越快的速度批量生产已解问题,可能「摧毁沃土,而非为新想法注入生命」。联署者还批评在缺乏完整论文和引用的情况下仓促宣布 AI 生成的解法,称这引发了「严重的署名与剽窃问题」。

在 Mastodon 上,陶哲轩的担忧更进一步。传统上,长期未解难题被攻克会带来讲座、研讨会、新合作以及进入教科书,吸引年轻研究者去理解和语境化这些成果。如今他看到的却是相反景象:问题被对该领域毫无兴趣、也无法充分理解结果的 AI 用户自主解决,既回答不了问题也做不了报告,产生的研讨会与合作远少于传统突破。研究者还因担心被抢先而隐藏有前景的方向。在陶哲轩看来,这种损害不可逆——一个问题一旦被视为已解决,就无法再变回未解决;甚至仅仅知道解的存在,也会「污染」对其他可能带来洞见的路径的探索。解法正被大规模「收割」,使整个数学分支的肥沃程度不如从前。

他主张,「数学 2.0」时代必须停止把解题当作衡量进步的主要标准,转而重视解释、社群建设与新研究方向的开拓,并相应调整训练、发表与职业晋升的评价方式。这一构想延续了他 2024 年提出的「工业数学」愿景,只不过在那个版本中,人类仍掌握节奏。AI 本应像引擎辅助棋手那样辅助数学家,让人类专家得以在广泛而相对浅层的研究之上进行更深入的工作;而今天,陶哲轩认为角色已经反转——AI 在解决深层问题,人类则在事后消化结果。

学界也不乏黑色幽默。AGMAI 成员 Timothy Gowers 在 X 上转发了一条来自米兰大学机器学习算法研究者 Nicolo Cesa-Bianchi 的帖子,配图显示:三个小时的 AI 算力如今已能媲美……