OpenAI在10月7日通过代码托管平台GitHub一次性发布了722篇数学手稿,全部出自同一个从未公开的内部模型,覆盖数论、几何、概率、理论计算机等17个数学分支。OpenAI称,该模型尝试了约4000个悬而未决的数学问题,最终在372组问题上给出了结果,平均每个结果耗费的算力约相当于ChatGPT付费高级版思考3个小时。

这批手稿的发布方式在数学界引发了罕见的分裂反应。一方面,其中一些声称的成果分量极重。例如在平面点集染色问题上,模型声称将答案范围从原先已知的5到7种颜色进一步压缩到6或7;更引人注目的是与黎曼猜想相关的一项声称——手稿称在实部大于7/8的区域不存在零点。美国罗格斯大学的数学家亚历克斯·孔托罗维奇评价,如果这一结果由人类做出,「立刻拿菲尔兹奖,没有任何疑问」。

但另一方面,手稿的整体质量令许多数学家感到沮丧。722篇手稿没有一篇经过同行评审,也没有人类作者署名。发布次日,OpenAI就撤回了3篇论文,原因是第一篇中一个符号错误——该写负号的地方写成了正号,导致关键抵消不成立,另外两篇因建立在同一构造上而一并撤回。同日还有14篇做了修补。

更多的问题出在可读性上。美国布朗大学的布伦丹·哈塞特翻看自己熟悉领域的手稿后表示不知所云,并称如果是人写的,他不会再多花时间,但后面还有721篇。普林斯顿大学研究黑洞数学的米哈利斯·达费莫斯则指出,这些手稿写得太含糊,够不上证明的标准,连错都谈不上。

数学界有一个其他学科没有的便利:证明可以翻译成Lean这类交互式定理证明器能读懂的语言,由计算机逐行检查逻辑严密性。截至10月10日,约42%的结果通过了这种机器检查。但机器检查也有盲区——程序只能保证它拿到的那句话被证明了,这句话和论文里的原题是否一致,仍需人工核对代码。负责Lean数学库的约翰·科梅林就怀疑,有些形式化版本证明的其实是更弱的命题。

这一事件触动了数学界更深层的焦虑。菲尔兹奖得主陶哲轩公开反对并抵制这种「论文轰炸」。他此前描述过数学界的惯例:一个长期难题被攻克后,证明者会到处做报告,同行组织研讨班一起啃,新的合作和新问题随之冒出来,年轻人被吸引进这个领域,证明被一步步简化,最后写进教科书。而现在,难题被AI成批解掉,提交结果的人自己也讲不清楚,这一连串反应几乎不再发生。研究者还开始把有前途的方向藏起来,生怕被抢先。陶哲轩把这比作露天开矿,把未解问题一片一片挖光。

发布第2天,一个由800多名数学家组成的团体「人类数学协会」发表声明,呼吁同行停止与OpenAI合作,称一次放出700多个文件是在秀肌肉,算不上学术。9月,20多位菲尔兹奖得主已联名发表宣言,批评AI公司把数学难题当成测试模型的考题。他们担心的是答案背后的东西:数学家攻一道难题,路上会造出新方法,再靠报告、讨论和教科书传给后来的人;AI直接把答案端出来,没人消化,这些方法就传不下去。

年轻人已经先吃了亏。博士论文、经费申请、求职材料往往就押在某一个未解问题上。手稿放出来之后,有数学家说,身边一批朋友和同事的经费申请一夜之间作废。还有人担心,下一代要是不再啃难题,几十年后,这些数学可能就没人看得懂了。

数学界并没有达成一致。加拿大多伦多大学的丹尼尔·利特认为这对数学是好事,他转述一位合作者的感受:「我觉得自己爬了一辈子,现在能飞了。」也有人看到自己研究过的问题被解决,感到的是轻松。

兴奋也好,愤怒也好,摆在所有人面前的是同一堆稿子。数学家普遍估计,把这722篇弄明白,要花好几年。OpenAI没有停下的意思,表示会继续拿数学问题测试自己的内部模型,数学圈里也已经在传下一批手稿。法国国家科学研究中心的数学家斯科特·阿姆斯特朗自认是对AI最乐观的那批人之一,被问到接下来的打算,他说眼下最要紧的是把手头的研究做完,「趁OpenAI还没抢在我们前面」。