美东时间10月6日傍晚6点,OpenAI发布了一批由尚未公开的内部模型撰写的数学研究手稿,共计722篇,被归纳为17个领域的372个成果类别,其中162篇附有主结果的Lean形式化证明。OpenAI官方表示,每项成功结果消耗的算力相当于ChatGPT Pro运行3小时。声明中列出的成果涵盖四维Kakeya猜想、广义黎曼猜想相关问题、唯一游戏猜想、自由群因子同构问题、有理数域上的希尔伯特第十问题、CM阿贝尔簇的霍奇猜想以及马勒猜想等数学难题。
这一发布迅速在数学界引发质疑。OpenAI在数学领域以大胆宣称和缺乏透明度著称,此次发布同样未能提供模型细节。OpenAI发言人向《科学美国人》表示,公司尚未公开发布该全新模型,几乎所有结果都是在向单个智能体发出单一指令后生成的。若该说法成立,意味着此前未曾出现的数学能力可能很快为普通用户所用。
质疑的导火索可追溯至9月8日。OpenAI当时声称解决了纳维-斯托克斯千禧年难题,该方程研究水、空气等流体的运动规律,广泛应用于工程与物理领域。难题的核心在于:如果三维流体初始状态平稳且光滑,按照纳维-斯托克斯方程运动,它是否会一直保持正常,还是在有限时间内突然出现速度或涡旋无限大的奇点。OpenAI表示其系统给出了解析证明和Lean形式化证明,表明初始静止且光滑的流体可在有限时间内产生奇点,并称这一结果证明了千禧年大奖难题官方表述中的命题C及命题D成立。克雷数学研究所于2000年设立该难题,为全球七大悬赏难题之一,奖金100万美元。OpenAI表示不打算申领奖金。
据披露,该智能体系统于9月1日启动。9月5日,首批智能体启动约88小时后,解答出炉。后续Lean形式化验证由GPT-6 Astra完成,耗时约17小时。整个过程中,智能体共发出约490万条消息,消耗约3000亿输出token。然而,在OpenAI官宣消息的12小时前,纽约大学数学家特里斯坦·巴克马斯特与其在Anthropic任职的合作者莱文特·阿尔珀格已先公开了相近成果,优先权争议随之而来。两人先后使用Claude、Codex等AI模型开展研究,8月15日做出关键结果,8月22日完成Lean验证。巴克马斯特表示,OpenAI是在听到传闻后迅速投入大量AI代理并发布成果,并认为OpenAI在成果发布、署名和优先权上处理不当,称对方曾要求排除阿尔珀格。OpenAI否认使用其私人数据,称研究为独立完成。该争议目前尚无定论。
9月21日,OpenAI宣布将组建由数学家组成的独立顾问小组,就如何负责任地发布AI生成的计算结果提出建议。小组建议OpenAI应公布结果背后的模型、具体提示信息和计算时间,并特别批评了使用未向数学家广泛开放的专有内部模型的做法。但OpenAI最终仅公布了问题的平均计算时间及部分额外统计数据,未提供任何提示信息。
更大的问题在于,Lean验证并不等于成果已获数学界确认。米兰比可卡大学副教授瓦莱里奥·卡普拉罗指出,有最新论文研究发现,OpenAI纳维-斯托克斯方案的论文和Lean代码至少存在两处不一致:论文中的一个估计只需四个额外输入导数,Lean版本却需要五个,形式化结果因此更弱;论文中的压力-通量估计也采用了不同的界限和证明方法。卡普拉罗表示,目前不清楚这些差异是否会使整个证明无效,但它们引出一个重要问题:OpenAI不断宣称革命性突破,但无人知晓这些证明是否正确,或是否证明了其声称要证明的内容。Lean只能检查数学推导在形式上是否存在逻辑错误,无法判断所证明的内容是否对应原来的难题,也不能判断结果是否具有真正的新意。
OpenAI公布的“平均每项结果消耗约3小时ChatGPT Pro算力”同样不能等同于AI用3小时解决了一道数学难题。3小时仅为成功保留结果的平均计算量,模型还经历了问题筛选、方向探索、反复尝试和结果整理。OpenAI发言人也向《科学美国人》承认,部分成果可能经过多次尝试。麻省理工学院数学家安德鲁·萨瑟兰表示,除非OpenAI公布模型且人们能够复现结果,否则任何关于用单个智能体一次性解决问题的说法都应被视为未经证实。
OpenAI在发布722篇数学手稿后,因发现一个符号错误撤回其中3篇,并修改了另外14篇,目前仓库列出719篇。数学家们没有足够时间逐项阅读这些手稿,其中许多证明文本长达上百页。这反映出数学界对AI竞赛最深的担忧:AI正在制造证明过剩,而人类缺乏足够的时间和能力去理解这些证明。开普勒猜想证明本身得到认可后,仍用了十多年进行形式化验证;四色定理的答案早已被广泛接受,但让数学共同体信任、检查并重建计算过程持续了几十年;有限单群分类定理的单个结论背后是一整个需要几代人维护、修补和整理的知识网络。OpenAI一次性放出700多篇手稿,等于将这套缓慢的消化流程压缩到了一夜之间。
有观点将这种发布方式称为将未经证实的工作倾倒给数学家,也有乐观声音认为,即使只有一半结果最终成立,这批成果仍可能改变数学研究。多伦多大学数学家丹尼尔·利特表示,如果想知道这些数学问题的答案,看不出有什么理由要求公司对数学界保密,这对数学发展是一件好事。陶哲轩及一众菲尔兹奖得主签署的《人工智能与数学的严重错位》中提到,解决问题只是数学研究的一个工具,数学更重要的目标是概念理解、理论发展、人才培养和知识传承。OpenAI不会放慢脚步,其目标是为数学家提供尽可能强大的工具,但对于将数学真理视作目的的数学界而言,如何在AI生成内容爆发式增长的背景下建立有效的验证与消化机制,已成为一个无法回避的问题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。