OpenAI于10月6日在GitHub发布722份AI生成的数学手稿,涵盖372个数学结果族,涉及数百项开放研究问题。次日,因一处符号错误及其连锁影响,OpenAI撤回3份手稿,公开目录调整为719份。该批成果发布后,被指尚未完全达到“数学与人工智能顾问小组”(AGMAI)此前提出的标准。
OpenAI表示,发布前曾咨询由普林斯顿高等研究院主持的AGMAI,并参考其公开建议。但从公开信息看,此次发布在多个关键维度上未满足该小组提出的要求。AGMAI此前建议前沿AI实验室停止在专有、外界无法访问的模型上测试高难度数学问题,并要求披露模型名称、提示词、推理链、耗时及计算成本等信息。OpenAI此次仍使用专有模型,且仅10份手稿附有模型推理链。
在人类可理解性方面,AGMAI强调AI生成证明应便于数学家审查和学习。然而据报道,OpenAI发布的证明中约42%未经形式化处理,也未提供将自然语言证明与形式化产物关联的机器可读元数据。AGMAI同时声明,其咨询角色不构成对OpenAI获取或发布这些结果的认可,最终仍需由数学界评估相关建议是否得到充分执行。
该事件再度引发关于AI生成数学成果的透明度、形式化验证、同行审查及学术研究自主性的争议。10月7日,数学家陶哲轩在mathstodon上发布帖子,对此事作出回应。他表示并不反对AI做数学,甚至一直是AI辅助研究的积极使用者,但强烈反对把“用AI快速攻克著名难题”当成主要目标或产品展示。他认为这会破坏数学共同体赖以运转的理解、教学、合作与开放探索机制。
陶哲轩指出,传统数学中,一个长期猜想的突破并不只是“得到答案”:作者会做报告、参加研讨、与同行交流,随后证明会被简化、解释、纳入教材,并催生后续问题、合作者和新的研究方向。而OpenAI等公司当前的做法,往往是由提示者驱动AI自主解题;目标一旦“解决”,后续的理解、报告、同行讨论和领域建设却很少发生。他认为,发布者甚至可能不足以解释AI的输出、回答问题或与领域互动。
他把这种状况称为数学界的“证明消化不良”:AI能高速生成命题、证明和反例,但人类来不及验证、理解、写作、教学和吸收,结果出现大量“无人能消化的证明”。他尤其担心的是,OpenAI把纳维–斯托克斯方程等千禧年难题当作模型能力基准来攻克。在他看来,这把“解出多少题、多快解出”当成了衡量“理解与洞见”的指标,但速度和数量本身并不等于数学理解。
陶哲轩进一步强调,问题一旦被公开“解决”,就几乎无法恢复为“未解决”状态。即使人们后来想寻找不同路径、从中提炼新方法,仅仅知道答案存在,也会“污染”这一探索过程。因此,他批评这是一种不可持续的大规模“收割”:把开放问题当作可批量消耗的资源,最终会让整个数学领域变得不如传统研究方式下那样肥沃。
陶哲轩是加州大学洛杉矶分校(UCLA)数学教授,2006年菲尔兹奖得主,被广泛视为当代最具影响力的数学家之一。此次争议的核心并非AI能否辅助数学研究,而是AI生成成果的发布方式、验证标准与学术共同体吸收能力之间的结构性张力。随着前沿实验室加速将AI应用于高难度数学问题,如何在效率与理解、公开与专有、自动化与同行审查之间建立可持续的平衡,将成为数学界与AI行业共同面对的长期议题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。