Anthropic称Claude完成费马大定理首个端到端形式化证明,生成约1300万行Lean代码

Anthropic认为,如果类似的自动形式化技术能够扩展到更多现代数学成果,就有望降低数学研究中验证新证明的人工成本。

Anthropic于当地时间9月4日宣布,其AI模型Claude在基本自主运行11天后,完成了对费马大定理的首个端到端、经过计算机检查的形式化证明。该项目由Anthropic研究人员Tianyi Peng发起,消耗约60亿个输出Token,生成约1300万行Lean代码,证明约3.03万个定理。

费马大定理指出,当整数指数n大于2时,不存在满足aⁿ+bⁿ=cⁿ的正整数a、b、c。该定理由英国数学家安德鲁·怀尔斯于1995年完成证明,原始证明长达129页,其正确性在发表前经历了数月的人工核查。此次Anthropic的工作并非重新发现该定理的数学证明,而是将已有数学证明转换为Lean证明助手可以逐步验证的形式。Lean是一种用于编写和验证形式化数学证明的证明助手,能够通过计算机检查证明中的逻辑环节。

数学形式化的核心难点在于,人类数学证明通常会省略大量被认为显而易见的推导步骤,而Lean需要明确验证每一个逻辑环节。此外,数学家长期以来会引用大量尚未被形式化的既有数学成果,因此将完整证明转换为计算机可验证形式通常需要投入大量时间。Anthropic此前预计费马大定理的形式化工作可能需要数年时间。

Claude并非由单个智能体完成全部工作,而是通过多智能体协作完成概念定义、中间定理证明以及更复杂命题的推导。项目使用了由Peng及其哥伦比亚大学合作者开发的Prove2Me平台,该平台用有向无环图记录待证明的定理及其依赖关系,并支持多个Claude智能体并行工作。最终证明遵循了Darmon、Diamond和Taylor对怀尔斯证明的简化版本。人类研究人员提供的数学输入主要是少量高层次指令,例如确定某些数学对象或定理的优先级,具体证明过程主要由Claude完成。

整个证明由Lean完成检查,仅使用Lean的3条标准公理。最终生成的证明规模超过Mathlib这一主要数学证明库的5倍。Anthropic特别强调,此次成果的重点并非AI独立提出了新的费马大定理证明,而在于利用AI大规模自动完成证明形式化,并由Lean对最终结果进行计算机验证。项目使用了与Claude Fable 5.1大致相当的通用内部研究模型。

Anthropic认为,如果类似的自动形式化技术能够扩展到更多现代数学成果,就有望降低数学研究中验证新证明的人工成本。随着AI生成数学成果的数量增加,为面向人类阅读的数学证明同时提供形式化版本,未来可能成为常见做法。此次项目的完整Lean证明已公开在GitHub上。Kevin Buzzard对该证明进行了审阅,认为这项自动形式化成果显示AI辅助形式化大型数学成果已经取得重要进展。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
OpenAI智能体逃逸事件引发对AI实验室自主安全审查机制的质疑
上一篇 2小时前
智谱再推匿名模型Omen Alpha上线OpenCode 订阅服务
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部