陶哲轩批OpenAI一次性公开722篇数学手稿:解题只是工具,数学正在失去沃土

2026年10月6日,OpenAI将一个未公开模型生成的722篇数学手稿批量推送至公开仓库,涵盖372个问题族系。菲尔兹奖得主陶哲轩随即提出"Math 2.0"框架,批评AI解题模式将方法论、失败路径和衍生问题等"副产品"全部抹去,认为这不过是以新的不可持续优化替换旧的不可持续优化。此前,包括陶哲轩在内的25

2026年10月6日,OpenAI将一个内部模型生成的722篇数学手稿批量推送至公开GitHub仓库。这批手稿横跨纯数学与理论计算机科学,组织为372个结果族系,模型训练于2026年8月28日启动。菲尔兹奖得主陶哲轩公开发声:AI以优化解题为目标,但解题过程中孕育的方法论、失败路径、衍生问题等副产品全部消失。他称“Math 1.0”已被优化至不可持续的临界点,“Math 2.0”必须重新定义数学进步。

陶哲轩此前参与OpenAI于9月21日成立的数学与人工智能顾问组。他以顾问身份表述使命:“我们目前面临一项非常具体的挑战——就如何协调发布大量重要数学成果向OpenAI提供建议,这些成果据报道由其内部模型生成。”顾问组的存在显示,数学共同体与OpenAI在成果发布时机与方式上尚未形成共识。

AI把解题做成了流水线,却绕开了真正重要的过程

陶哲轩的批评需置于数学知识生产的内在逻辑中理解。在数学界,一个开放问题的价值不仅在于答案。它首先是地标,解决它检验人类对某片数学地貌的理解程度。解决后,数学共同体通常持续数月乃至数年围绕成果工作:理解证明结构、识别新方法、与已有体系连接、简化至可教学程度,最终某些思想在数十年后成为普通工具。这个消化过程是数学的核心产出。

AI批量解题打断了这一循环。722篇手稿并非经传统同行评审发布,而是模型直接生成后推送。其中能以Lean形式化语言验证的仅162篇,其余560篇仍需数学界进行传统严格审查。陶哲轩判断:解题只是实现数学目标的工具,真正目标是概念理解与洞见;若AI仅生产“真/假”断言而不提供思路路径,数学便失去培育新问题与方法的沃土。

他将此延伸为对“Math 2.0”时代的呼吁:数学进步需更全面衡量,阐释质量、社区建设、新方向开辟应与解决问题同等重要。否则AI只是将旧的不可持续优化替换为新的算力批量消耗。

Navier-Stokes争议:一次让问题集中爆发的导火索

讨论爆发的直接导火索是OpenAI于9月8日宣布解决Navier-Stokes方程存在性与光滑性问题。这是克雷数学研究所2000年设立的七个千禧年大奖难题之一。OpenAI调用约1万个AI智能体持续工作约88小时,给出构造平滑外力使流体在有限时间发生爆破的证明,符合克雷题面C、D情形。截至目前,克雷数学研究所官方页面仍将该问题标记为“活跃”。

验证状态的落差暴露出AI数学成果与数学界接受标准之间的结构性断层。数学界验证是社会过程:同行阅读、质疑、简化、再生产,最终形成共识。OpenAI使用“自动化验证方法”,公司称其正在成为数学严谨性的新标准,但这与数学共同体期待的验证方式是两套不同体系。

Navier-Stokes事件还引发归属权争议:纽约大学数学家Tristan Buckmaster与Anthropic研究员Levent Alpöge被卷入,围绕模型是否在知悉数学家研究进展的前提下暴力破题、成果署名是否合理等问题,引发数学界对“Prompt算不算未发表研究材料”的公开讨论。这触及更深层问题:顶尖模型接受用户对话数据,模型给出的证明究竟借用了多少数学家的半成品思路。

25位菲尔兹奖得主:这是AI与科学界目标的系统性错位

2026年9月11日,陶哲轩、邓煜等25位菲尔兹奖得主发表联合声明《人工智能在数学中的严重错位》。声明将问题定性为系统性:AI公司以“解决数学问题”作为衡量模型能力的基准,这对数学学科和数学共同体构成伤害,且已影响到其他科学与创意职业。

声明列出三个具体结构性问题。其一,AI解题速度超过数学共同体消化知识的速度,存量开放问题被快速消耗,但AI尚不具备提出具有深远价值的新开放问题的能力,地标正在消失而新地标产生速度跟不上消耗。其二,AI发布成果的方式存在合规问题:成果常匆忙向媒体宣布,未能撰写严谨论文,也缺乏对前人工作的妥善引用,引发归属与剽窃争议。其三,若无数学家负责将其整合进知识体系,AI产生的思想无法真正“活起来”,人类数学家间的传承链条可能断裂。

对数学界、AI行业与评测生态的分层影响

对数学共同体而言,722篇手稿的冲击是多重的。首先是资源挤占:数学家需花费大量时间审查AI生成的声明,而这些时间原本可用于推进研究。其次是寒蝉效应:事件引发研究者对大厂后台监控Prompt数据、窃取灵感并凭算力抢跑的恐慌,研究者开始犹豫是否向对话框透露半成品思路。若数学界从开放协作走向防御性闭门造车,将是对学科生态的严重倒退。

对AI行业而言,事件将隐患推到台面:数学基准成绩越来越高,这个分数究竟在衡量什么。当模型调用1万个智能体穷举验证,分数提升主要来自算力投入而非推理能力本质进步,数学问题作为能力评估工具的有效性大打折扣。此外,OpenAI这批发布“并未包含独立数学顾问组建议的所有披露内容”,意味着即便OpenAI自己设立的顾问机制,其建议也未被完整采纳。

对企业用户和开发者而言,这场争议提供选型参照框架:在部署AI解决专业领域问题时,“模型声称解决了问题”与“解决方案经过该领域社区验证”之间存在本质差距。162篇Lean形式化验证的手稿与其余560篇之间的区分,正是这种差距的量化体现。在高风险决策场景中,依赖未经领域专家验证的AI输出,意味着承担难以量化的系统性风险。

战略判断:数学基准的公信力危机将倒逼评测体系重构

陶哲轩的“Math 2.0”框架,本质上是对AI能力评估体系的一次哲学挑战:当“解题率”这个代理指标被优化至接近天花板,它就不再是真实能力的可靠信号,甚至开始与真实能力发生背离。这个逻辑不仅适用于数学,也适用于所有以“解决可验证问题”为基准的领域。

最可能发生的一个走向是:数学领域率先形成独立的AI成果验证标准,要求发布方提供形式化证明(如Lean或Coq格式)而非自然语言手稿,且验证工作须由独立数学家完成,而非依赖发布方自有的“自动化验证”。可观察的信号包括:克雷数学研究所是否最终承认Navier-Stokes问题已解决,以及OpenAI是否调整下一批成果的发布方式。

另一个方向,是陶哲轩提出的“Math 2.0”从理念走向制度设计:不再以“解决了多少问题”衡量AI的数学价值,而是以“产生了多少可以被消化、传承和教学的理解”为标准。这需要数学共同体、AI公司和学术机构三方同时调整激励结构,难度极高,但25位菲尔兹奖得主联合发声这一事实本身,说明这条路正在被认真讨论。

一个底层矛盾是:AI公司需要通过解决著名问题来证明模型进步,这是商业传播逻辑的必然;但数学共同体需要慢下来才能真正从中受益,这是知识生产逻辑的必然。这两套逻辑的时间尺度完全不同,而目前AI行业的节奏明显是前者在主导。陶哲轩的警告表明,这个节奏的代价正在积累,且已引起领域最顶尖群体的注意。