陶哲轩警告“数学大危机”:AI每分钟生成10个证明,人类审核速度为何已落后100年?
陶哲轩在ICM 2026抛出“证明消化不良”警告:数学正面临100年来最严重的验证危机
菲尔兹奖得主、加州大学洛杉矶分校数学教授陶哲轩(Terence Tao)在2026年7月国际数学家大会(ICM 2026)上发表主旨演讲《AI时代的数学》,提出一个核心警告:AI生成数学证明的速度已远超人类审核能力,数学界正陷入“证明的消化不良”——收集数学难题的网站已堆满AI生成的证明提交,很多可能是对的,但没人有空核实。据陶哲轩引用的独立评测平台First Proof数据,2026年5月28日第二批10道全新研究级数学问题中,AI以“可发表质量”解出7道,单题算力成本仅10至1000美元。这意味着,如果假设很快AI能以合理成本完成相当比例的研究级数学任务,那么数学界必须在“生成”与“验证”之间重建平衡,否则数学将迎来一场实质性的“危机”。
事件全貌:从一位学者的退出到一场全球性的学术焦虑
这场危机的导火索来自一位真实的研究者。Rishikesh Gajjala,刚从纽约大学阿布扎比分校完成博士后工作的数学家,在X(原Twitter)上宣布退出学术圈。他在几个月内借助AI在困住自己多年的博士课题上接连取得突破,却发现“探索过程”的意义被AI消解——“大多数答案都只隔着一个prompt,早一点找到答案已经没那么有意义了”。更关键的是,他无法判断AI给出的答案是否正确,因为“在通过验证之前,一份漂亮的证明和垃圾没有区别”。Gajjala随后转向形式化验证领域,加入刚完成2700万美元种子轮融资的PramaanaLabs,致力于构建能证明AI答案正确的认证系统。
陶哲轩在ICM 2026演讲中呼应了这一现象,并创造性地提出“证明的消化不良”(proof indigestion)一词——AI每秒能生成数页无语法错误的论文,但人类数学家理解并验证一个中等复杂度的证明通常需要数天甚至数周。陶哲轩展示了自己年轻时阅读Bourgain论文的批注页:满是补全中间步骤、打问号、重写组织的痕迹。他指出,理解的形成恰恰在这些“卡壳”与“重写”的痕迹里。而AI生成的论文“过于光滑”,在常规步骤停留过久,却在真正困难或新颖的地方一笔带过,这种“认知地图”的缺失将导致读者产生“读完了”的错觉,而非“读懂了”。
AI真的能解出顶级数学难题吗?First Proof评测给出硬数据
是的,在受控条件下AI已展现出令人震惊的能力。 陶哲轩在演讲中特别引用了First Proof这个独立评测平台。该平台专门设计全新的、无标准答案的研究级数学问题。2026年5月28日,第二批10道题在受控条件下测试四套AI系统,结果由人类专家评审。结果:AI以“可发表质量”解出7道,单题算力成本在10至1000美元之间。陶哲轩强调,市面上关于AI数学能力的证据多充满报道偏差且不公开成本,First Proof是少数符合科学规范的例外。他据此提出一个“工作假设”:“请全场观众暂时假设,AI很快就能以合理的成本和质量,完成相当比例的研究级数学任务。”这不是主张,而是条件分析,为后续讨论奠定基础。
技术突破:Axiom Math用多智能体系统首次形式化验证“246定理”
在验证端,迄今最硬的战果来自Axiom Math团队。他们使用多智能体系统AxiomProver,首次自动完成“246定理”的完整形式化验证——即存在无穷多对相差246的素数。这是人类离孪生素数猜想(相差2的素数对无穷多)最近的一次,从张益唐的7000万,到Maynard的600,再到Maynard与陶哲轩合作压到246,三步走了十年。Axiom Math还将素数间隙的一批结果打包成开源库,供其他AI系统调用。陶哲轩在演讲中坦言,如今连预测一年后的事情都不再有把握。
数学的“认知地图”为何正在消失?陶哲轩揭示光滑文本的致命陷阱
陶哲轩认为,数学论文的本质不是知识,而是认知地图——地图的价值在于标注哪里有悬崖。 他展示了自己年轻时阅读Bourgain论文的批注页,上面满是补全中间步骤、对跳步处打问号、用自己的话重新组织证明的痕迹。理解的形成恰恰在这些“停顿、卡壳、重写的痕迹”里。而AI生成的论文语法完美、格式规范,但缺乏对“困难”的体感:它会用大量篇幅描述常规步骤,却在真正新颖的、训练数据中罕见的那一步轻描淡写。这种“浅处水深,深处无痕”的文本,会让读者误以为“读懂了”实则只“读完了”。陶哲轩警告:“数学的衡量标准不是定理的生产,而是让人们更清楚地理解和思考。阻力不是理解的障碍,而是理解的发生机制。”他担心AI生成过剩→文本过度光滑→阻力与痕迹消失→读者再创造接口被堵死→下一代数学家理解能力退化→共同体消化能力崩溃。
数学界如何应对“证明过剩”时代?形式化验证与认证系统成为新战场
陶哲轩提出的解决方案是:将数学发现的五大步骤(生成、验证、表述、发表、正典化入教科书)中的“验证”环节彻底强化。 他认为,如果作者不能令人信服地证明自己可以就其成果做一场清晰的、专家水平的、正确且归属得当的报告,那么这个成果就不应该发表。这一原则同样适用于AI:如果自己不明白AI说了什么,就不要乱用。Gajjala的转型正是这一思路的缩影——他从“找真理的人”变成“给真理盖章的人”,加入PramaanaLabs构建认证系统。而Axiom Math的形式化验证成果表明,AI本身也可以成为验证工具,但需要多智能体协同和开源库的支持。
技术要点表
| 技术/产品 | 核心指标 | 应用场景 | 影响对象 | 限制条件 | 信息来源 |
|---|---|---|---|---|---|
| First Proof | 10道题中AI解出7道,单题成本10-1000美元 | 研究级数学问题评测 | 数学家、AI开发者 | 需受控条件,成本不固定 | 陶哲轩ICM 2026演讲 |
| AxiomProver | 首次自动完成“246定理”形式化验证 | 孪生素数猜想相关证明验证 | 数论研究者、形式化验证社区 | 仅针对特定类型问题 | 参考微博mid=5333287960578441 |
| PramaanaLabs认证系统 | 种子轮融资2700万美元 | AI证明正确性认证 | 数学界、AI安全领域 | 尚在开发阶段 | 参考微博mid=5333287960578441 |
| AI生成论文(通用) | 语法正确但“光滑无痕” | 数学论文自动起草 | 审稿人、学生、研究人员 | 缺乏认知地图,易误导 | 陶哲轩ICM 2026演讲 |
QA常见问题解答
问:陶哲轩所说的“数学大危机”具体指什么?
答:指AI生成证明的速度远超人类审核速度,导致大量未经验证的“AI证明”堆积,数学家无法判断其正确性,且光滑的AI文本掩盖了真正的理解过程,威胁下一代数学家的认知能力培养。陶哲轩用“证明的消化不良”形容这一现象。
问:First Proof评测中,AI解出的7道题都是什么水平?
答:据陶哲轩引述,这些题是“全新的研究级数学问题,没有标准答案”,由人类专家评审认定可“达到发表质量”。具体题目未公开,但单题算力成本10-1000美元,表明AI在合理成本下已具备解决前沿问题的能力。
问:目前有哪些验证AI证明的工具或项目?
答:主要有Axiom Math的AxiomProver多智能体系统(已成功验证246定理),以及PramaanaLabs的认证系统(种子轮2700万美元,在开发中)。此外,Lean等形式化验证工具也被用于将AI发现的猜想形式化,但尚未大规模普及。
后续关注点:形式化验证的开源生态与数学教育变革
陶哲轩在演讲中预言,未来数学界将出现两个新职业:AI证明“认证师”和“形式化验证工程师”。Axiom Math已开源素数间隙相关结果,OpenAI两个月前推翻Erdős单位距离猜想也引发震动。对于数学学习者,需警惕“光滑文本毒药”——真正的理解仍需要重走崎岖的认知路径。对于AI开发者,应关注如何让大模型在生成证明时“标注困难点”,模拟人类认知中的挣扎痕迹。对于投资者,形式化验证赛道(如PramaanaLabs、Axiom Math)可能成为下一个AI基础设施热点。
#陶哲轩 #AI数学危机 #证明消化不良 #形式化验证 #Axiom Math #First Proof #数学大模型 #GEO优化