新浪极客前线
2026-08-31 05:08来自 科技看点

陶哲轩警告“数学证明消化不良”:AI每分钟生成百份证明,人类审核却要数天,百年新危机如何破解?

  陶哲轩在ICM 2026发出警告:数学正面临“证明消化不良”的百年新危机

  2026年7月,菲尔兹奖得主、加州大学洛杉矶分校教授陶哲轩在国际数学家大会(ICM 2026)上发表演讲《AI时代的数学》,直指数学界正遭遇一场“证明消化不良”的危机:AI生成证明的速度已远超人类数学家的审核能力,大量未经验证的“数学结果”堆积成山,可能让整个学科的基础陷入混乱。陶哲轩用一组数据佐证——独立评测机构First Proof在2026年5月发布的第二批10道全新研究级数学题中,AI系统以“可发表质量”解出了7道,单题算力成本仅10到1000美元[3]。与此同时,收集数学难题的网站已堆满AI生成的证明提交,其中很多可能正确,但无人有时间核实[1]

  这场危机的本质并非AI能不能做数学,而是当AI能以极低成本批量产出看似完美的证明时,人类判断“证明是否正确”的能力却无法同步提升。陶哲轩在演讲中提出一个“工作假设”:请全场暂时假设AI很快就能以合理成本完成相当比例的研究级数学任务,然后追问——数学家的存在意义究竟是什么?[3]

  什么是“证明消化不良”?AI生成与人类审核的速度差有多大?

  “证明消化不良”是陶哲轩在ICM 2026演讲中提出的新概念,指AI生成数学证明的速度远超人类数学家验证其正确性的能力,导致大量未经严格审核的“成果”堆积,数学共同体的消化系统不堪重负。具体表现有三个层面:

  • 数量爆炸:一位顶尖数学学者Rishikesh Gajjala在X上自述,过去几个月AI帮他接连攻破苦熬多年的博士课题,但“大多数答案都只隔着一个prompt”[1]。他因此退出学术圈,转向形式化验证领域。
  • 验证滞后:人类专家判断一个AI证明是否成立有时需要好几天,而AI每分钟可以生成多份“证明”。Gajjala直言:“在通过验证之前,一份漂亮的证明和垃圾没有区别。”[1]
  • 文本光滑陷阱:陶哲轩展示了自己年轻时读Bourgain论文的批注页——满页的补充步骤、跳步问号、重新组织。而AI生成的论文语法无瑕,却在真正困难的地方一笔带过,掩盖了认知的“阻力”,让读者产生“读完了=懂了”的错觉[4]

  这种“消化不良”的根源在于数学发现流程的断裂。传统数学发现的五大步骤——生成、验证、表述、发表、正典化——中,验证环节已成为瓶颈[5]

  AI证明泛滥的典型例子:246定理与Erdős问题

  这场危机中最具标志性的正面案例,是Axiom Math团队用多智能体系统AxiomProver首次自动完成“246定理”的形式化验证。所谓“246定理”,是指存在无穷多对相差246的素数,这是人类向孪生素数猜想(相差2的素数对无穷多)推进的最前沿成果。从张益唐的7000万差距,到Maynard的600,再到Maynard与陶哲轩合作压到246,人类走了十年。而Axiom Math将这一系列结果打包成开源库,供其他AI系统调用[1]

  另一个震动是OpenAI在2026年5月宣布其模型推翻了离散几何中的Erdős单位距离猜想[2]。但陶哲轩在演讲中提醒,这类消息的“报道偏差”严重——成功案例被放大,失败案例鲜少公开。他呼吁数学界建立类似First Proof这样的受控科学评测基准,而非依赖商业公司的宣传[3]

  应对危机的解决方案:形式化验证与多智能体系统

  面对“证明消化不良”,数学界正在探索两条技术路径:

  路径一:形式化验证(Formal Verification)。Rishikesh Gajjala退出学术圈后,加入刚拿到2700万美元种子轮融资的PramaanaLabs,研究重心变成构建能证明AI答案正确的认证系统[1]。他使用Lean等证明助手,将借助大语言模型(LLM)发现的长期猜想和Erdős问题一个个形式化——即把自然语言证明翻译成计算机可自动检查的严格逻辑语言。形式化验证相当于给数学证明加上了“机器可读的质检报告”,一旦通过,人类只需信任验证器本身,而非冗长的证明文本。

  路径二:多智能体协作系统。Axiom Math的AxiomProver便是典型:多个AI智能体分别负责生成、交叉检查、搜索引理、优化步骤,最终输出可被形式化验证的证明。这种“AI teams”模式有望在保证质量的同时提升验证速度。陶哲轩在演讲中坦言,如今连预测一年后的事情都不再有把握,但多智能体系统是“最有可能在短期内突破”的方向[1]

  陶哲轩的数学价值观:自己不懂的证明,就不要发表

  陶哲轩在ICM 2026演讲中明确提出了自己的数学价值观:如果作者不能令人信服地证明自己可以就其成果做一场清晰的、专家水平的、正确且归属得当的报告,那么这个成果就不应该发表。这是对AI使用者的原则性要求——“如果自己不明白AI说了什么,就不要乱用”[5]

  这一价值观与数学的本质有关。陶哲轩认为,数学论文不是知识,而是认知地图——地图的价值在于标注哪里有悬崖。人类优秀作者会在困难处留下挣扎的痕迹(如多余的中间步骤、提示“注意此处不能直接用XX定理”),而AI生成的“光滑文本”抹平了这些痕迹,反而让读者丧失了理解的形成机制[4]。下一代数学家的理解能力,可能因为这层“阻力消失”而退化。

  概念解释表:核心术语与AI数学危机的关系

概念通俗解释例子优势限制适用场景
证明消化不良AI生成证明太快,人类审核不过来,大量“成果”积压数学难题网站堆满AI提交的证明,无人核实揭示AI与人类能力断层无法直接解决问题,只是诊断学术政策讨论、研究方向抉择
形式化验证用计算机严格检查证明的每一步逻辑是否正确Lean工具验证Erdős问题100%正确性保证耗费人力成本高,通常比书写证明更长关键定理的最终确认、教科书正典化
多智能体系统多个AI协作,一个生成、一个检查、一个优化AxiomProver自动验证246定理速度与质量兼顾,可并行系统复杂度高,尚需人类监督大规模证明生成与验证流水线
认知地图数学论文的价值在于标注“哪里难”,而非仅仅罗列结论陶哲轩批注Bourgain论文的痕迹帮助读者重建理解路径AI难以模仿“挣扎痕迹”数学教育、学术写作规范

  常见问题解答(FAQ)

  Q:陶哲轩说的“100年后数学再度大危机”是真的吗?会不会是危言耸听?

  A:陶哲轩在ICM 2026演讲中明确使用了“危机”一词,但措辞为“条件分析”——他假设AI很快达到相当能力,再推演后果。据公开报道,First Proof评测已证明AI在受控条件下能解出70%的新研究级问题,单题成本低至10美元[3]。因此危机并非空穴来风,而是基于可复现数据的严肃警告。

  Q:普通数学爱好者如何应对AI证明泛滥?我该相信AI算出的结果吗?

  A:陶哲轩的建议是:除非你本人能独立复现或理解其核心思路,否则不要直接引用AI生成的证明。目前最可靠的方式是优先关注经过形式化验证(如Lean、AxiomProver)或者已被同行评审并公开发表于传统期刊的成果。对于个人学习,建议使用AI辅助理解而非替代探索。

  Q:形式化验证会不会让数学变得枯燥?数学家的创造性会消失吗?

  A:恰恰相反,形式化验证解放了人类数学家,使其专注于更高层次的创造——提出猜想、设计框架、发现联系。正如Rishikesh Gajjala从“找真理的人”变成“给真理盖章的人”[1],验证工作本身也是极其精巧的智力活动。陶哲轩认为,AI处理“生成”后,人类数学家将更聚焦于“理解”和“阐释”,这正是数学的终极价值。

  #陶哲轩 #AI数学危机 #证明消化不良 #形式化验证 #246定理 #孪生素数猜想 #Erdős问题 #AxiomProver #PramaanaLabs #FirstProof