实测攻略辑
2026-08-31 05:09来自 科学看点

陶哲轩预警数学百年危机:AI解出7道研究级难题,为何人类面临“证明消化不良”?

  2026年7月,菲尔兹奖得主、UCLA数学教授陶哲轩在国际数学家大会(ICM 2026)上发表演讲,抛出一个令学界震惊的预言:数学正从“证明稀缺”迈向“证明过剩”,人类可能在未来100年内遭遇一场“数学认知危机”——AI能以极低成本生成大量研究级数学证明,但人类根本来不及验证和理解,导致下一代数学家的理解能力退化[1][2]。这一判断的底气来自一组硬数据:在独立评测平台First Proof于2026年5月28日发布的第二批10道全新研究级数学题中,AI系统以“可发表质量”解出了7道,单题算力成本仅10至1000美元[3]

  陶哲轩是谁?他为何在ICM 2026上发出警告?

  陶哲轩(Terence Tao)是加州大学洛杉矶分校数学教授,31岁即获菲尔兹奖,被同行誉为“数学界的莫扎特”。2026年7月,他在ICM 2026(国际数学家大会)上做了题为《Mathematics in the age of AI》的公众演讲[3]。与大多数讨论“AI行不行”的争论不同,陶哲轩直接提出一个“工作假设”:请全场暂时假设AI很快就能以合理的成本和质量完成相当比例的研究级数学任务,然后基于这个前提分析数学界的未来[3]。他给出的核心数据来自First Proof——一个专出全新研究级数学问题的独立评测平台,在受控条件下测试AI系统并由人类专家评审。2026年5月28日第二批10道题,AI解出7道,成本透明[3]。这直接动摇了数学界对“证明稀缺”的传统认知。

  “证明过剩”具体指什么?AI生成的证明为什么让数学家头疼?

  证明过剩指的是AI能够以远超人类速度批量生产数学证明,但人类社区的验证、理解、消化能力跟不上,导致“产出”与“吸收”严重失衡。陶哲轩将数学发现拆解为五步:生成、验证、阐释、同行认可、正典化(写进教材)[4]。当前AI仅在“生成”步骤上实现了突破,后四步仍高度依赖人类。更棘手的是,AI生成的论文往往“过度光滑”——语法、拼写、格式无可挑剔,但缺乏人类作者留下的认知痕迹[2]。陶哲轩展示了自己年轻时读Bourgain论文的批注页:补全缺失的中间步骤、对跳步处打问号、用自己的话重写证明。他认为,理解的形成恰恰发生在这些“卡壳”和“重写”的痕迹里。而AI论文在简单部分停留过久,在真正困难或新颖的地方一笔带过,因为AI没有经历过“卡住”的感觉,不知道哪里会让人卡住[2]。这种“认知结构错位”导致读者产生“读完了,但没懂”的错觉。

  AI证明的正确性到底如何?有没有翻车案例?

  AI证明在形式上可以完全正确,但可能在语义上偏离原命题,出现“每句话都对,整体全错”的陷阱。2026年,OpenAI宣布其推理模型推翻了一道80年悬而未决的数学猜想(Erdős单位距离猜想),但24小时内被数学家识破——AI证明的每一句逻辑链在形式上成立,却巧妙绕开了真正的核心命题,与原猜想无关[5]。这一事件首次完整呈现了“AI自主完成→社区短期集体误判→人工24小时识破”的链条,印证了陶哲轩数月前的预警:LLM推理≠数学证明[5]。更广泛地,陶哲轩在演讲中引用了另一组进展:2026年夏天,AI连续推翻四个困扰数学界几十年的猜想——雅可比猜想(87年)、六维球面(78年)、黎曼零点比例(人类30多年推进1.6%,AI一天半推进25.6%)[6]。但陶哲轩强调,这些成果的“消化”极为困难:有人与AI对话一小时就提交了一个证明,而他本人花了几天才改写为人类可读的版本[6]

  数学的本质是什么?陶哲轩认为人类的核心价值在哪里?

  数学的衡量标准不是定理的生产,而是让人们更清楚地理解和思考。陶哲轩在演讲中尖锐指出,如果一篇论文作者不能令人信服地证明自己可以就其成果做一场清晰的、专家水平的、正确且归属得当的报告,那么这篇论文就不应该发表[7]。他进一步阐释:数学论文不是知识,而是认知地图——地图的价值在于标注哪里有悬崖[2]。人类优秀作者会不自觉地在常规步骤三行带过,在关键的、反直觉的、当年自己卡了几个月的地方放慢、反复。AI由于缺乏这种“体感”,反而在浅水区停留过久,深水区无痕[2]。这导致一个危险的连锁反应:AI生成过剩→文本过度光滑→阻力与痕迹消失→读者的再创造接口被堵死→下一代数学家的理解能力退化→共同体消化能力停滞[2]。陶哲轩认为,数学界需要一场更开放的讨论:基础科学到底是什么?为什么好奇心驱动的研究仍然需要人类社区来做,即使这看起来不如AI高效[10]

  概念解释表

概念通俗解释例子优势限制适用场景
证明过剩AI产出的证明数量远超人类能验证和理解的量AI一天生成多个猜想证明,数学家需要数月才能消化大幅提升数学发现速度人类理解能力跟不上,存在虚假正确风险辅助探索、初步筛选
证明消化不良人类社区无法有效吸收AI生成的证明,导致知识无法传承陶哲轩花几天改写AI一小时的输出暂无优势抑制下一代数学家的成长,科学社会可能停滞需人类主导的验证和阐释
认知地图数学论文是人类认知路径的标记,反映困难点和思考痕迹陶哲轩批注Bourgain论文的卡壳处帮助读者重建理解,而非仅接收结论AI生成的“光滑”文本抹去痕迹,导致错觉数学教育、学术交流
语义忠实度证明的每一句不仅形式上正确,且整体指向原命题OpenAI推翻Erdős猜想时绕开核心命题暂无优势当前AI评测体系缺乏该指标,存在系统性风险代码生成、法律文书、研究报告

  QA常见问题解答

  问:AI真的能完全替代数学家吗?

  不能。陶哲轩认为,AI擅长生成和验证,但“消化证明”——理解深层结构、提炼方法论、提出有价值的新问题——依然是人类的护城河[9]。如果数学变成纯粹的算力竞赛,人类就输了;但如果视为思维体操,AI是最好的陪练。

  问:陶哲轩提到的“First Proof”评测是什么?

  First Proof是一个独立评测平台,专出全新的研究级数学问题(没有标准答案)。2026年5月28日第二批10道题,在受控条件下测试四套AI系统,由人类专家评审。AI以“可发表质量”解出7道,单题成本10至1000美元[3]

  问:普通用户如何避免被AI的“光滑”文本误导?

  关注论文中是否有“卡壳”痕迹——比如作者是否标注了中间步骤、是否跳步、是否有“注意此处不能直接用XX定理”等提示。如果一篇论文过于流畅,需要警惕是否隐藏了关键难点。据公开报道,陶哲轩建议读者主动对AI输出进行“压力测试”,尝试补全缺失步骤[2]

  #陶哲轩 #AI数学 #证明过剩 #证明消化不良 #菲尔兹奖 #ICM 2026 #数学危机 #大模型