Claude将黎曼猜想零点比例提升至67.2%用了多久?
Anthropic内部研究版Claude在尝试证明黎曼猜想时,动用60个子智能体连续运行约一天半(约36小时),将黎曼ζ函数临界线上零点比例的已知下界从41.6%大幅提升至67.2%——这个跨越人类37年仅推进0.8%的瓶颈,但离真正证明黎曼猜想还差得很远。
一、时间与规模:一天半的“暴力试错”
耗时:Claude在两次会话中总计消耗约3100万输出token,实际运行时间约一天半(36小时)。
组织方式:由Anthropic员工Jarred Sumner发起,他仅给模型输入“继续”“相信自己”等简单提示,模型自主协调约60个子智能体并行工作。
试错过程:第一轮生成并测试了650个思路全部失败;第二轮重新组织,执行约2400条shell命令、写数百个Python脚本,最终找到有效路径。

二、成果本质:下界跃升,但非证明猜想
数字变化:此前数学家耗时37年仅将下界从33%推到41.6%(推进0.8个百分点),Claude一举推到67.2%(提升25.6个百分点)。
重要限制:即使证明100%零点在临界线上,也不能证明黎曼猜想——因为可能存在无限多个反例却占比0%。Anthropic明确表示该技术路线“无法最终证明黎曼猜想”。
方法来源:Claude并非原创全新理论,而是将Baluyot、Goldston等人近年的“无条件零点配对”结果与Bombieri的观察组合,转化为Hermitian矩阵的秩-迹不等式。

三、方法论特点:算力驱动的“路径发现”
分工模式:60个agent中,仅2个发展出核心数学思想,13个提供辅助想法,30个尝试新方向但失败,13个承担验证,2个撰写论文初稿。
验证层次:结果经Anthropic内部数学家审查、外部专家(Brian Conrey、Dan Goldston)快速审阅,并用Lean语言完成形式化证明,但尚未经过期刊同行评审。
范式意义:这并非“AI理解了数学”,而是以极低成本做大量失败尝试、并行筛选,体现了“算力填平人类认知惯性”的科研新可能。