虎嗅

Claude挑战黎曼猜想失败,却刷新了沉寂数十年的数学下界

该文章尚未提供 한국어 解读,以下为中文版内容。

核心内容总结

Anthropic未发布的科研版Claude在尝试证明黎曼猜想(一个167年未解决的数学难题)时,虽未成功,但意外将“能无条件证明位于临界线上的黎曼zeta函数零点比例下界”从41.6%提升到67.2%。更关键的是,这次突破不是AI在已知答案的题目上“答题”,而是通过多Agent协作、组合跨年代文献、大量试错验证等方式,展示了AI在开放科研场景中的能力——从“科研工具”向“科研Agent”转变。

详细拆解

1. 67.2%不是“黎曼猜想完成度”,而是“已知零点下限的大飞跃”

黎曼猜想是说:黎曼zeta函数的所有关键零点都落在复平面的“临界线”上(简单理解,这条线和素数分布密切相关)。但人类暂时无法证明所有零点都在这条线上,于是退而求其次:至少能证明多少比例的零点肯定在这条线上?这就是“零点比例下界”。

过去100多年,数学家们把这个比例从“无穷多”(但不知道占比)推进到41.6%(2020年)。这次Claude把它提到了67.2%——意思是:现在可以确定,至少67.2%的零点在临界线上,但剩下的32.8%是否在?不知道。这不是猜想完成了67.2%,只是我们能“打包票”的部分变多了。

更牛的是,Claude没用传统的Levinson方法,而是把1973年Montgomery的思想重新组合,绕开了之前的技术瓶颈。

2. 突破不是“造新数学”,而是“把散落的工具拼起来”

Claude的成果不是凭空创造新理论,而是把过去几十年分散在不同论文里的数学工具“拼”在了一起。比如它借鉴了Baluyot、Goldston等人对Montgomery方法的改进,以及Bombieri关于Weil厄米型的研究。

为什么人类没早想到?因为人类研究者受时间、精力限制,很难读完所有相关文献,更难把跨年代、跨领域的方法组合起来。AI的优势就是能处理海量文献,找到人类忽略的连接点——这次突破的关键,就是Claude敢把“线上零点”和“线外零点”放进同一个数学结构里处理,而之前人类可能觉得这样做太复杂。

3. 像一支AI科研团队:650次失败+60个子Agent分工

这次研究的流程比结果更震撼:

  • 试错规模:Claude先试了650个想法,全失败了;然后用60个子Agent分工协作——2个负责核心思路,13个提供辅助想法,30个探索新方向(全失败),13个验证对错,2个写论文。
  • 工作量:执行2400条命令、写数百个Python脚本、做数千次数值检查,总共输出3100万token(相当于写了10本长篇小说)。
  • 自我验证:找到结果后,Claude还主动下载54篇论文查重复,让不同Agent互审,甚至生成了形式化证明(通过工具验证)。

这和传统AI“答题”完全不同——它像一个真实的科研团队,在未知领域里持续试错、协调分工、自我纠错。

4. 别吹过了:AI还没成为“独立科学家”

虽然成果亮眼,但要清醒看待:

  • 结果未完全验证:Anthropic邀请了几位专家审阅,但还没经过数学界的完整同行评议(这是科学成果被认可的关键步骤)。
  • 方法有天花板:用当前方法,最多只能证明约68.185%的零点在临界线上,想突破70%需要新的数学工具,不是线性提升。
  • 定位是辅助:Claude的成果是“意外副产品”(原本想证明黎曼猜想),它还需要人类科学家来判断方向、验证结果——AI不是替代人类,而是帮人类干“脏活累活”。

5. 产业信号:AI瞄准科研预算,从工具变Agent

这次实验对产业的意义远大于数学本身:

  • 科研AI的进化:过去AI是工具(检索论文、写代码),现在变成“Agent”——能持续追踪目标、分派任务、调整方向,像一个自主的小团队。
  • 商业价值:科研是高溢价领域(药物、材料、数学等),真正的价值是“降低探索未知的成本”。如果AI能把人类没时间做的试错、文献组合自动化,就能帮科研机构省大量钱,而不是只做办公软件。
  • 未来场景:AI不会突然变成爱因斯坦,但会成为人类科学家的“超级助手”——处理耗时的试错、文献检索、验证,人类负责选问题、抓重点。

最后一句话总结

Claude没攻克黎曼猜想,但它证明了AI已经能走进科研的“无人区”——试错、组合、协作,这是AI从“聊天机器人”向“科研伙伴”转变的关键一步。未来,AI可能不会单独拿诺奖,但会让人类科学家的效率翻好几倍。