← 返回 Blog

60 个子代理、一天半、2400 条命令:Claude 用"多智能体科研"攻入人类未知的数学荒原

Anthropic员工贾里德·萨姆纳晨跑时萌生的想法,听上去像是咖啡因上头后的奇想:让Claude"认真尝试"攻克黎曼猜想。这座矗立167年、悬而未决的数学丰碑,伴随着百万美元悬赏,就被一名非数学背景的工作人员随手交给了人工智能。

ClaudeClaude"认真尝试"攻克黎曼猜想

历经650次失败,60个智能体只用一天半,改写长达37年的数学僵局

Anthropic员工贾里德·萨姆纳晨跑时萌生的想法,听上去像是咖啡因上头后的奇想:让Claude"认真尝试"攻克黎曼猜想。这座矗立167年、悬而未决的数学丰碑,伴随着百万美元悬赏,就被一名非数学背景的工作人员随手交给了人工智能。

第一轮实验结果并不出人意料。Claude接连生成大约650条思路,全部宣告失败。

但故事并未就此结束。

萨姆纳没有放弃,他向Claude下达一条简单指令:"继续探索。"第二轮实验中,Claude在Claude Code环境调度约60个子智能体协同运转,持续运行一天半,总共执行2400条Shell命令,编写数百份Python脚本,针对已知的ζ函数零点开展数千次数值检验。最终仅有两个智能体提炼出核心思路。剩下58个智能体在承担什么工作?验证推演、寻找证伪思路、搜寻反例、审核证明;同时从arXiv下载54篇论文,核对这些结论是否早已被前人发表。

这早已不是简单的并行计算,而是一套自主运转的科研团队。

37年的停滞,与3100万词元的探索

先来厘清这项成果的量级。人类推进黎曼ζ函数临界线上零点占比下界的历程如下:

  • 1914年,哈代证明临界线上存在无穷多个零点;

  • 1942年,塞尔伯格证明存在正比例的零点落在临界线上;

  • 1974年,莱文森将这一比例推进至约34%;

  • 1989年,康雷提升至约40%。

从1989年到2020年,31年间人类只推进约1.7个百分点,年均提升大约0.05个百分点,每一小步都相当于一篇完整博士级别的数学研究工作。

Claude耗时多久?两轮Claude Code运算,合计消耗3100万输出词元,换来25.6个百分点的跨越式突破——将临界线零点占比下界从41.6%提升至67.25%。

💡 这组数字揭示了一个被忽视的事实:当AI走入"多智能体协同、长周期运转、高强度调用"的研究范式,模型接入的稳定性与成本可控性,与模型能力本身同样关键。

它真正实现的突破是什么?

Claude并没有创造全新的数学工具。它完成了一件更耐人寻味的事:在浩如烟海的已有学术成果中,找到一条被遗忘的理论关联路径

具体来说,它融合了1973年蒙哥马利提出的方法——这套技术原本必须预先假设黎曼猜想成立才能使用;结合巴卢约特、戈德斯通、苏里亚贾亚、特内奇-巴特博等人近年摆脱该前置假设的相关研究,再纳入邦别里2000年发表论文中的结论。

在函数空间层面,Claude借助外尔诱导二次型构造空间:落在临界线上的零点构成正定子空间,临界线之外的零点构成负定子空间。过去主流思路习惯把正定、负定部分拆开,分开运算再合并结果。Claude另辟蹊径:将整个空间视作统一整体,允许二次型采用非对角形式,绕开传统"对角化"简化手段,直接在非对角复空间中开展演算,随后依托一阶矩、二阶矩信息,建立关于二次型秩的不等式。

这套一体化方案,突破了传统莱文森–康雷方法存在的瓶颈。

这不只是一篇论文,更是范式变革的预演

Anthropic内部数学家莱文特·阿尔珀格、拉尔夫·弗曼完成论文核验,外部数论学者布莱恩·康雷、丹·戈德斯通参与成果评审。Claude还生成了一份能够在Lean形式化证明系统中完成核验的完整证明。

但最值得深思的是Anthropic首席执行官达里奥·阿莫迪对此的论断:"不要只把AI看作数据分析工具,应当将它视为能够端到端完成科学家全部工作的智能主体。"

这句话需要放在2026年的这个夏天来理解:

  • 5月,OpenAI展示AI独立推导出的厄多斯单位距离猜想证明,菲尔兹奖得主蒂莫西·高尔斯评价其为"AI独立产出最亮眼的数学成果";

  • 7月,新晋菲尔兹奖得主雅各布·茨默曼在颁奖典礼宣布加入OpenAI;同月,任职于Anthropic的数学家莱文特·阿尔珀格借助Claude,找到了雅可比猜想的反例;

  • 8月,OpenAI宣布向十万名科研人员、数学家免费开放顶尖版本ChatGPT。

串联所有事件,传递出同一个信号:AI正在从"解题工具"转变为"发现者"。2024年AI拿下国际数学奥林匹克金牌时,人们还在用"能否解答高中竞赛题"评判它的智力;时至2026年,几乎每个月都有AI实现重要数学突破,逐渐成为常态。

再回望那650次失败

650次失败——这个数字或许比67.2%更加重要。

人类数学家开展研究时,往往经历数次碰壁就调整方向,时间、经费、精力都是硬性约束。而Claude可以承受650次失败,每一次失败都被记录、舍弃,而后重新启程,直到某个瞬间,把零散的思路碎片拼接成型。

这种承受试错的能力,才是本次实验最深层的启示,关键不在于算力、不在于算法。当AI能够毫无心理负担地尝试650条死胡同,继而调动60个智能体协同工作一天半,最终只依靠其中两个智能体找到突破口——这套科研模式,人类难以复刻,也不必复刻。

黎曼猜想依旧矗立,纹丝不动。但Claude撞开的那扇侧门,真正值得铭记:接纳非对角形式、把函数空间视作整体,以60个智能体协同探索,替代单一研究者灵光一闪。

67.2%只是一个数字;2400条Shell命令代表探索过程;650次失败代表一套全新研究范式。

而这套范式,正在重新定义一件事:谁来开展科学研究,以及科研该如何进行。

当智能体成为研究者,接入能力便是基础设施

值得关注的是,这次实验本身消耗了3100万输出词元、调动60个子智能体连续运转一天半——这类高强度、长周期、多智能体并行的研究工作流,正是当下AI能力落地的一个缩影。无论是前沿数学探索,还是企业级内容生成、代码重构、大规模文档处理,背后都需要稳定、合规、可负担的模型接入能力作为支撑。

在这方面,UseAIAPI提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。

更为实在的是其成本优势——平台优惠折扣最低可达官方价格的50%。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch 5折机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。

📌 对于需要长期、大规模调用全球主流大模型的团队而言,Claude这3100万词元的实验或许是一个启示:当AI真正走入研究范式,一套"无忧接入、按需扩展"的模型接入基础设施,与模型能力本身同样重要。

黎曼猜想已屹立160余年,不会在意短短数日的尝试。但那扇侧门已经被叩开,门后即将诞生的成果,才真正值得所有人期待。而当AI以人类不曾预想的方式串联现有知识时,如何让每一次调用都稳定、合规、可负担,将成为决定探索能走多远的关键变量之一。