← 返回 Blog

告别"AI 幻觉"质疑:Claude 的 67.25% 数学推理成果获两位 Anthropic 数学家 + Conrey 联合审稿

2026年8月10日,Anthropic投出一枚重磅消息,但事情的内核远比外界所见更加耐人寻味。大众目光聚焦于67.2%:Claude将黎曼ζ函数零点占比下界从41.6%大幅提升至67.25%。整整25.6个百分点的跨越,反观过去37年间,人类数学家仅仅推进了0.8个百分点。 然而真正让这项成果拥有分量的,不是这个数字本身,而是负责核验这份结论的人。

ClaudeClaude尝试证明黎曼猜想

当审稿人曾经是纪录保持者

2026年8月10日,Anthropic投出一枚重磅消息,但事情的内核远比外界所见更加耐人寻味。大众目光聚焦于67.2%:Claude将黎曼ζ函数零点占比下界从41.6%大幅提升至67.25%。整整25.6个百分点的跨越,反观过去37年间,人类数学家仅仅推进了0.8个百分点。

然而真正让这项成果拥有分量的,不是这个数字本身,而是负责核验这份结论的人。

32年前的名字再度登场

布莱恩·康雷(Brian Conrey)。

1989年,康雷将零点占比下界推进至五分之二以上,创下当时的世界纪录。在此之后数十年,该研究方向几乎每一次重要进展,都绕不开他的名字。他不只是领域内顶尖专家,更是这条研究路线的奠基人之一。

时隔32年,康雷的名字再次出现在同一项重大成果相关的署名名单里。只是这一次,他不再是结论的推导者,而是审稿人。

Anthropic在官方公告中明确写道:"我们十分感谢该领域两位专家布莱恩·康雷与丹·戈德斯通,他们在接到通知后,在短时间内审阅了本篇论文。"数论领域的顶尖学者康雷与戈德斯通,在短周期内完成了对Claude论文的评阅工作。

⚠️ 需要明确的是,这并不等同于传统意义上经过学术期刊完整流程的同行评议。Anthropic在论文中也坦诚,作者身份和结果强度"自然会引发怀疑",并明确欢迎外界指出错误。但外部顶尖专家在短期内愿意投入时间审阅、参与核验,这本身已是极强的信任信号。

从内部核验到外部专家评审

Claude的整套论证经历了一套完整的三级核验流程。

第一层:内部数学家核验

Anthropic两名数学家莱文特·阿尔珀格、拉尔夫·弗曼研读并验证Claude得出的结论,厘清新成果与过往学术工作的关联,同时撰写非形式化说明文稿,方便外部专家快速理解结论与证明思路。

第二层:外部顶尖专家评审

康雷与戈德斯通审阅全文。康雷本人正是该下界纪录的原先创造者。当AI突破一项人类保持了32年的研究纪录,请这项纪录曾经的持有者亲自审稿,是最具备说服力的验证方式之一。

第三层:可供机器核验的形式化证明

Claude与Anthropic员工埃里克·伊斯利合作,生成能够在Lean定理证明器中完成校验的完整证明,并通过了comparator验证工具的检查——该工具会核对提交的证明是否真的对应预先给定的定理陈述,而不是偷偷换了一道更容易的题。Lean内核逐行检查每一条逻辑推导是否符合公理规则,一旦推导存在漏洞,直接判定核验失败。

三层审核同时覆盖两大维度:人类专家的理性研判,以及机器确定性的机械化校验。

"AI推演存在幻象"的质疑难以立足

"AI幻象"一直是大众不信任大模型数学推理能力的最大理由。模型有可能编造文献引用、虚构逻辑链条,产出看似通顺实则错误的推导,人类阅读者很难第一时间辨别真伪。

而Claude本次的整套工作流程,从根源上封堵了这类质疑。

第一,论文全文、附录、两组子智能体transcript完全公开。任何一名数论领域专家,都可以逐行研读、复核论证过程。

第二,Lean形式化证明可直接运行校验。你不需要主观"相信"Claude给出的任何说法,只需运行Lean程序,机器就会客观判定这份证明是否成立。机器判断具备确定性,不会疲惫、不存在主观偏见,不会遗漏任何一行逻辑。

第三,经过人类顶尖专家审阅。康雷与戈德斯通在短时限内完成评审。深耕该领域数十年的权威学者愿意投入时间审阅、参与核验,这条信号本身,远比任何宣传话术更有分量。

Claude主动提议邀请专家开展核验

一处值得单独留意的细节。

得到全新结论之后,Claude调度多个子智能体互相复核证明、搜寻潜在反例;从arXiv下载54篇学术论文,验证该结论是否早已被前人发表;并且从零出发独立重新推导一遍结论。在此之后,Claude主动将成果整理为规范论文,同时提议交由人类数论专家进行核验。

这不再是人类被动接收黑盒输出的故事,而是AI主动要求接受审计。

Claude先后构思650条失败思路,协调大约60个子智能体协同工作,执行2400条终端指令,编写数百份Python脚本,针对已知ζ函数零点开展数千次数值仿真测试,检索大量文献避免重复研究。做完这一切之后,它提出:邀请人类专家复核。

可信度的分水岭时刻

2024年AI拿下国际奥数金牌,人们感慨:AI能够求解数学难题。

2025年AI产出原创数学猜想证明,人们感慨:AI能够做出科学发现。

2026年8月,Claude更进一步:不止实现原创发现,还主动敞开接受多方审查。

内部数学家核验、外部顶级同行评审、Lean机器形式化证明、完整论文与运行日志全部公开发布,形成一套完整、可追溯、可审计的闭环。

从"AI自称完成证明",到"机器判定证明有效",再到"人类权威专家认可结论"。三重验证,最终指向同一个核心问题:这项结论是否真实成立?

1989年,康雷将下界推进至五分之二;37年后,一套AI突破了他保持多年的纪录,并且邀请他亲自审稿。

这不仅仅是一串数字的更迭,而是一套信任体系建立的全新范式。

💡 值得关注的是,这次实验本身消耗了3100万输出词元、调动60个子智能体连续运转一天半——这类高强度、长周期、多智能体并行的研究工作流,正是当下AI能力落地的一个缩影。无论是前沿数学探索,还是企业级内容生成、代码重构、大规模文档处理,背后都需要稳定、合规、可负担的模型接入能力作为支撑。

在这一背景下,UseAIAPI为需要长期、大规模调用全球主流大模型的团队提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。

平台优惠折扣最低可达官方价格的50%,让高频次接口调用、高强度内容生成的重度使用需求,也无需为高昂的成本消耗而顾虑。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。

当AI真正走入"形式化验证+多智能体协同"的研究范式,一套"无忧接入、按需扩展"的模型接入基础设施,与模型能力本身同样重要——这恰恰是UseAIAPI所致力于解决的问题。