← 返回 Blog

Claude 自己写 Lean 4 形式化证明通过机器校验,AI 数学推理首次达到可审计级别

2026年8月10日,Anthropic披露一版尚未正式发布的研究型Claude在黎曼猜想相关研究上取得突破,将零点占比下界从41.6%推进至67.25%。这本身已是亮眼成果。但真正让这件事从"AI实现一项数学发现"升级为"AI产出可审计的数学发现"的,是另一项关键进展。

ClaudeClaude在黎曼猜想相关研究上取得突破

当AI的证明能够被机器逐行核验

数学家与AI之间始终横亘着一道信任难题。

人类如何判定AI给出的结论是否成立?传统方式依靠专家审阅。但专家会疲惫、注意力会涣散,极易疏漏细节。2024年AI斩获国际数学奥林匹克竞赛金牌时,对应的证明使用人类可读的自然语言撰写,却无法借助机器对每一步逻辑开展机械化校验。

2026年8月10日,Anthropic披露一版尚未正式发布的研究型Claude在黎曼猜想相关研究上取得突破,将零点占比下界从41.6%推进至67.25%。这本身已是亮眼成果。但真正让这件事从"AI实现一项数学发现"升级为"AI产出可审计的数学发现"的,是另一项关键进展:

Anthropic内部数学家莱文特·阿尔珀格、拉尔夫·弗曼审阅了Claude的工作,理解了新结果及其与已有工作的关联。与此同时,Claude与另一名Anthropic员工埃里克·伊斯利合作,把整套证明在Lean定理证明器中完成形式化,通过了标准验证工具comparator的检验。Anthropic对外公开了附带专家注释的论文、完整运行日志,以及可直接在Lean中完成校验的完备证明文本。

这意味着什么?Claude给出的证明不再是需要人类主观采信的自然语言论述,而是一套能够由机器逐行核查的形式化代码。

Lean是什么,为何至关重要

Lean属于交互式定理证明器。简单来说,它是一套可以让计算机检验数学证明的工具。使用者用Lean代码书写数学命题,逐步搭建完整证明;Lean内核会核验每一步推导是否严格遵守逻辑公理。一旦推导存在漏洞,程序会直接判定无法通过。

传统数学证明的核验,依靠审阅者的专业能力;而Lean形式化证明的核验,依托机器确定不移的执行规则。前者存在人为疏漏风险,后者不存在。

时至2026年,AI生成Lean形式化证明的能力快速成熟。今年3月,华盛顿大学研究团队利用Gemini DeepThink推导结论,通过Claude Code把自然语言思路转译为Lean代码,并借助专用证明工具Aristotle补齐111条引理。整个项目仅由一名数学家统筹监督10天,投入成本仅200美元订阅费用,全程无需人工手写一行代码,最终得到弗拉索夫–麦克斯韦–朗道方程组平衡态一套完整、经过机器验证的形式化证明。同期,北京大学北京国际数学研究中心董彬教授课题组与合作者组建的AI4Math团队,用自主构建的自动化AI框架解决了交换代数中的Anderson猜想,并在Lean 4中完成了约19000行的形式化验证。这是国内首次以AI框架攻克交换代数开放问题并实现大规模形式化验证。

一系列案例共同指向一个判断:AI产出可被机器逐行审计的证明,已经从个案探索,演变为全球性的研究范式。

"可审计"并非营销话术

"可审计"一词在AI行业被频繁滥用,但在此处拥有精准的技术定义。

Anthropic本次采用的方案,本质搭建了一套可审计的人机协作闭环。一篇2026年6月发表的论文《面向可信Lean形式化的可审计人机回路》勾勒出这套范式:编码智能体(Claude Code)编写Lean 4代码,根据编译器报错自主修正;另一套模型开展对抗性审查,重点核查论证思路而非语法正误;人类把控研究边界与前置条件。其核心创新是持续生效的公理预算机制:把每一条结论划分成"已严格证明/条件成立/文献引用"三类,结论等级只能下调、不得随意抬升。

这套框架解决一个核心痛点:仅仅能够编译通过的证明并不足够。漏洞可能隐藏在自定义公理声明之中。单纯的编译成功,无法区分这套理论构建是合理拓展,还是建立在虚假、空洞或是过强的前置假设之上。

可审计能力代表着:你能清晰知晓AI使用了哪些公理,哪些结论严格得证、哪些附带前提条件、哪些引自前人成果。每一步推导,都支持机器二次复核

从黑盒输出,走向白盒证明

Claude围绕黎曼猜想的研究,标志一次关键转型。

过去AI输出数学结论时,人类陷入两难:要么选择相信AI,要么耗费大量时间手动复现推导。如今Claude不仅给出结论,还自主产出Lean形式化证明。这不等同于"AI声称完成证明",而是"AI写出一套代码,机器判定该代码构成合法有效的完整证明"。

尽管Anthropic内部数学家完成初审,外部数论学者布莱恩·康雷、丹·戈德斯通开展同行评议,但最终为这份证明提供最强背书的,是Lean内核——一台冷静、严苛,绝不会放过任何逻辑缺陷的机器。

2024年,我们追问AI能不能解出数学难题;

2025年,我们追问AI能不能做出原创数学发现;

2026年,我们迎来新问题:AI得出的发现,能否交由机器独立验证。

Claude给出的答案是:可以。并且它自主编写了配套核验代码。

这不只是一次功能迭代,而是信任机制的迁移:信任的根基,从"权威专家的判断"转向"机器可校验的形式化证明"。当AI的每一步推理都能由Lean内核逐行审计,"AI数学推理"一词的内涵已经彻底改写。

💡 形式化验证、多智能体协同与推理成本的大幅下降,是2026年AI科研范式变革的三股核心力量。当"机器可审计"成为科研标配,模型接入的稳定性、合规性与成本可控性,与模型能力本身同样关键。

在这一背景下,UseAIAPI为需要长期、大规模调用全球主流大模型的团队提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。

平台提供极具竞争力的优惠权益,显著降低了高频次接口调用、高强度内容生成的重度使用成本,让团队无需为高昂的消耗而顾虑。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。

当AI真正走入"形式化验证+多智能体协同"的研究范式,一套"无忧接入、按需扩展"的模型接入基础设施,与模型能力本身同样重要——这恰恰是UseAIAPI所致力于解决的问题。