
半年三轮连续突破
2026年3月至8月的不到半年内,Claude在数学领域接连完成三项数十年来无人实现的成果。
3月,88岁的图灵奖得主唐纳德·克努特在斯坦福官网发布论文,开篇便写下"Shock! Shock!"——一道困扰他数周的图论公开难题,被Claude Opus 4.6通过31次探索迭代给出适用于所有奇数情形的构造方案。
7月19日世界杯决赛之夜,Anthropic研究员、哈佛大学数学家莱文特·阿尔珀格在社交平台X公布:存在87年悬案的雅可比猜想,Claude Fable 5找到了一则三元多项式反例。
8月10日,一份尚未公开发布的Claude研究版本尝试攻克黎曼猜想,虽未能达成目标,却将黎曼ζ函数临界线上零点占比的下界,从41.6%提升至67.2%。
三项成果,来自三个不同模型版本,对应三类时间跨度从数周到数十年的数学难题。短短不到半年,Claude在数学领域实现三次重大突破。
三月:克努特笔下的"Shock! Shock!"
把视线先拉回3月。
克努特正在撰写《计算机程序设计艺术》全新章节,遇到一道有向哈密顿环相关难题。题目条件并不晦涩:一个m×m×m的立方网格,每个顶点连接三条边;需要找出三条哈密顿回路,每条回路长度为m³,能够恰好覆盖全部边。问题解集规模达到3^(m³)种路径,暴力穷举完全行不通。
克努特求解出m=3的特例,却在推广到一般情形时陷入僵局,该问题被搁置数周。他的朋友菲利波·斯塔佩斯借助OR-Tools等工具验证了特定偶数情形,但通用构造方法始终未能找到。
随后Claude Opus 4.6在大约一小时内展开了31次有引导的探索:引入商映射将顶点划分为不同的"纤维层",提出"蛇形构造"方法,并从早期失败记录中提取出隐藏规律——选择走哪个方向只需看其中一个坐标。最终在第31次探索时,找到了适用于所有奇数情形的构造方案。
克努特在此基础上完成严谨数学证明,发表题为《克劳德环》(Claude's Cycles)的论文,并在文末写道:"为Claude脱帽致敬!"
💡 这并非AI在已知数据集上刷题冲分。一位深耕算法著作五十载的图灵奖得主,在自己的研究工作中被AI补齐关键环节。这套由Claude提出的构造方法,被克努特正式写入学术论文——这也是生成式AI的结论首次被正式纳入数学研究成文记录。
七月:世界杯决赛夜的反例
7月19日,恰逢世界杯决赛当晚。
阿尔珀格与好友阿希尔·马修探讨雅可比猜想。该猜想自1939年由德国数学家凯勒提出后,历经87年始终悬而未决。猜想描述一个看似简单的命题:若多项式映射在局部处处满足"无折叠"条件(雅可比行列式为非零常数),那么整体映射必然是一一对应的?
学界戏称这道题为"民科坟场":无数研究者被它吸引,最终陷入漫长却徒劳的推导。知名华人数学家张益唐博士阶段便投入该问题研究,无果之后转向解析数论方向。
阿尔珀格把题目交给Claude Fable 5,让模型在世界杯决赛直播期间持续推演搜索。最终模型找到一组三元多项式映射:雅可比行列式恒等于-2(非零常数),完全满足猜想所有前提条件,却将三组不同输入映射至同一个输出结果。
短短216字符的反例,推翻存续87年的猜想。
消息公开后,数学界迅速开展核验。斯坦福科技评论等报道,该反例在发现后短时间内已在证明辅助语言Lean中完成机器验证;多位数学家包括斯坦福大学数论学家贾里德·杜克·利赫特曼及加州大学洛杉矶分校教授陶哲轩都公开撰文确认运算无误。OpenAI研究员Aaron Lou随即证实,公司内部一个Codex模型版本在完全没有连接网络搜索、也未使用额外工具的情况下,一次性独立推导出本质相同的反例。
⚠️ 需要明确的是:该反例适用于三维复数空间,并可扩展到所有更高维空间;二维版本仍然悬而未决,猜想未被完全终结。
伦敦玛丽女王大学数学家阿比舍克·萨哈评论:"这大概是AI在数学研究中起到核心作用、意义最为重大的猜想求证事件。影响深远。过去一年,AI取得的进展超乎想象。"
八月:3100万词元与67.2%的突破
8月10日,Anthropic正式公布第三项重磅进展。
整件事的缘起听起来近乎荒诞:员工贾里德·萨默晨跑时突发灵感,给Claude布置任务:尝试证明黎曼猜想。
黎曼猜想1859年提出,历经167年无人攻克,克雷数学研究所悬赏100万美元征求证明。Claude最终没能完成证明——其实没有人期待一次尝试就能攻克世纪难题。但在推演过程中,模型推进了一项相关核心问题的边界记录。
实验中,模型搭建约60个子智能体,依托Claude Code持续运算一天半,执行2400条终端指令,编写数百个Python脚本,针对已知ζ零点进行数千次数值检查。不同子智能体之间还会互相审阅结果。最终仅有两个智能体推导出核心思路,全程合计消耗3100万输出词元。
按照Anthropic的说法,萨默在这一阶段几乎没有提供数学上的指导。他主要做的事情,是不断告诉Claude"继续""再试试""相信自己"。最终成果:黎曼ζ函数临界线上零点占比下界,由41.6%提升至67.2%(精确优化常数为0.6725)。在此之前,人类数学家耗费37年,仅把这个指标向前推进0.8个百分点。
Anthropic着重说明:这项结果无法对黎曼猜想本身给出任何决定性佐证或否定结论。67.2%不等于"完成了67.2%的证明",它只代表一条确定结论:临界线上至少存在占比67.2%的非平凡零点。公司也明确不预期这些技巧能直接通向黎曼猜想的完整证明。
真正值得关注的,是这条结论如何诞生。Claude融合1973年确立的蒙哥马利理论(该方法原本必须依托黎曼猜想成立作为前提),结合巴卢约特、戈德斯通等人近年摆脱该前置假设的研究成果,同时参考邦比耶2000年发表的论文,走出一条全新推导路径:构造由韦尔诱导二次型定义的函数空间,临界线上的零点构成正定子空间,临界线以外的零点构成负定子空间;将整个空间视作统一整体,允许二次型采用非对角形式,依托一阶、二阶矩信息建立关于二次型秩的不等式。相关推导流程完整记录在论文之中。
由Anthropic内部数学家莱文特·阿尔珀格、拉尔夫·弗曼完成初审,员工埃里克·伊斯利协助把证明写成可由Lean定理证明器校验的形式,外部数论专家布莱恩·康雷、丹·戈德斯通完成复核。正是康雷在1989年率先将该下界突破五分之二;32年后,他创下的纪录被AI打破,同时受邀参与成果评审。
从31步、216字符,到67.2%
三项突破,处于完全不同的研究量级。
3月,Claude为图论猜想提供构造思路,克努特补足完整证明。这是AI辅助科研发现。
7月,Claude找到雅可比猜想反例,直接推翻存续数十年的猜想。这是AI独立完成科学发现。
8月,针对黎曼零点下界问题,Claude刷新保持数十年的数学纪录,产出可核验、通过人机双重评审的严谨推导。这是AI自主开展前沿数学研究。
不到半年三轮接连攻坚。模型各不相同、问题类型各异、难度层级跨度巨大,却指向同一个趋势:AI正在从单纯的解题工具,转变为具备原创能力的发现者。
2024年,人们探寻AI能不能解决数学难题;
2025年,人们探寻AI能不能做出原创发现;
2026年,新的疑问应运而生:AI的下一次重大突破,将会落在何处?
当"AI+数学研究"成为常态,模型接入便是另一道门槛
半年三轮数学突破折射出一个朴素的行业真相:当AI真正走入前沿科研,无论是数学推理、长链条论证,还是多智能体协同与形式化验证,背后都需要稳定、合规、可负担的模型接入能力作为支撑。
对于需要长期、大规模调用全球主流大模型的科研团队与企业而言,频繁遭遇地区可用性门槛、账号风控、跨境支付与多平台对接的摩擦,本身就是一个隐性成本。在这方面,UseAIAPI提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。
平台提供极具竞争力的优惠权益,折扣可达官方价格的50%,显著降低了高频次接口调用、高强度内容生成的重度使用成本,让团队无需为高昂的消耗而顾虑。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。
📌 当AI从"解习题"迈向"开展学术研究",一套"无忧接入、按需扩展"的模型接入基础设施,与模型能力本身同样重要——这恰恰是UseAIAPI所致力于解决的问题。
31步探索、216字符反例、67.2%下界——三组数字背后,是AI科研范式迁移的三个坐标。而真正决定科研团队能在这条新范式上走多远的,除了模型能力本身,还有让每一次调用都稳定、合规、可负担的接入底座。