
世界杯决赛当夜,AI推翻存在87年的数学猜想:Claude Fable 5与Gemini三箭齐发的路线之争
世界杯决赛进入加时赛阶段时,哈佛大学数学家、Anthropic研究员莱文特·阿尔珀格(Levent Alpöge)在X平台发布了一则仅216字符的帖子。没有正式论文,没有预印本,也没有长达上百页的证明过程,只有三行公式。
帖子里一句话被不断引用:感谢我的挚友Fable——这里指Anthropic的Claude Fable 5模型。世界杯决赛当晚,该模型持续推演搜索,最终找到了反例构造方案。
1939年提出的雅可比猜想,就此可能被推翻。
💡 需要客观指出的是:截至发稿,该结果仍停留在社交媒体公开阶段,尚未发布arXiv预印本,也未经过学术同行评审。但雅可比行列式是否恒为-2、三个不同点是否映射到同一点这两项核心验证,已通过Wolfram Alpha、SymPy等工具的公开计算独立确认。
"数学推演机器"发现的漏洞
雅可比猜想由德国数学家凯勒于1939年提出,也被列入斯蒂芬·斯梅尔"21世纪数学问题"清单。通俗解释:设想一组多项式映射,如果它在所有局部区域都平滑可逆,也就是雅可比行列式恒为非零常数,那么整体映射同样具备可逆性。
这个猜想看上去十分符合直觉,过去87年间,几乎所有数学家都试图证明它成立。期间至少有五组研究者宣称完成证明,但后续均被查出存在漏洞。众多顶尖数学家耗费大量精力钻研该问题,因孪生素数猜想闻名的张益唐也不例外,他的博士论文研究主题正是雅可比猜想。
Fable 5给出了一个极简反例:一组从三维复空间映射至三维复空间的多项式,其雅可比行列式恒等于-2,完全满足猜想的前提条件。然而代入三组不同输入——(0,0,-1/4)、(1,-3/2,13/2)、(-1,3/2,13/2)——却得到完全相同的输出(-1/4,0,0)。面对同一个输出结果,人们无法判定它究竟源自哪一组原始输入。
后续分析证实,该映射属于典型的"三对一"映射。三维情形被证伪后,四维、五维乃至更高维度版本的猜想自然随之失效。二维版本目前依然悬而未决,这也是雅可比猜想仅剩的最后一道防线。
斯坦福大学数学系助理教授贾里德·杜克·利赫特曼(Jared Duker Lichtman)转发称这一结果"相当惊人",并将署名写作"Alpöge、Mathew和Claude Fable 5";伦敦玛丽女王大学数学家阿比舍克·萨哈评价:"这或许是迄今为止,AI发挥核心作用攻克的最大数学猜想。"《新科学家》杂志也给出相近评价:"这是目前AI解决过难度最高的数学难题。"
Fable 5究竟是什么
Fable 5是Anthropic在2026年6月9日推出的第五代模型,与Claude Mythos 5共享同一底层架构——后者取消部分安全分类器,仅通过"Project Glasswing"计划向受信任的网络安全、生物等合作伙伴开放。Fable 5则是首个面向公众开放的"Mythos级"模型,在敏感领域会自动路由回Claude Opus 4.8处理。
定价为每百万词元输入10美元、输出50美元,约为Opus 4.8的两倍,但不到此前Mythos Preview的一半。Anthropic称其为公司对外发布过最强模型,专门面向长周期、高复杂度任务打造。1M词元上下文窗口,单次请求最多输出128K词元。
实测数据印证这一定位:
SWE-Bench Pro(智能体编程):80.3%,对比Opus 4.8的69.2%、GPT-5.5的58.6%;
Terminal-Bench 2.1:88.0%;
在 FrontierCode 等高难度编程评测中,Fable 5不仅得分领先,且随着推理算力投入增加而持续攀升,旧模型则早早进入平台期。
Anthropic披露的典型案例是:Stripe使用Fable 5在一天之内完成了横跨5000万行Ruby的代码库级迁移,人工估算原本需要一个完整团队两个多月。
谷歌连夜推出三款"节能型"模型
就在Fable 5在数学界掀起巨浪之际,谷歌处境不容乐观。2026年7月21日,谷歌DeepMind一次性发布三款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。万众期待的旗舰版本Gemini 3.5 Pro依旧缺席,Gemini 4的预训练工作刚刚启动。
在这场持续被竞品赶超的夏日,谷歌给出的应对方案是:推出更低价的经济型模型。
Gemini 3.6 Flash输出词元消耗量降低17%,在DeepSWE这类长周期工程任务中,单任务输出词元从276K降至97K,最高可节省65%开销;输出单价由每百万词元9美元下调至7.5美元。硬性指标同步小幅上涨:DeepSWE得分自37%提升至49%,MLE-Bench由49.7%上涨至63.9%,OSWorld-Verified从78.4%提升至83.0%,GDPval-AA v2从1349升至1421。
但第三方评测机构Artificial Analysis给出的一组数据,让"效率叙事"露出尴尬一面:3.6 Flash的智力指数仅拿到50分,与前代3.5 Flash持平。开发者实测发现,生成三层以上嵌套React/Vue组件时,标签闭合错误率高达42%,前端能力饱受诟病。在Artificial Analysis速度榜上,3.6 Flash以每秒275.5词元位列第二,仅次于每秒350词元的3.5 Flash-Lite。
另一款Gemini 3.5 Flash-Lite走极致性价比路线:每秒生成350词元,输入单价每百万0.3美元,输出2.5美元,Termina-Bench 2.1从31%跃升至54%,GDPval-AA v2从642翻倍至1140。第三款Gemini 3.5 Flash Cyber专门针对网络安全漏洞挖掘场景优化调参,通过CodeMender智能体提供服务,目前仅向政府与受信合作伙伴开放限量试点。
效能路线 VS 智能路线,两大方向正面交锋
Fable 5取得数学突破、谷歌集中推出经济型模型,两件事发生在同一个月绝非巧合。
Fable 5展现出高智能模型在科研领域独有的价值:它解决的不只是工程任务,而是困扰人类数学家近90年的基础理论难题。正如Anthropic所定位的——"任务越长、越复杂,Fable 5相较于其他模型的领先优势就越大"。
谷歌Flash系列则印证另一个事实:当AI迈入大规模落地阶段,成本就是难以替代的核心竞争力。第三方测算显示,在3.6 Flash上跑一个多步骤编码智能体,原本10美元的会话成本可降至3美元左右;Flash-Lite让高并发分类、抽取、路由等业务更便宜。
两条路线本身并无对错。Fable 5定位是攻克最难的问题;Flash系列目标是以最低成本承接海量任务。但关键问题在于,当对手不断冲击能力上限时,你却选择打磨成本下限——这一选择本身,就已经区分出进攻方与防守方。
谷歌押注"效率本身就是一种智能"。可世界杯决赛当夜,Fable 5抛出的那三行公式提醒所有人:有一部分高阶智能价值,无法仅仅依靠节省词元成本实现。
让全球主流大模型能力,以更优成本触手可及
Fable 5的数学突破与Gemini三款新模型的效率革命,清晰地传递出一个信号:全球主流大模型正在分化为"智能极限突破"与"规模落地降本"两条赛道并行演进。但对于广大国内企业而言,想要同时顺畅调用Claude Fable 5、Gemini 3.6 Flash、GPT、DeepSeek等全球最新模型能力,仍面临跨境访问不稳定、多模型分别对接成本高、企业级集成门槛高等现实难题。
在这一背景下,UseAIAPI提供了一个稳健的解决方案:
顶尖模型一站式接入:单一接口无缝调用GPT、Claude(含Fable 5与Opus 4.8)、Gemini(含3.6 Flash与3.5 Flash-Lite)、DeepSeek等全系120+主流与前沿模型,官方能力秒级同步,让业务永远保持领先;
价格优势显著:平台优惠折扣低至官方价格的50%。以Fable 5输出定价50美元/百万词元计算,通过UseAIAPI调用实际成本可压缩至约25美元/百万词元;Gemini 3.6 Flash输出价7.5美元/百万词元,折后仅约3.75美元——这意味着即便是Fable 5级别的"神话级"算力,企业也能以可接受的成本用于生产环境;
企业级定制化服务:支持业务系统直接接入,提供稳定、合规、可控的调用环境,免去自行搭建和维护的繁琐;
灵活的多模型路由:企业可按任务复杂度自由匹配最优性价比模型——攻克高难度科研、复杂推理任务调用Claude Fable 5;高并发低延迟业务路由至Gemini 3.6 Flash、Flash-Lite或DeepSeek;日常智能体工作负载选用Claude Sonnet 5。借助Fable 5与Gemini 3.6 Flash的"effort调节"能力,配合平台的精细化路由,可将综合成本进一步压低。
从Fable 5用"神话级智能"推开数学新边界,到Gemini用"效率革命"重塑成本曲线,再到企业通过统一、稳定、可控的接口调用全球顶尖模型,AI生产力的最后一公里正在被打通。
世界杯决赛当夜那三行公式留给行业的启示远不止数学层面——真正的竞争优势不再仅仅是"是否使用了最强的AI",而是"能否以合理的成本、稳定的服务,将最合适的模型匹配到最合适的任务"。这或许才是这场"智能路线与效能路线"正面交锋,留给每一位AI从业者的深远启示。