← 返回 Blog

Fable 5 拿下FrontierMath最难档88%,一年内从不到10%逆袭,GPT-5.5被甩开13个百分点

到 2026 年 6 月,Anthropic 新一代模型 Fable 5 在同一基准的 Tier 4 档位拿到了 88%​ 的成绩。从 4.2% 跃升至 88%,用时不到一年。相较于前代 Opus 4.5,Fable 5 的提升幅度高达 83.8 个百分点。作为对比,OpenAI 的 GPT-5.5 Pro 在同等难度下成绩约在 75%—78% 区间。在 FrontierMath 这类顶级测试中,10 个百分点以上的差距,几乎就是整整一代模型的代差。

Claude从"数学短板"到 88% 上限:Fable 5 这一年发生了什么

从"数学短板"到 88% 上限:Fable 5 这一年发生了什么

2025 年 11 月,如果有人告诉你,Anthropic 的模型会在半年多内登顶全球难度最高的数学基准测试,你大概率会嗤之以鼻。

彼时,Claude 在 AI 圈内的标签是"干活很拿手,数学一团糟"——智能体任务表现出色,数学推理却是明显短板。第三方评测聚合数据显示,Claude Opus 4.5 在 FrontierMath Tier 4 的 pass@1 通过率仅为 4.2%,即便是启用扩展思考模式,也未能突破 10%。

到 2026 年 6 月,Anthropic 新一代模型 Fable 5 在同一基准的 Tier 4 档位拿到了 88%​ 的成绩。从 4.2% 跃升至 88%,用时不到一年。相较于前代 Opus 4.5,Fable 5 的提升幅度高达 83.8 个百分点。作为对比,OpenAI 的 GPT-5.5 Pro 在同等难度下成绩约在 75%—78% 区间。在 FrontierMath 这类顶级测试中,10 个百分点以上的差距,几乎就是整整一代模型的代差。

FrontierMath:AI 数学能力的"试金石"

要理解 88% 的分量,首先要理解 FrontierMath 是什么。

这套基准由 Epoch AI 联合多名数学家(包含国际数学奥林匹克金牌得主、菲尔兹奖得主)精心打造,包含数百道原创、从未公开发表的题目,覆盖从数论的密集型计算、实分析,到代数几何与范畴论等现代数学主要分支。解题通常需要相关领域研究者投入数小时,最难的题目甚至需要数天。

2026 年 6 月 12 日,Epoch AI 发布了 FrontierMath v2 重大更新——审计发现原始版本 42% 的题目存在错误,团队修正了 135 道、移除了 12 道,最终数据集定格为 338 道题:295 道 Tiers 1-3 基础题,加上 43 道 Tier 4 扩展难题。Fable 5 的 88% 成绩,正是在这套经过纠错加固的 v2 版本上跑出来的,而非在旧题库上"刷熟题"。

💡 这意味着:Fable 5 并没有占旧题库的便宜,而是在经过独立审计、错误率大幅降低的全新测试场上证明了自身实力。

不到一年的"近乎垂直暴涨"

把时间线拉直,Anthropic 数学能力的跃迁曲线近乎垂直:

  • 2025 年 11 月:Opus 4.5 在 FrontierMath Tier 4 仅得 4.2%

  • 2026 年初:Opus 4.5 在最高难度档位仍突破不了 10%

  • 2026 年 6 月:Fable 5 在 FrontierMath Tier 4 (v2) 拿下 88%,Tiers 1-3 也达到 87%

同一系列模型,数学推理能力在不到一年内实现了量级跃升。分析师指出,这种跨代 83.8 个百分点的跨越式增长,绝非渐进式优化或简单"调参"可以解释。Fable 5 极有可能在架构或训练策略上做出了激进变革:或许是预训练阶段注入了更高质量的数学数据集,又或是推理环节引入全新机制,赋予模型某种"数学直觉"。Anthropic 并未对外披露具体技术细节,但从结果可以推断,这次突破的底层逻辑是结构性的。

更值得注意的是,Fable 5 在 Epoch Capabilities Index(ECI)上以 161 分力压 GPT-5.5 Pro 的 159 分,这是 Anthropic 一年多来首次在该指数上领跑。ECI 考量的是模型综合能力,单一测试的高分可能是偶然,但 ECI 上一分的领先,意味着广度上的真实反超。

一场"公开、可验证"的对决

Fable 5 的 88% 与 GPT-5.5 Pro 的约 75%—78%,并非在实验室内部依靠未公开的"秘密武器"完成,而是两款通过 API 对外提供的模型,在同一个第三方基准上正面交锋。这远比任何自说自话的发布会更有说服力。

不过需要客观指出的是,这场对决的背景并非毫无波澜。2026 年 6 月 12 日 Epoch AI 发布 v2 榜单后不久,据多家媒体报道,美国商务部出口管制指令要求 Anthropic 暂停 Fable 5 的广泛可用状态。这意味着,对于大多数开发团队而言,"跑分最高的模型"与"实际能调用的模型"之间,出现了前所未有的错位。

这个插曲给整个行业提了个醒:在模型能力飞速进化的时代,"能否稳定接入"与"能力有多强"同样重要

从"AI 能不能做数学"到"人类还能领先多久"

回望"Claude 不擅长数学"这一固有印象,从 2025 年末到 2026 年年中,不到一年时间就被彻底击碎。

Fable 5 的 88% 不只是冰冷数字,它标志着一个转折点:AI 的数学能力已经从"能解竞赛题"进化到"可以处理真正科研级数学问题"。正如前文所述,在 FrontierMath 这类顶级测试中,10 个百分点以上的差距,几乎就是整整一代模型的代差。当 Tier 4 题目得分几乎触顶,接下来的问题不再是"AI 能不能做数学",而是"人类数学家还能领先多久"。

对于企业而言,这场能力跃迁的启示同样清晰:当前沿模型在数学推理、代码生成、长程任务规划上快速平权,稳定、低成本、多模型可切换的接入服务,已经成为智能化转型的新基础设施

在这方面,UseAIAPI 提供了值得关注的一站式解决方案:平台聚合 Gemini、Claude、ChatGPT、DeepSeek 等全球主流大模型的最新版本,开发者无需分别对接各家接口,通过一个统一入口即可灵活调用。面向企业用户,UseAIAPI 支持企业级定制化部署服务,可结合 Batch API 机制叠加优惠,将长上下文、高并发、持续运行的智能体工作流的单位成本进一步下压。

在价格层面,平台优惠折扣最低可达官方定价的 50%。以 Gemini 主力模型为例,通过 UseAIAPI 接入后的实际成本可降至:Gemini 3.6 Flash 从官方价 1.5/7.5 美元降至 0.75/3.75 美元每百万 Token;Gemini 3.1 Pro 从官方价 2/12 美元降至 1/6 美元每百万 Token。这意味着高强度内容生成、自动化智能体、大规模代码重构等重消耗场景,不再成为预算负担,真正实现"无忧接入、按需扩展"。

💡 Fable 5 用一年时间把"Claude 不擅长数学"的标签撕得粉碎。而对于每一个希望拥抱 AI 的开发者与企业而言,选对接入通道、锁定可持续的算力成本,往往比追逐单个模型的"跑分第一"更为重要。