
从不足10%到88%:Fable 5的数学跃迁,与算力平权的时代底色
2026年6月初,Epoch AI公布一组测试数据:Claude Fable 5在FrontierMath基准测试的Tiers 1-3题目上准确率达87%,最难度的Tier 4(v2版本)得分达到88%。同一张图表里,OpenAI的GPT-5.5在同一难度下约为75%。在FrontierMath这类被公认为AI数学推理领域最难的基准测试中,13个百分点的差距,意味着模型能力之间存在着难以忽视的代差。
但让业内人士真正倒吸一口凉气的,并不是这13个百分点,而是另一组数字——78个百分点。
2026年初,Anthropic上一代旗舰Opus 4.5在FrontierMath Tier 4上得分尚不足10%。短短不到半年,同一系列模型从个位数一跃冲到该基准最高难度的近天花板水平。这78个百分点的内部代际跃升,比任何横向对比都更有说服力:这不是渐进式优化,而是底层能力的结构性跃迁。
FrontierMath:一道极难被"刷分"的墙
要理解88%的分量,首先要理解FrontierMath是什么。
这套基准由Epoch AI联合IMO金牌得主、菲尔兹奖得主等数学家共同设计,包含数百道原创、从未公开发表的题目,覆盖从数论的密集型计算、实分析,到代数几何与范畴论等现代数学主要分支。解题通常需要相关领域研究者投入数小时,最难的题目甚至需要数天。
2026年6月12日,Epoch AI发布了FrontierMath v2重大更新——审计发现原始版本42%的题目存在错误,团队修正了135道、移除了12道,最终数据集定格为338道题:295道Tiers 1-3基础题,加上43道Tier 4扩展难题。Fable 5的88%成绩,正是在这套经过纠错加固的v2版本上跑出来的。
💡 这意味着:Fable 5并没有占旧题库"刷熟题"的便宜,而是在经过独立审计、错误率大幅降低的全新测试场上证明了自身实力。所有模型都在Epoch AI的标准脚手架下、以最高推理强度进行测试,比较具有可比性。
半年之内,从"数学短板"到"数学标杆"
把时间线拉直,Anthropic数学能力的跃迁曲线近乎垂直:
2026年初:Opus 4.5在FrontierMath Tier 4仅得不足10%,Claude在AI圈内的标签还是"干活很拿手,数学一团糟"
2026年6月:Fable 5在FrontierMath Tier 4(v2)拿下88%,Tiers 1-3也达到87%
同一系列模型,数学推理能力在不到一年内实现了量级跃升。分析师指出,这种跨代78个百分点的跨越式增长,绝非渐进式优化或简单"调参"可以解释。Fable 5极有可能在架构或训练策略上做出了激进变革:或是预训练阶段注入了更高质量的数学数据集,或是推理环节引入全新机制,赋予模型某种"数学直觉"。Anthropic尚未对外披露具体技术细节,但从结果可以推断,这次突破的底层逻辑是结构性的。
更值得注意的是,Fable 5并非在实验室内部依靠未公开的"秘密武器"完成对GPT-5.5的超越,而是一款任何开发者都可通过API调用的公开模型,在同一个第三方基准上与GPT-5.5正面交锋。这远比任何自说自话的发布会更有说服力。
基准跑分之外,真实科研场景的验证也在同步发生。2026年7月,Claude Fable 5攻克了一道卡壳半年的弦理论难题——人类研究者久攻不下的问题,Fable 5一夜之间完成求解。更早之前,Claude Mythos独立解决了OpenAI此前攻关的Erdős问题,给出一份"简洁优雅"的证明。
一个被低估的细节:Fable 5是"可被调用的"
这一点之所以关键,是因为它改变了AI能力的分配方式。
过去,"最强模型"往往意味着"少数机构能用"。而Fable 5的88%成绩,是建立在"任何数学家、科研人员,甚至只是感兴趣的学生,都可以调用它"的前提之上的。当一款数学能力已经拉开差距的公开模型人人可调用时,数学研究本身的工作方式必然发生改变。
这正是AI能力"平权化"趋势的一个缩影——前沿大模型能力正在快速平权,稳定、低成本、多模型可切换的接入服务,已经成为智能化转型的新基础设施。
从"Claude不擅长数学"到88%:一年不到的标签重写
回望"Claude不擅长数学"这一固有印象,从2026年初到年中,不到一年时间就被彻底击碎。
Fable 5的88%不只是一个数字,它标志着一个转折点:AI的数学能力已经从"可以解竞赛题",进化到能够处理真正科研级别的数学问题。当FrontierMath的Tier 4题目得分逼近上限,接下来的问题已经不再是"AI能不能做数学",而是"人类数学家还能在AI面前保持多久优势"。
多位学者提出:2026年菲尔兹奖,或许会是最后一届完全授予人类智力成果的评奖。这听上去像预言,但Fable 5用88%的成绩证明——这已经不是预言,而是倒计时。
对于企业开发者而言,这场能力跃迁的另一重启示同样清晰:当各家头部模型在数学推理、形式化验证、长程任务规划上快速平权,选对接入通道、锁定可持续的算力成本,往往比追逐单个模型的"跑分第一"更为重要。
算力平权时代,接入层成为新基础设施
在这方面,UseAIAPI提供了值得关注的一站式解决方案。平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,开发者无需分别对接各家接口,通过一个统一入口即可灵活调用;面向企业用户,UseAIAPI支持企业级定制化部署服务,可结合Batch API机制叠加优惠,将长上下文、高并发、持续运行的智能体工作流的单位成本进一步下压。
在价格层面,平台优惠折扣最低可达官方定价的50%。以Gemini主力模型为例,通过UseAIAPI接入后的实际成本可降至:Gemini 3.6 Flash从官方价1.5/7.5美元降至0.75/3.75美元每百万Token;Gemini 3.1 Pro(200K以内)从官方价2/12美元降至1/6美元每百万Token。这意味着高强度内容生成、自动化智能体、大规模代码重构等重消耗场景,不再成为预算负担,真正实现"无忧接入、按需扩展"。
💡 当Fable 5用半年时间把"Claude不擅长数学"的标签撕得粉碎,真正值得企业记住的,不是某一个模型的跑分,而是这样一条规律:在模型能力快速平权的时代,谁能以更低的成本、更灵活地调用最合适的模型,谁就掌握了AI转型的底层主动权。
Fable 5的78个百分点跃迁,是AI数学能力演进史上的里程碑;而对企业与开发者而言,选对接入通道、锁定可持续的算力成本,则是AI时代最务实的生存基础设施。当算力平权成为不可逆的趋势,接入层的开放度与成本优势,将决定一个组织在"AI原生"竞赛中的真实起点。