← 返回 Blog

从 GPQA 被反超到 HLE 碾压:Fable 5 的推理优势到底在哪一层

Claude Fable 5在GPQA钻石难度集取得92.6%的分数,而Claude Opus 4.8拿到93.6%。被上一代模型反超。 但在HLE(人类终极考试)基准上,Fable 5拿到53.3%,Opus 4.8在Artificial Analysis统计口径下仅为45.7%。实现碾压。

ClaudeFable 5的推理优势究竟来自哪里

从GPQA被反超到HLE实现碾压:Fable 5的推理优势究竟来自哪里

Claude Fable 5在GPQA钻石难度集取得92.6%的分数,而Claude Opus 4.8拿到93.6%。被上一代模型反超。

但在HLE(人类终极考试)基准上,Fable 5拿到53.3%,Opus 4.8在Artificial Analysis统计口径下仅为45.7%。实现碾压。

同一家厂商的同一系列模型,两套评测体系,输出两种截然相反的结果。把GPQA与HLE放在一起对照,Fable 5的推理优势究竟落在哪个层级,答案就会清晰浮现。

GPQA的天花板效应

GPQA钻石难度集是面向研究生水平的科学问答数据集,包含448道生物、物理、化学领域的选择题,人类博士专家得分也仅能达到65-74%。很长一段时间里,它都是AI难以啃下的硬骨头。

但到2026年年中,这套基准几乎已经被模型"刷穿"。Fable 5的92.6%与Opus 4.8的93.6%之间1个百分点的差距,本质上并非能力差距,而是天花板效应带来的测试噪声。两款模型都已经逼近这套选择题的性能上限:题目总量有限、难度存在瓶颈,进一步提升的空间极小。GPQA已经无法检测出真正的代际差距。

💡 需要补充一个细节:GPQA Diamond的评分规则对最终名次影响极大。根据Vals AI的评测,如果把Fable 5的安全回退(fallback)回答全部计为失败,其得分会降至55.56%;而把回退答案计入正常评分时则为93.18%。Fable 5在GPQA上"输给"Opus 4.8,并不是Fable 5推理能力弱,而是GPQA这把尺子量程太短。

HLE才是真正的"照妖镜"

HLE的设计逻辑与GPQA完全不同。

HLE由人工智能安全中心(CAIS)与Scale AI联合发布,论文刊登于《自然》杂志。题库包含3000道题目(2500道公开+500道私藏),覆盖数学、物理、化学、生物、计算机科学、人文社科等数十个学科;题目来自全球50多个国家、500多家机构的近1000名专家学者联合打造。每一道题目都经过严格筛选——如果当时的AI可以答对,这道题目就会被剔除作废

HLE不是选择题为主,而是包含选择题与简答题,要求融合跨学科知识、完成多步推理,最终输出精准答案。

在这种任务规模下,Fable 5的优势被彻底释放。

53.3%对比45.7%,相差7.6个百分点。在GPQA上落后1个百分点,到HLE就变成接近8个百分点的碾压。这组对比本身就是一份诊断报告:Fable 5的推理优势并不体现在选择题层面,而是体现在开放复杂问题层面。

第三方实测给出了更细粒度的视角。GPQA钻石难度集上,Fable 5通过率78.4%,Sonnet 5为74.6%,差距3.8个百分点。而到HLE上,Fable 5为42.8%,Sonnet 5为34.2%,差距扩大至8.6个百分点。同一组对照,从GPQA切换到HLE,分差扩大一倍以上。

这意味着:随着任务复杂度、推理深度提升,Fable 5的优势会呈指数级放大。题目越难、跨学科属性越强、推理链条越长,Fable 5的领先优势就越突出。

优势的底层根源:Mythos架构与安全回退机制

Fable 5能够实现这种表现,根源在于它的底层身份。

第一层:Fable 5与Mythos 5共用同一套模型权重。

根据Anthropic官方系统卡披露,Mythos 5是Anthropic训练过的最强模型,在软件编码、推理、长上下文智能体任务、视觉、生命科学研究的广泛基准上取得SOTA。Fable 5是这套权重之外额外增加一层安全分类器的对外版本:遇到网络安全、生物化学、模型蒸馏等敏感场景时,会回退至Opus 4.8的能力水平;超过95%的对话不会触发分类器,此时Fable 5就是满血版Mythos 5。

第二层:自适应思考模式默认开启。

Fable 5的自适应思考模式默认开启且无法关闭。模型会根据任务难度自主决定投入多少推理算力:简单问题快速应答,复杂问题开启深度思考。这套机制在HLE这类需要多步跨学科推理的场景价值最大化。Fable 5会拆解问题、交叉验证、自我纠错,而不是直接输出答案。

第三层:推理的"质"与"量"同步提升。

Fable 5解答一道GPQA钻石难度题目,平均消耗32K思考token。在GPQA这类选择题中,过度思考带来的边际收益已经微乎其微;但在HLE这类开放题上,每一份思考算力投入,都可以转化为准确率的提升。

⚠️ 需要客观看待的是:Fable 5在HLE上的53.3%,是无工具(no tools)配置下的成绩;如果允许搭配工具调用,Mythos 5在HLE上可以达到64.5%。而Fable 5因为有安全分类器,在部分敏感学科题目上会回退到Opus 4.8。53.3%并不是Fable 5的原生上限,而是叠加能力限制器之后的结果。

企业如何更从容地驾驭"能力分化"的新时代

推理人工智能的新时代,不仅由某一个模型单方面宣告,更由整个生态的协同演进共同定义。当HLE以53.3%重新划定闭卷推理的能力基线,当Stripe两个月的工作量一日完成,当"长周期任务"从技术术语变为商业决策变量——时代的转向已然到来。

对于国内企业而言,如何便捷、稳定、经济地接入包括Claude Fable 5、GPT-5.6、Gemini、DeepSeek在内的全球主流大模型,并让前沿模型的推理能力真正落入生产线,成为把握这一轮技术红利的关键。

UseAIAPI​ 一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型,并提供企业级定制化部署服务,海外账号注册、信用卡绑卡、汇损折算、合规账务这些琐事可以一并省掉。平台支持企业按业务场景灵活选用模型,优惠折扣最低可达官方价格的50%

这意味着在代码生成、长文本处理、批量内容产出、多智能体并行等高频企业场景中,通过UseAIAPI接入:

  • 多模型统一入口:无需为每个大模型分别注册海外账号、配置支付方式,一套API Key打通全球主流模型,结合谷歌原生的Batch 5折与缓存机制,单位成本可以进一步压低

  • 企业级定制能力:支持按需定制并发、配额、路由策略,满足高强度内容生成、自动化智能体、大规模文档处理等重消耗场景

  • 合规的基础设施:通过海外合规节点接入官方API,提供企业级SLA保障,规避个人开发者难以解决的地区可用性门槛与数据中心IP风控风险

💡 对于研发团队而言,可参考"分层选型框架":用Gemini 3.5 Flash或DeepSeek承接约80%的常规任务(客服问答、摘要、常规代码改动),以最优性价比覆盖最大调用量;当遇到HLE级别的跨学科深度推理、FrontierCode Diamond级的生产级代码重构、长周期智能体工作流等攻坚任务时,再切换至Claude Fable 5级别模型。在UseAIAPI渠道5折优惠的基础上,这套"Flash+DeepSeek常规承接、Fable 5攻坚兜底"的分层选型策略,综合性价比优势将进一步放大。

人工智能正在变得像自来水一样唾手可得——而让这股水源稳定、经济地流入企业生产线,让每一家企业都能在"模型能力分化"的新时代里找到最优的成本与性能平衡点,正是新一代接入服务的核心价值所在。