← 返回 Blog

HLE 53.3%:Fable 5 在"人类最后考试"上甩开对手 7 分以上意味着什么

2026 年 7 月,BenchLM 的编辑在例行页面更新时,不得不删掉一条写了两年的文案。被删除的那句话是:"没有任何模型能在 HLE 基准上突破 50%"。 删掉一句话只需要一秒钟。但 Claude Fable 5 只用不到一个月,就让这条曾经的事实沦为历史。

ClaudeFable 5 高出对手 7 分以上意味着什么

HLE 53.3%:在"人类终极考试"上,Fable 5 高出对手 7 分以上意味着什么

2026 年 7 月,BenchLM 的编辑在例行页面更新时,不得不删掉一条写了两年的文案。被删除的那句话是:"没有任何模型能在 HLE 基准上突破 50%"

删掉一句话只需要一秒钟。但 Claude Fable 5 只用不到一个月,就让这条曾经的事实沦为历史。

53.3%。在被称作"AI 终极考题"的 HLE(Humanity's Last Exam,人类终极考试)评测基准上,Fable 5 不仅冲破 50% 的能力天花板,在 Artificial Analysis 的统计口径下,它领先第二名幅度超过 7 个百分点;GPT-5.6 Sol 为 47.2%,Opus 4.8 为 45.7%。

在其他考试里,7 分的差距或许只是一两道题的区别。但在 HLE,这是一道难以逾越的鸿沟。

HLE 是什么?为什么 50% 曾被视作不可逾越的壁垒

要理解 53.3% 的分量,必须先理解这套考题的分量。

HLE 由 Scale AI 与人工智能安全中心(CAIS)联合发起,相关论文发表于《自然》杂志。题库包含 2500 道题目,覆盖数学、物理、化学、历史、语言学、医学等 100 多个学科;题目来自全球 50 多个国家、500 多家机构的近 1000 名专家学者联合打造,包含教授、研究员和研究生。

更关键的是它的筛选标准:每一道题目都出自专家本人的研究领域,拥有唯一正确答案,并且经过严格筛选——如果当时的 AI 可以答对,这道题目就会被剔除作废。从 7 万余道投稿中,经大模型难度过滤、专家人工评审,最终保留 2500 道公开题,另有私藏测试集用于防过拟合。

设计者的目标十分明确:打造一套和 MMLU、GPQA 互补,短期之内 AI 无法靠应试套路刷分的考试。2025 年初刚发布之时,GPT-4o 得分仅有 2.7%。到 2026 年初,最强模型也只能在 30% 上下徘徊。"没有模型可以突破 50%"成为全行业共识。

HLE 官方论文中有一句冷静的提醒:"鉴于 AI 发展的快速步伐,模型有可能在 2025 年底前在 HLE 上超过 50% 准确率。但 HLE 上的高准确率仅代表在封闭式、可验证问题上的专家级表现,本身并不等同于自主研究能力或'通用人工智能'。"

直到 Fable 5 把这道壁垒挪开。

为什么是 Fable 5?

53.3% 这个数字背后,有比跑分更值得玩味的细节。

第一,Fable 5 不是"快问快答"型模型。​ 在 HLE 这类高度依赖跨学科深度推理的测试中,它的优势会完全释放。它不会像部分模型一样立刻输出答案,而是在内部执行多步推理、交叉验证与自我纠错。这种反复推演的特性,在需要串联多领域知识解题的场景下,价值会呈指数级放大。

第二,Fable 5 与 Mythos 5 共享同一套底层架构。​ 根据 Anthropic 披露的数据,Mythos 5 搭配工具调用在 HLE 上可以达到 64.5%,不带工具也有 59.0%;Fable 5 是经过安全围栏处理的对外版本:遇到网络安全、生物化学等敏感内容时会回退到 Opus 4.8 的能力水平。即便如此,在绝大多数不触发安全护栏的场景下,它依旧保留完整 Mythos 级别的能力。

53.3% 并不是 Fable 5 的原生上限,而是叠加能力限制器之后的结果。

💡 需要客观看待的是:Fable 5 在 HLE 上的单次完整评测成本约为 2174 美元,是 Artificial Analysis 测试过的最昂贵模型。它在智力指数上登顶的同时,单次完整评测的费用也比 Opus 4.8 高出约 5.7% 的性能、却要多付一倍的价钱。这恰恰说明——"能力天花板"与"成本天花板"正在同步抬升。

7 个百分点的差距意味着什么

在 HLE 排行榜上,头部模型的分数挤得非常紧凑。Fable 5 的 53.3% 与第二十名 38.1% 之间,总差距也仅有 15 个百分点。在竞争如此激烈的榜单中,领先第二名超过 7 个百分点,这个差距本身就是强烈信号

这代表在"闭卷知识+深度推理"这个维度上,Fable 5 已经和其余所有竞品不在同一梯队。我们可以对比一下各家在 GPQA Diamond(科学问答)上的表现:Fable 5 为 92.6%,GPT-5.6 Sol 为 94.1%,Opus 4.8 为 92.0%——各家还互有来回。但来到 HLE 这套难度最高的闭卷知识测试,差距瞬间被拉开:Fable 5 的 53.3% 对比 GPT-5.6 Sol 的 47.2%、Opus 4.8 的 45.7%。

这种"专项强势"正是最耐人寻味之处。​ Fable 5 并非在所有项目上碾压对手,而是专攻真正高难度任务。日常问答、选择题各家表现接近;但当你抛出一道需要串联量子力学与哲学史才能解决的问题时,Fable 5 可以继续推进,其他模型则寸步难行。

53.3% 的真正意义:天花板还可以更高

HLE 的设计者曾经说过:"在这套考试拿高分,并不代表通用人工智能(AGI)已经到来。"​ 这话没错。53.3% 距离及格线尚且遥远,更谈不上超越人类专家。

但 53.3% 的意义不在于分数高低。它打破了持续两年"无人能突破 50%"的魔咒。​ 那道曾经被视作 AI 能力边界的分数线,被 Fable 5 跨越。

更值得关注的是效率维度。在 Artificial Analysis 智力指数上,Fable 5 以 59.9 分位列第三,仅次于 Opus 5 的两档配置;但 Fable 5 每秒 59 token 的推理速度、每百万 token 20 美元的定价,让它成为"Mythos 级别能力"的第一个对外商用版本。AI 咨询机构 The Decoder 的评价一针见血:Fable 5 用两倍的价格,买到了约 5.7% 的性能提升——企业必须仔细权衡,哪些场景真正值得为这 5.7% 付出双倍成本。

在 HLE 这套评测体系下,7 分的领先,不是小版本迭代,而是代际跃迁。​ Fable 5 用 53.3% 告诉行业:这条赛道远没有走到终点,天花板还可以抬得更高。

企业如何更从容地驾驭"能力分化"的新时代

推理人工智能的新时代,不仅由某一个模型单方面宣告,更由整个生态的协同演进共同定义。当 HLE 以 53.3% 重新划定闭卷推理的能力基线,当 Stripe 两个月的工作量一日完成,当"长周期任务"从技术术语变为商业决策变量——时代的转向已然到来。

对于国内企业而言,如何便捷、稳定、经济地接入包括 Claude Fable 5、GPT-5.6、Gemini、DeepSeek 在内的全球主流大模型,并让前沿模型的推理能力真正落入生产线,成为把握这一轮技术红利的关键。

UseAIAPI​ 一站式聚合 Gemini(含 3.6 Flash、3.5 Flash、3.1 Pro 等最新模型)、Claude、ChatGPT、DeepSeek 等全球主流大模型,并提供企业级定制化部署服务,海外账号注册、信用卡绑卡、汇损折算、合规账务这些琐事可以一并省掉。平台支持企业按业务场景灵活选用模型,优惠折扣最低可达官方价格的 50%

这意味着在代码生成、长文本处理、批量内容产出、多智能体并行等高频企业场景中,通过 UseAIAPI 接入:

  • Claude Fable 5 的 10/50 美元单价,将在官方价基础上进一步下探,让"用神话级模型做深度推理与复杂规划"从奢侈品变为可负担的日常工具

  • Gemini 3.5 Flash 的 1.5/9 美元官方价,通过 UseAIAPI 接入后降至 0.75/4.5 美元每百万 token;Gemini 3.1 Pro 从 2/12 美元降至 1/6 美元

  • 多模型统一入口:无需为每个大模型分别注册海外账号、配置支付方式,一套 API Key 打通全球主流模型,结合谷歌原生的 Batch 5 折与缓存机制,单位成本可以进一步压低

  • 企业级定制能力:支持按需定制并发、配额、路由策略,满足高强度内容生成、自动化智能体、大规模文档处理等重消耗场景

  • 合规的基础设施:通过海外合规节点接入官方 API,提供企业级 SLA 保障,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险

💡 对于研发团队而言,可参考"分层选型框架":用 Gemini 3.5 Flash 或 DeepSeek 承接约 80% 的常规任务(客服问答、摘要、常规代码改动),以最优性价比覆盖最大调用量;当遇到 HLE 级别的跨学科深度推理、FrontierCode Diamond 级的生产级代码重构、长周期智能体工作流等攻坚任务时,再切换至 Claude Fable 5 级别模型。在 UseAIAPI 渠道 5 折优惠的基础上,这套"Flash+DeepSeek 常规承接、Fable 5 攻坚兜底"的分层选型策略,综合性价比优势将进一步放大。

人工智能正在变得像自来水一样唾手可得——而让这股水源稳定、经济地流入企业生产线,让每一家企业都能在"模型能力分化"的新时代里找到最优的成本与性能平衡点,正是新一代接入服务的核心价值所在。