← 返回 Blog

SWE-bench Pro 80.3% vs 58.6%:Fable 5 与 GPT-5.5 的代差究竟有多大

80.3% 对 58.6%,相差 21.7 个百分点。在很多基准测试里,20 分或许只是险胜与惜败之间的微弱差距,但 SWE-Bench Pro 绝非普通基准。 这套测试本身就是为拉高 AI 拿高分的门槛而设计。它的整体得分天然远低于 SWE-Bench Verified,在这套标尺之下,80.3% 这个分数,足以让其他竞品黯然失色。

ClaudeFable 5 与 GPT-5.5 之间的代差究竟是什么

SWE-Bench Pro 80.3% 对 58.6%:Fable 5 与 GPT-5.5 之间的代差究竟是什么

80.3% 对 58.6%,相差 21.7 个百分点。在很多基准测试里,20 分或许只是险胜与惜败之间的微弱差距,但 SWE-Bench Pro 绝非普通基准

这套测试本身就是为拉高 AI 拿高分的门槛而设计。它的整体得分天然远低于 SWE-Bench Verified,在这套标尺之下,80.3% 这个分数,足以让其他竞品黯然失色。

Pro 为什么比 Verified 更"苛刻"

SWE-Bench 有两个主流版本。Verified 是人工筛选出的 500 道题目,整体可控。而 Pro 包含 41 个代码库、1865 个任务,全部是长周期、企业级真实软件工程问题。模型要做的不只是写出一段能跑通单元测试的代码,而是要解决真实代码库里曾经实实在在困扰开发者的真实问题。

第三方评测机构 DataCamp 指出,GPT-5.5 在 SWE-Bench Pro 上拿到 58.6%,而 Claude Opus 4.7 其实早以 64.3% 在该基准上超过了 GPT-5.5——也就是说,在 Fable 5 到来之前,GPT-5.5 在仓库级编程上已经处于落后位置。Fable 5 的 80.3% 把这个差距进一步拉大到 22 个百分点。

22 分的差距,已经不是略胜一筹,而是完全不在同一个能力梯队。

更能说明问题的是 FrontierCode Diamond 基准——这套基准专门测试代码能否被真实开源项目接纳合并的超高难度任务。Fable 5 取得 29.3%,而 GPT-5.5 仅 5.7%。Diamond 考察的不是"能不能写出代码",而是写出的代码是否适配数十万行、拥有自身规范与架构的真实项目。在这里,差距不再是 22 分,而是足足五倍。

DataCamp 对这套数据的总结十分直白:"If your primary use case is repository-level engineering, Fable 5 is the clear choice on capability alone."(如果你的核心用例是仓库级工程,仅凭能力这一项,Fable 5 就是明确的选择。)

代差的底层根源:Mythos 秘典架构

Fable 5 与 GPT-5.5 之间的差距,不是普通版本迭代优化带来的提升,而是 内部受限能力解禁释放出的代差

Fable 5 是 Anthropic 首款对外开放的 Mythos 秘典层级模型。根据 Anthropic 官方说明,Mythos 是介于 Opus 之上的一档全新能力层级。Fable 5 与内部受限的 Mythos 5 使用同一套底层权重;唯一区别就是 Fable 5 额外增加一层安全分类器——当请求涉及网络安全、生物化学、模型蒸馏等敏感领域时,会自动回退至 Opus 4.8 处理。Anthropic 官方表示,超过 95% 的会话不会触发回退。

GPT-5.5 是 OpenAI 的旗舰编程模型,按产品迭代节奏本应是 Fable 5 最强对手。但 Fable 5 用 22 分的差距向市场证明:普通旗舰与秘典层级之间,存在一道能力天花板鸿沟

更值得关注的一点:Fable 5 的优势会随任务复杂度呈指数级放大。第三方测试数据显示,普通编程任务中,它相比上一代 Opus 4.8 大约领先 1.16 倍;而在 FrontierCode Diamond 这种地狱难度任务中,性能差距直接拉到 2.2 倍。题目越难,Fable 5 的优势就越明显。

获得代差优势需要付出成本,但并非"简单翻倍"

当然,22 分的领先不是免费的。

Fable 5 标准 API 定价:输入 10 美元/百万 token,输出 50 美元/百万 token,恰好是 GPT-5.5(输入 5 美元/输出 30 美元)的两倍。但把两家模型的完整价格结构放在一起对比,会发现"贵一倍"这个结论需要重新核算:

计费维度

Fable 5

GPT-5.5

标准输入/输出

10 / 50 美元

5 / 30 美元

Batch 异步(5 折)

5 / 25 美元

2.50 / 15 美元

缓存命中输入

1 美元

0.50 美元

长上下文(>272K 输入)

100 万 token 内统一定价

整轮跳至 10 / 45 美元

数据来源:Anthropic 官方费率卡、OpenAI 官方定价页

两张价目表放在一起,三个关键事实浮现出来:

第一,Fable 5 的 Batch 价是 5/25 美元,缓存命中输入价仅 1 美元。​ 对于多日自主智能体、代码库迁移等非实时任务,结合 Batch 与缓存机制,单位成本可大幅下探。

第二,GPT-5.5 存在 272K token 的"断崖阈值"。​ 一旦单次请求输入超过 272K token,整条请求的全部输入、输出 token 统一按 10/45 美元计费——这与 Fable 5 在 100 万 token 上下文内统一定价形成鲜明对比。对于全库迁移这类超长上下文任务,GPT-5.5 的"便宜"会迅速被附加费吞没。

第三,Fable 5 在 FrontierCode 上以"中等推理力度"就拿到了前沿模型最高分——这意味着它用更少的 token 完成了任务。DataCamp 评价:"Fable 5 在编码和智能体性能上领先最大,而这是两个模型之间差距最大、最影响决策的维度。"

💡 一个被低估的维度:任务成功率。Fable 5 在 FrontierCode Diamond 上 29.3% 对 5.7% 的差距意味着——同一道生产级代码难题,GPT-5.5 几乎无法一次交付,需要人工兜底或多次返工;而 Fable 5 有将近三成概率端到端跑通。当"任务成功率"被纳入成本核算,"单次调用单价"的对比就失去了意义。

结语:22 分,是一条分界线

80.3% 对比 58.6%,22 个百分点的差距。

这不是单纯跑分层面的胜利,而是能力层级的分水岭。SWE-Bench Pro 本就是一套 AI 很难拿高分的测试,而 Fable 5 是首款公开可用、得分突破 80% 的模型。GPT-5.5 拿到 58.6% 并不算弱,只是 Fable 5 已经站在了另一个能力维度。

DataCamp 的总结恰如其分:"The question is whether the 2x output token cost and classifier friction are worth it for your specific workload."(问题在于,对你的具体工作负载而言,两倍的输出 token 成本和分类器摩擦是否值得。)

22 分,不只是一个数字,而是一条分界线。线的一边是普通旗舰;另一边,则是秘典层级。

对于研发团队而言,可参考"分层选型框架":当遇到仓库级重构、大规模代码迁移、长周期智能体工作流等攻坚任务时,Fable 5 的代差优势能够直接转化为"任务能否被端到端交付";而对于常规代码辅助、轻量摘要等场景,GPT-5.5 的性价比依然具备竞争力。值不值得,只看你的任务是否配得上这份能力溢价。

企业如何更从容地驾驭"神话级"模型成本

编程与推理人工智能的新时代,不仅由某一个模型单方面宣告,更由整个生态的协同演进共同定义。当 Fable 5 在 SWE-Bench Pro 上以 80.3% 划出代际分界线,当 Stripe 两个月的工作量压缩为一天,当"长周期任务"从技术术语变为商业决策变量——时代的转向已然到来。

对于国内企业而言,如何便捷、稳定、经济地接入 Claude Fable 5,并与 GPT-5.5、Gemini、DeepSeek 等全球主流大模型灵活组合,成为把握这一轮技术红利的关键。

UseAIAPI​ 一站式聚合 Claude、Gemini、ChatGPT、DeepSeek 等全球最新主流大模型,并提供企业级定制化部署服务,海外账号注册、信用卡绑卡、汇损折算、合规账务这些琐事可以一并省掉。平台支持企业按业务场景灵活选用模型,优惠折扣最低可达官方价格的 50%

这意味着在代码生成、长文本处理、批量内容产出、多智能体并行等高频企业场景中,通过 UseAIAPI 接入:

  • Claude Fable 5 的 10/50 美元单价,将在官方价基础上进一步下探,让"用秘典级模型做生产级代码迁移"从奢侈品变为可负担的日常工具

  • 结合 Batch API 的 5 折机制叠加渠道优惠,长上下文、高并发、持续运行的智能体工作流单位成本可进一步压低——Fable 5 的 Batch 价本就为 5/25 美元,再叠加 UseAIAPI 渠道折扣,实际成本可进一步下探

  • 上下文缓存 90% 折扣:Fable 5 提示缓存命中价仅为 1 美元/百万 token,结合渠道折扣进一步下探,让 5000 万行级别的代码库分析不再成为预算负担

  • 多模型统一入口:无需为每个大模型分别注册海外账号、配置支付方式,一套 API Key 打通全球主流模型,国内直连低延迟

  • 企业级定制能力:支持按需定制并发、配额、路由策略,满足高强度内容生成、自动化智能体、大规模代码重构等重消耗场景

  • 合规的基础设施:通过海外合规节点接入官方 API,提供企业级 SLA 保障,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险

💡 对于研发团队而言,可参考"分层选型框架":用 GPT-5.5 或 Gemini 3.5 Flash 承接约 80% 的常规任务(客服问答、摘要、常规代码改动),以最优性价比覆盖最大调用量;当遇到 Stripe 级别的代码库全量迁移、FrontierCode Diamond 级的生产级代码重构、SWE-Bench Pro 级的仓库级工程等攻坚任务时,再切换至 Claude Fable 5 级别模型。在 UseAIAPI 渠道 5 折优惠的基础上,这套"常规模型承接 + Fable 5 攻坚兜底"的分层选型策略,综合性价比优势将进一步放大。

人工智能正在变得像自来水一样唾手可得——而让这股水源稳定、经济地流入企业生产线,让每一家企业都能在"模型能力分化"的新时代里找到最优的成本与性能平衡点,正是新一代接入服务的核心价值所在。