
95.0%!Claude Fable 5 刷新 SWE-Bench Verified 历史最高分,编程人工智能迈入新阶段
2026 年 6 月 9 日,Anthropic 对外发布 Claude Fable 5,首次将 Mythos 层级模型向一般用户开放。这是继 Opus 系列之后,Claude 模型体系又一次具有分水岭意义的迭代。
在软件工程领域最具代表性的 SWE-Bench Verified 基准测试中,Fable 5 取得 95.0% 的成绩,Vals AI 独立验证该分数为 95.00%。在更难、更接近生产环境的 SWE-Bench Pro 测试中,Fable 5 得分 80.3%,较 Opus 4.8 高出逾 11 个百分点,较 GPT-5.5 高出 21.7 个百分点。在 Cognition 发布的 FrontierCode 钻石难度评测中,Fable 5 拿到 29.3%,是 GPT-5.5(5.7%)的五倍以上,也是当前所有公开模型中唯一突破 20% 的模型。
数字的意义,往往需要真实场景来印证。Anthropic 援引 Stripe 的案例显示,Fable 5 在一天之内完成了约 5000 万行 Ruby 代码库的迁移工作,而这项任务过去需要完整团队投入两个多月时间。
这并非"效率提升 30%"量级的改进,而是工程师角色转变的重要信号——开发者的工作重心,正从编写代码逐步转向审核代码补丁。
不止于跑分:长周期任务中的"持续学习"
Fable 5 与受限版 Mythos 5 底层架构完全一致,二者唯一区别是 Fable 5 增加了一层安全分类器。当请求触及网络安全、生物化学、模型蒸馏等敏感领域时,系统会自动将任务回退至 Opus 4.8 处理。
更值得关注的是一项被低估的质变:Fable 5 在长周期任务中能够实现真正意义上的"学习"。其上下文窗口为 100 万 token,但它并非被动等待上下文填满,而是会主动记录要点、回溯历史、提炼规则,并将所学应用于后续决策。
在"Slayer's Spire"实验中,接入基于文件的持久化记忆后,Fable 5 的性能达到 Opus 4.8 的三倍;在连续学习基准上实现 73% 的验证覆盖率,能够走完"失败→排查→验证→优化→落地"的完整闭环,而 Opus 4.8 的中位数仅为 17%。
这意味着,对于跨多天、多轮会话的复杂项目,Fable 5 可以不断沉淀对代码库、内部规范、过往决策的理解;而 Opus 4.8 在每次启动时,都需要重新加载全部上下文。这正是新一代模型与上一代模型之间的分水岭。
"长周期智能体"成为年度关键词
Cursor 首席技术官 Michael Truell 指出:"Fable 5 开启了一类我们此前从未接触过的长周期问题。"智能体能否连续运行数小时乃至数天,中途不丢失上下文、不产生逻辑崩坏——从前不敢交由人工智能处理的链式任务,例如核对会计周期、撰写月报、发送邮件、更新仪表盘,如今都可以完整跑完。
Claude Code 的缔造者 Boris Cherny 认为,Fable 5 已经不再只是一个"编程智能体",更像是与开发者并肩构建产品的思考伙伴和设计伙伴。面对复杂 Bug,它不会急于修改代码,而是像资深工程师一样收集数据、新增日志、验证假设,确认问题真正解决之后,才宣告任务完成。这种行为并非依靠特殊提示词强行实现,更像是模型自身演化出的能力。
成本翻倍的背后:为性能天花板付费
Fable 5 定价为输入每百万 token 10 美元、输出每百万 token 50 美元,是 Opus 4.8 的两倍,也是当前主流前沿模型中挂牌价最高的模型之一。单次 SWE-Bench Pro 评测成本相比 Opus 4.8 高出 72%。
与此同时,DeepSeek V4 Pro 在 SWE-Bench Verified 拿到 80.6%,输出成本仅每百万 token 0.87 美元。同样一组企业级智能体负载运行一个月,若采用 Fable 5 花费约 3.7 万美元,而 DeepSeek 仅需约 1400 美元。
这并非一道"选谁更便宜"的选择题,而是一道"谁能真正把事情做完"的选择题。根据 Anthropic 内部数据,截至 2026 年 5 月,公司代码库中上线落地的程序有 80% 由 Claude 独立生成;研发工程师每日有效代码产出相比 2024 年同期提升 8 倍。
需要客观看待的是,Fable 5 于 6 月 12 日曾因美国出口管制要求暂停访问,预计近期恢复。榜单高分也存在自报告与测试脚手架的影响,企业在选型时仍需结合自身代码库进行标准化评估。
把前沿大模型当作固定费率公用工具的时代正在结束。模型能力与成本正在同步分化——要么为性能天花板付费,要么在性价比曲线上做出取舍。两种选择都无可厚非,唯一的误区,是假装这道选择题根本不存在。
企业如何更从容地接入前沿模型
编程人工智能的新时代,不仅由某一个模型单方面宣告,更由整个生态的协同演进共同定义。当 95.0% 这个数字登顶 SWE-Bench 榜单,当 Stripe 两个月的工作量一日完成,当"长周期任务"从技术术语变为商业决策变量——时代的转向已然到来。
对于国内企业而言,如何便捷、稳定、经济地接入包括 Claude Fable 5、Gemini、ChatGPT、DeepSeek 在内的全球主流大模型,成为把握这一轮技术红利的关键。
UseAIAPI 一站式聚合 Gemini、Claude、ChatGPT、DeepSeek 等全球最新主流大模型,并提供企业级定制化部署服务。平台支持企业按业务场景灵活选用模型,优惠折扣最低可达官方价格的 50%。
在代码生成、长文本处理、批量内容产出、多智能体并行等高频企业场景中,通过 UseAIAPI 接入,月度调用成本相较直连官方通常能降低 40%–50%。结合 Batch API 的异步批处理机制,长上下文、高并发、持续运行的智能体工作流单位成本可进一步下探,真正实现"无忧接入、按需扩展"。
💡 对于研发团队而言,默认选用 Sonnet 4.5 可覆盖 80% 以上常规场景,成本仅为 Opus 的六成;当遇到复杂架构设计、超长上下文研读等攻坚任务时,再切换至 Opus 级别模型。在 UseAIAPI 渠道折扣的基础上,这套分层选型策略的性价比优势将进一步放大。
人工智能正在变得像自来水一样唾手可得——而让这股水源稳定、经济地流入企业生产线,正是新一代接入服务的核心价值所在。