← 返回 Blog

Agents' Last Exam 53.6 分刷新 SOTA:GPT-5.6 Sol 在编程与长周期推理上碾压 Fable 5

2026年7月9日,OpenAI正式对外发布GPT-5.6完整产品家族,分为Sol、Terra、Luna三个版本,定位分别为复杂专业工作旗舰、智能与成本平衡、成本敏感型高容量负载。 旗舰版Sol的宣传语只有一句话,但分量十足:在Agents' Last Exam(ALE)拿到53.6分,领先Claude Fable 5(自适应推理)13.1分。​ 即便是在中等推理强度下,Sol也以大约四分之一的预估成本领先Fable 5达11.4分。

OpenAIGPT-5.6 Sol在长周期智能体任务上超越Fable 5

ALE评测拿到53.6分刷新SOTA:GPT-5.6 Sol在长周期智能体任务上超越Fable 5

2026年7月9日,OpenAI正式对外发布GPT-5.6完整产品家族,分为Sol、Terra、Luna三个版本,定位分别为复杂专业工作旗舰、智能与成本平衡、成本敏感型高容量负载。

旗舰版Sol的宣传语只有一句话,但分量十足:在Agents' Last Exam(ALE)拿到53.6分,领先Claude Fable 5(自适应推理)13.1分。​ 即便是在中等推理强度下,Sol也以大约四分之一的预估成本领先Fable 5达11.4分。

Fable 5在SWE-Bench Pro上得分80.3%,纯软件工程任务上保持着极强竞争力。但ALE并不是SWE-Bench。它考察的不是会不会写代码。

ALE是什么?为什么它比SWE-Bench更难

Agents' Last Exam由加州大学伯克利RDI机构牵头,300余名行业专家、100余家机构联合打造,覆盖55个行业领域,包含1490个任务实例、960个不同的工作流程。

ALE的设计目标十分明确:衡量AI在具备经济价值的真实长周期工作流中的表现。它不考选择题选A还是B,而是测试AI能否像人一样在计算机上完成完整工作:任务规划、工具调用、持续执行、全程无错,全程无需人工介入、人工纠错。任务源自制造业、法律、医疗、视觉媒体等领域,全部来自从业者真实日常工作,而非研究人员闭门造车的合成场景。

SWE-Bench考的是"修Bug";ALE考的是"完整干活"。​ 前者如同客观题,后者如同开卷大作文。正如研究报告所指出的,ALE旨在同时打通真实性、广度和可验证性三道关卡。

该基准下Fable 5得分40.5,Sol拿到53.6。13.1分的差距,不是同代模型小幅迭代,而是代际级跨越。

💡 需要客观看待的是:OpenAI官方公告中强调53.6分是在启用max推理强度等特定配置下取得的。在Artificial Analysis Intelligence Index广泛智能指数上,开启max推理强度的Sol与Fable 5的差距不到1分,但任务完成时间缩短了61%,预估成本仅为后者的一半左右。这说明Sol的领先在特定长周期专业工作流评估中最为显著。

Sol凭什么取胜

Sol的优势来自三层能力叠加。

第一层:分级推理能力。

GPT-5.6引入全新推理强度档位体系:none、low、medium、high、xhigh、max;Sol支持最高两档max与ultra。Max档位给模型分配更多算力做深度思考;Ultra默认启动子智能体并行协作,复杂任务最多可扩展至16个。ALE全部是长周期、多步骤智能体任务:单模型硬扛,和4个智能体分工并行,输出效果天差地别。

第二层:每一枚Token产出价值更高。

OpenAI在官方公告直言:"我们训练GPT-5.6,让每一个Token产出更具实际价值。"这不是营销话术。在Artificial Analysis编码智能体指数上,Sol(max)以80分刷新SOTA,高出Fable 5 2.8分;同时输出Token数量减半、耗时减半,预估成本下降约三分之一。

同样任务,用更少Token做得更好。

第三层:计算机实操能力。

GPT-5.6补齐过往短板:界面审美与视觉理解。模型可以自行"看见"渲染结果,检查视觉、功能缺陷,再自行修复。它能看懂自己生成的UI实际长什么样,而不仅仅是输出代码。

13.1分意味着什么

ALE上53.6对40.5,13.1分的分差,需要两组参照数字来理解。

第一组:Fable 5在SWE-Bench Pro领先Sol。纯软件工程领域Fable 5确实更强。但ALE覆盖55个领域,不止编码,还包括法律文书、医疗诊断、视觉媒体制作;在这些非编程长周期任务上,Sol反超Fable 5约13分。

第二组:即便使用中等推理强度档位,Sol依旧领先Fable 5约11.4分,预估成本仅约对方四分之一。说明Sol的领先不是靠"堆算力烧钱",即使用更经济的配置,依旧可以取胜。

OpenAI官方数据显示,这种效率优势同样体现在小型模型上:GPT-5.6 Terra和Luna的表现超越了Fable 5,而成本仅为后者的约十六分之一。

这不叫"略胜一筹",而是不在同一个竞争维度。

选型启示:按任务形状匹配模型

Sol在ALE上的53.6分,揭示了一个清晰的产业信号:不同模型在不同任务形状上各有胜负

  • 长周期、跨领域、真实专业工作流​ → Sol优势显著(ALE 53.6 vs 40.5)

  • 仓库级代码修复、生产级PR生成​ → Fable 5依旧保持竞争力(SWE-Bench Pro 80.3%)

  • 日常生产工作负载​ → Terra以2/12美元的官方价兼顾质量与成本

  • 高频轻量、成本敏感型批量任务​ → Luna以0.20/1.20美元的官方价提供极具竞争力的单位成本

横向对比理解这个价格的分量:

模型

输入(美元/百万Token)

输出(美元/百万Token)

核心定位

Claude Fable 5

10.00

50.00

秘典层级,编程极强

GPT-5.6 Sol

5.00

30.00

复杂推理与编程旗舰

GPT-5.6 Terra

2.50

15.00

平衡智能与成本

GPT-5.6 Luna

0.20

1.20

成本敏感、高容量

注:数据来源:OpenAI官方定价页

Sol价格约为Fable 5的1/2,Terra为Fable 5的1/4,Luna仅为Fable 5的1/50。

结语:13.1分不只是一个数字,而是一条分界线

53.6分对比40.5分,13.1分的鸿沟。

在ALE基准上,Sol证明自己不只是会写代码,它可以在55个领域像人类一样完成真实业务工作。Fable 5依旧是"最强编码模型"的有力竞争者,而Sol正在成为"能完成更多种类工作的模型"。

OpenAI官方公告中有一段话,可以作为本次发布最精准注解:

GPT-5.6 Sol重新定义智能与效率的行业标杆,在编程、知识工作、网络安全与科学领域交出行业领先成绩;以更少Token、更低预估成本,超越前代以及市面上其他前沿模型。

13.1分不只是一个数字,而是一条分界线。​ 线的一边是"写代码的AI";另一边是"真正干活的AI"

对于研发团队而言,可参考"分层选型框架":用Luna承接高频轻量任务,用Terra处理日常生产工作负载,当遇到复杂长周期专业工作流时,再切换至Sol级别模型;当遇到仓库级代码修复等Fable 5极具优势的攻坚任务时,亦可灵活调用Claude Fable 5。让每一类任务都跑在性价比最优的模型上,正是"模型能力分化"新时代的核心竞争力。

企业如何更从容地驾驭"分层调度"的新时代

编程与推理人工智能的新时代,不仅由某一个模型单方面宣告,更由整个生态的协同演进共同定义。当GPT-5.6 Sol以53.6分刷新ALE基准,当Luna以0.20/1.20美元的官方定价重新划定成本基线,当"分层调度"从技术术语变为FinOps决策变量——时代的转向已然到来。

对于国内企业而言,如何便捷、稳定、经济地接入GPT-5.6 Sol、Terra、Luna,并与Claude Fable 5、Gemini、DeepSeek等全球主流大模型灵活组合,成为把握这一轮技术红利的关键。

UseAIAPI​ 一站式聚合GPT-5.6(含Sol、Terra、Luna)、Claude、Gemini、DeepSeek等全球最新主流大模型,并提供企业级定制化部署服务,海外账号注册、信用卡绑卡、汇损折算、合规账务这些琐事可以一并省掉。平台支持企业按业务场景灵活选用模型,优惠折扣最低可达官方价格的50%

这意味着在长周期智能体、代码生成、批量内容产出、多智能体并行等高频企业场景中,通过UseAIAPI接入:

  • GPT-5.6 Sol的5/30美元官方价,通过UseAIAPI渠道折扣进一步下探,让"用旗舰模型跑ALE级别的复杂长周期专业工作流"的成本门槛大幅降低,把53.6分的能力以更可承受的价格赋能企业核心业务

  • GPT-5.6 Terra的2.50/15美元官方价,通过渠道折扣进一步下探,让"平衡智能与成本的日常生产工作负载"以最优性价比支撑企业主流业务

  • GPT-5.6 Luna的0.20/1.20美元新低价红利可第一时间享用,结合渠道优惠,让"成本敏感、高容量"的轻量任务单位成本压到极低

  • Claude Fable 5级别模型:当遇到仓库级代码修复、生产级PR生成等Fable 5极具优势的攻坚任务时,可通过UseAIAPI接入,以渠道优惠享受10/50美元官方价下探后的成本优势

  • 智能路由与成本优化:企业可根据业务场景,在同一个工作流中灵活调度不同模型——用Luna承接高频轻量任务,用Terra处理日常生产工作负载,用Sol攻坚复杂长周期专业工作流,让每一类任务都跑在性价比最优的模型上

  • 多模型统一入口:无需为每个大模型分别注册海外账号、配置支付方式,一套API Key打通全球主流模型,兼容OpenAI协议,一行代码即可切换模型,国内直连低延迟

  • 企业级定制能力:支持按需定制并发、配额、路由策略,满足高强度内容生成、自动化智能体、大规模文档处理等重消耗场景

  • 合规的基础设施:提供企业级SLA保障,规避个人开发者难以解决的地区可用性门槛与数据中心IP风控风险

💡 对于研发与运营团队而言,可参考"四层调度框架":用GPT-5.6 Luna承接约80%的常规任务(客服问答、摘要、常规代码改动、内容分类、自动化工作流),以最低成本覆盖最大调用量;用Terra处理需要更稳定质量的日常专业工作;当遇到复杂长周期专业工作流、跨领域知识工作等攻坚任务时,切换至GPT-5.6 Sol级别模型;当遇到仓库级代码修复等Fable 5极具优势的任务时,亦可灵活调用Claude Fable 5。在UseAIAPI渠道5折优惠的基础上,这套"Luna预处理+Terra日常+Sol/Fable 5攻坚"的分层选型策略,综合性价比优势将进一步放大——既享受到Sol在ALE上53.6分的代差优势,又通过合理的任务路由与渠道优惠,让每一类任务都跑在性价比最优的模型上。

人工智能正在变得像自来水一样唾手可得——而让这股水源稳定、经济地流入企业生产线,让每一家企业都能在"模型能力分化、价格断崖式下探"的新时代里找到最优的成本与性能平衡点,正是新一代接入服务的核心价值所在。