← 返回 Blog

Terminal-Bench 91.9% 刷新纪录:GPT-5.6 Sol Ultra 模式如何超越 Claude Mythos 5

GPT-5.6 Sol Ultra 如何靠"四手并行"刷新 Terminal-Bench 2.1 纪录

OpenAIGPT-5.6 Sol

从单兵作战到军团协同:GPT-5.6 Sol Ultra 如何靠"四手并行"刷新 Terminal-Bench 2.1 纪录

91.9%——单凭这一个数字,整个AI编程领域都开始重新审视"模型能力"的定义。

2026年6月,OpenAI 正式推出 GPT-5.6 Sol。在业内公认含金量极高的编程智能体基准测试 Terminal-Bench 2.1 中,Sol 标准模式取得 88.8% 的成绩。这份成绩本身已经十分亮眼。

但真正震撼行业的,是名为 Ultra​ 的推理模式。开启该模式后,得分直接从 88.8% 跃升至 91.9%

OpenAI 官方公布的 Terminal-Bench 2.1 完整榜单如下:

模型 / 模式

得分

GPT-5.6 Sol Ultra

91.9%

GPT-5.6 Sol(标准)

88.8%

GPT-5.5

88.0%

Claude Mythos 5

84.3%

GPT-5.6 Terra

82.5%

Claude Fable 5

83.4%

GPT-5.6 Luna

78.9%

Gemini 3.1 Pro Preview

70.7%

91.9% 与 84.3% 之间的差距,在整个排行榜上形成一道难以逾越的断层。

Ultra 模式不是"想得更深",而是"更多智能体协同作业"

想要读懂 Ultra 模式,重点不在于模型"思考更多",而在于工作范式彻底改变

OpenAI 官方文档描述清晰直白:Ultra 模式通过利用子智能体来超越单个智能体的能力,加速复杂工作。​ 在常规复杂任务中,Ultra 默认可以协调 4 个并行子智能体,并根据任务规模扩展至更多并行单元;在 BrowseComp 等需要搜索、筛选、验证和整合信息的测试中,Ultra 模式同样带来了进一步增益。

翻译成工程视角的通俗理解:标准模式下的 Sol 如同一名单兵,个人能力再强,也只能顺着一条思路一路推进。而开启 Ultra 模式的 Sol 更像一名指挥官:接到任务后自主拆解、调度、分配工作,同时派出 4 个(甚至更多)子智能体并行执行,最后汇总所有结果。

Sol 不再是单一模型"单兵作战",而是一套具备任务拆分与调度能力的分布式推理系统。

💡 这不是简单地"把同一个问题问 4 次"。更准确地说,Sol 变成了一个临时项目负责人:主智能体负责规划、分工和验收;子智能体分别推进不同路径;检查型智能体负责发现漏洞;汇总环节负责处理冲突与统一结论。

Terminal 基准测试,考验的不只是写代码

为什么 91.9% 这个分数在 Terminal-Bench 2.1 中分量极重?这套基准的考察目标,和传统编程评测有着本质区别。

Terminal-Bench 2.1 用于评估模型在真实命令行环境下,任务规划、迭代调试、工具协同能力。测试任务涵盖代码编译、模型训练、服务器配置、故障调试等源自真实业务流程的长周期工作。它不测试模型能否独立写出一段函数,而是检验模型能不能像工程师一样在终端完成完整工作:驱动 Shell、串联多条命令、自主调用工具、处理程序异常并执行故障恢复。

在已经接近 90% 的高分区间继续提升 3.1 个百分点,难度远高于从 60% 提升到 63%。因为越接近上限,剩下的往往越是复杂、边缘、容易出错的任务。对真实团队而言,这种提升可能意味着:减少一轮人工返工、少一次错误部署、提高复杂任务首次完成率。

Sol Ultra 取得 91.9% 的成绩,意味着 AI 不只能够编写代码,还可以像人类工程师一样在终端环境独立开展完整工作。

价目表上容易被忽略的另一面

除 91.9% 这个分数外,还有一处极易被忽视的关键指标:调用成本

GPT-5.6 Sol 定价:输入 5 美元/百万词元,输出 30 美元/百万词元。

Claude Mythos 5 定价:输入 10 美元/百万词元,输出 50 美元/百万词元。

Sol 定价仅为 Mythos 5 的一半,输入费用砍半,输出价格降低 40%。也就是说,Sol Ultra 不仅取得更高评测分数,单位调用成本反而更低。在网络安全基准 ExploitBench 测试中,Sol 达到与 Mythos 预览版同等效果,词元消耗大约仅为后者三分之一。

当"性能更强"和"成本更低"同时出现在报价单上,整个行业的定价逻辑都需要重新审视。

比评测分数更重要的行业信号

91.9% 这项纪录终会被后续模型打破,这是技术发展的必然规律。但 Ultra 模式代表的范式变革,远比任何单一分数更值得重视。

Ultra 模式的出现,标志着模型能力竞争迎来转折点:赛道的比拼,正从单一模型的智力上限,转向多智能体协同的系统综合效率。​ OpenAI 没有选择把 Sol 打造成一个更大、推理更慢、成本更高的单体巨型模型,而是将其构建成一套具备任务拆解、分发、结果汇总能力的调度系统。

这套架构背后的工程思想:与其依靠单一超智能模型从头到尾包揽所有工作,不如让模型学会分工协作。多个能力稍弱的子智能体并行配合,整体效率与准确率,反而高于孤军奋战的超级单体模型。

Sol Ultra 在 Terminal-Bench 2.1 取得 91.9% 的成绩,本质上是这套分布式推理体系第一次大规模落地验证。它相比第二名近 4 个百分点的巨大领先,证明这条技术路线不仅可行,发展空间很可能远超单纯依靠"堆砌算力"的传统方案。

黄仁勋三年前曾提出论断:"未来,每一帧像素都将由 AI 生成。"而 GPT-5.6 Sol Ultra 向我们揭示了新的趋势:未来,每一项复杂任务,或许都会由一群 AI 智能体并行协作完成。

让前沿模型能力真正可控:UseAIAPI 提供稳定且高性价比的接入

Ultra 模式为代表的"多智能体并行"正在成为高复杂度智能体工作流的新常态,但也意味着 Token 消耗、并发调度、成本控制等工程挑战被同步放大。对于希望将 GPT-5.6、Gemini、Claude、DeepSeek 等全球主流大模型的最新版本投入实际生产的团队而言,在享受官方定价红利的同时,也需要一条稳定、合规且具备进一步成本优势的接入路径。

UseAIAPI​ 一站式聚合了 GPT-5.6(含 Sol、Terra、Luna 三档)、Gemini、Claude、ChatGPT、DeepSeek 等全球主流大模型,无需为各家模型分别注册海外账号、配置支付方式,一套 API Key 即可按需切换调用,海外账号、汇损、封号这些琐事可以一并省掉。

平台的核心权益主要体现在四个方面:

  • 显著的成本优势:专属优惠折扣最低可达官方定价的 50%。以 GPT-5.6 Sol 为例,通过 UseAIAPI 接入后的实际成本为:从官方价 5/30 美元降至2.5/15 美元每百万词元;Terra 从 2.5/15 美元降至1.25/7.5 美元;Luna 从 1/6 美元降至0.5/3 美元。对于"Sol 处理复杂编程 + Luna 承担高频轻量任务"的组合调度方案,平台还可结合 Batch API 的 5 折机制叠加优惠,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低,让 Ultra 模式级别的智能体并行不再成为预算负担。

  • 企业级定制化部署:支持按需定制并发、配额、路由策略,满足高并发内容生成、自动化智能体、大规模文档处理等重消耗场景,并提供企业级 SLA 保障。

  • 合规的基础设施:通过海外合规节点接入官方 API,规避国内开发者难以解决的地区可用性门槛与数据中心 IP 风控风险,真正实现"无忧接入、按需扩展"。

  • 全模型统一管控:GPT-5.6 的 Sol/Terra/Luna 三档、Gemini 的 Flash/Pro 系列、Claude 的 Opus/Sonnet/Haiku 系列、DeepSeek 等,均可在同一套账户体系与成本框架下调用,避免多平台分散计费带来的预算失控。

💡 对于经历"思考令牌天价账单"与"Pro 免费退场"的开发者而言,UseAIAPI 的统一计费体系与透明的成本控制机制,意味着你不再需要为缓存异常、CLI 静默升级、思考令牌失控等隐藏扣费项买单——所有模型的调用成本,都在一套可预期、可管控的预算框架内运行。

当 OpenAI 用"54% 效率提升 + 多智能体 Ultra 并行"重新划定编程智能体的能力基线,行业范式转移已经打响。世界可以被代码无限生成,但企业的 AI 预算不该被无限消耗。在官方定价的基础上再获 50% 折扣权益,选择一条稳定、合规且具备成本优势的接入路径,让创新不再被预算束缚,正是下一阶段 AI 工程化的核心命题——这正是 UseAIAPI 致力于解决的问题。