← 返回 Blog

小模型先答、大模型验收:GPT-5.6 靠"推测解码"自优化撬动 15% 吞吐提升

GPT-5.6 Sol完成了一件重塑整条推理效率链路的事:它亲自优化规模远小于自身的草稿模型,并依靠这个模型实现推理加速。 这并非理论推演,而是OpenAI披露的工程细节:Sol通过Codex参与优化生产推理栈,端到端服务成本降低20%,词元生成效率提升15%以上。

OpenAIGPT-5.6 Sol

Sol亲手优化的"小兄弟":当AI开始为自己设计加速器

GPT-5.6 Sol完成了一件重塑整条推理效率链路的事:它亲自优化规模远小于自身的草稿模型,并依靠这个模型实现推理加速。

这并非理论推演,而是OpenAI披露的工程细节:Sol通过Codex参与优化生产推理栈,端到端服务成本降低20%,词元生成效率提升15%以上。

推测解码:一套精心设计的"大小协同机制"

要理解Sol这项工作的分量,首先需要厘清:什么是推测解码(Speculative Decoding)?

大模型生成词元本质上是串行流程:逐词生成,产出每一个词元都需要执行一轮完整GPU前向计算。这套流程算力开销巨大,并且无法并行执行:第N个词元没有完成计算,就无法启动第N+1个词元的运算。

推测解码的思路十分巧妙:部署轻量化草稿模型与主模型协同工作。小模型以极低算力成本先行生成一串候选词元,随后主模型一次性并行校验全部预测结果。预测无误则直接采信;预测出错,完成修正后继续生成。

通俗概括:小模型先行猜测一段文本,大模型一次性完成核验修正。

这套方案将串行计算转为并行计算,摆脱大模型逐词"挤牙膏"式生成的瓶颈。原本主模型想要生成N个词元,需要执行N次前向运算;如今仅需一轮运算,并行完成多个词元的校验

这项技术本身早已问世,真正具有突破性的一点在于:负责完成这套机制优化工作的工程师,正是Sol自身。

Sol一手打磨的"小兄弟"

OpenAI将GPT-5.6 Sol以智能体形式接入生产推理集群,分配的任务目标清晰明确:优化与它协同工作的草稿模型。

Sol具体完成了哪些工作?

第一,自主设计对照实验。

Sol独立设计并开展数百组系统性控制实验。实验维度覆盖小型模型参数量、网络拓扑结构、功能模块组合。它在多维参数空间内同步搜寻最优解:匹配合理算力开销、筛选效率最优网络结构,确定功能模块的取舍。

第二,独立启动训练流程。

实验方案敲定后,Sol自主发起并全程监管整套训练流程:寻找闲置GPU资源、确定训练配置、编写启动脚本、确认任务正常运行,全程无需人类工程师介入

第三,自主处置各类故障。

训练过程中一旦遭遇硬件故障、训练震荡等异常问题,Sol主动介入并完成处理

整套流程里,Sol身兼实验设计者、实验执行者、故障处理者多重角色。它在生产环境持续迭代调优,直至找到综合性能最优的草稿模型配置。

15%效率提升从何而来

这套"自研配套草稿模型"闭环落地之后,最终实现词元生成效率提升超15%。

OpenAI官方表述:依托推理解码机制优化,词元生成效率提升15%以上。技术细节显示:Sol围绕配套草稿模型自主设计并运行数百组架构实验,测试不同模型规模、网络结构与参数配置;每一组实验涉及模型启动、运行监控、故障排查,全部由Sol独立完成。

换个角度理解该数据:硬件资源、耗时不变的前提下,模型单次推理能够多产出15%以上的词元。​ 当前AI业务需求增速持续超过算力扩容速度,这15%的提升意味着实打实的成本优势与吞吐性能优势。

推测解码优化成果,叠加Sol另一项生产优化工作——自主重写Triton、Gluon GPU内核,两项优化共同促成端到端服务成本下降20%。

💡 一次主模型计算便可以确认多个词元——这意味着"降本"和"提速"不是二选一,而是同一套机制的两个侧面。

比15%提速更重要:范式发生转变

Sol自主优化配套草稿模型这件事,意义远不止15%的性能增幅。

它标志着范式切换:模型正在从被优化的对象,转变为执行优化的主体

OpenAI内部将该体系称为RSI(Recursive Self Improvement,递归自我改进)。Codex负责人蒂博·索蒂奥将OpenAI的发展路线总结为两步:先训练能力足够强大的基础模型,再利用该模型优化一切系统,包括自身运行基础设施、推理堆栈与底层内核。

OpenAI总裁格雷格·布罗克曼表述更为直白:GPT-5.6 Sol兼顾高性能与低成本,核心驱动力就是持续推进生产服务效率优化。

当然,现阶段还谈不上完全的"AI自主演化"。代码能否上线、安全评估标准、优化目标如何设定——最终决策权依旧掌握在人类手中,人类持续处于管控闭环内。

但趋势已经十分清晰:Sol不仅能够编写代码,还可自主设计实验、训练模型、监控运行流程、处理故障、验证实验结论。它已经从被动调用的工具,进化成一款能够优化其他模型的模型

超越性能提升的深层思考

GPT-5.6 Sol自主优化配套草稿模型,存在一处极易被忽略的关键细节:草稿模型规模远小于Sol,但整套训练、调优工作全部由Sol独立完成。

这背后意味着什么?说明Sol不仅理解自身推理逻辑,还掌握如何借助轻量化版本的"自己"实现加速。它清楚哪些计算环节能够提前预判,知晓小型模型取多大规模才能平衡效率与准确率,同时掌握训练过程中的纠错手段。

一个模型能够读懂另一套模型的运行逻辑——即便后者规模更小,这件事值得深度思考,其价值远超15%的效率提升。

OpenAI将整套路径归纳为两步:首先训练足够强大的基础模型,再依靠这个强大模型持续优化一切。

而第二步,才刚刚拉开序幕。

当模型学会为自己降本:UseAIAPI 让前沿模型能力真正可控

Sol自主优化推理栈、把服务成本压低20%之后,OpenAI在7月30日公布了全新的价格体系:GPT-5.6 Luna输入价格从每百万Token 1美元下调至0.20美元,输出由6美元降至1.20美元,降幅高达80%;Terra降价20%;旗舰Sol维持原价但新增极速模式(Fast mode,速度为标准版2.5倍,资费翻倍)。

AI行业的价格战已经打响。但对于希望将GPT-5.6、Gemini、Claude、DeepSeek等全球主流大模型的最新版本投入实际生产的团队而言,在享受官方降价红利的同时,也需要一条稳定、合规且具备进一步成本优势的接入路径。

UseAIAPI​ 一站式聚合了GPT-5.6(含Luna、Terra、Sol及Fast模式)、Gemini、Claude、ChatGPT、DeepSeek等全球主流大模型,无需为各家模型分别注册海外账号、配置支付方式,一套API Key即可按需切换调用。

平台的核心权益主要体现在四个方面:

  • 显著的成本优势:专属优惠折扣最低可达官方定价的 50%。以刚降价的GPT-5.6为例,通过UseAIAPI接入后的实际成本为:Luna从官方价0.20/1.20美元降至0.10/0.60美元每百万Token;Terra从2/12美元降至1/6美元每百万Token;Sol从5/30美元降至2.5/15美元每百万Token。叠加OpenAI原生的Batch 5折与缓存机制,在代码生成、长文本处理、批量内容产出、多智能体并行等高频企业场景里,单位调用成本相较直连官方通常能再降40%–50%,让高强度内容生成不再成为预算负担。

  • 企业级定制化部署:支持按需定制并发、配额、路由策略,满足高并发内容生成、自动化智能体、大规模文档处理等重消耗场景,并提供企业级SLA保障。

  • 合规的基础设施:通过海外合规节点接入官方API,规避个人开发者难以解决的地区可用性门槛与数据中心IP风控风险,真正实现"无忧接入、按需扩展"。

  • 全模型统一管控:GPT-5.6的Luna/Terra/Sol三档、Gemini的Flash/Pro系列、Claude的Opus/Sonnet系列,均可在同一套账户体系与成本框架下调用,避免多平台分散计费带来的预算失控。

💡 对于经历过"思考令牌天价账单"与"Pro免费退场"的开发者而言,UseAIAPI的统一计费体系与透明的成本控制机制,意味着你不再需要为缓存异常、CLI静默升级、思考令牌失控等隐藏扣费项买单——所有模型的调用成本,都在一套可预期、可管控的预算框架内运行。

当OpenAI用"模型优化模型"把Luna打到0.20美元,行业价格战已经打响。世界可以被代码无限生成,但企业的AI预算不该被无限消耗。在官方降价的基础上再获50%折扣权益,选择一条稳定、合规且具备成本优势的接入路径,正是UseAIAPI致力于解决的问题。