← 返回 Blog

左脚踩右脚:GPT-5.6 如何用"自优化"把端到端推理成本砍掉五分之一

2026 年 7 月 29 日,OpenAI 公布一组数据,震惊整个 AI 行业:GPT-5.6 Sol 通过 Codex 参与优化 OpenAI 的生产推理栈,最终实现端到端服务成本下降 20%,Token 生成效率提升超 15%​ 。

OpenAIGPT-5.6

左脚踩右脚登天:GPT-5.6 如何依靠"自我优化",将端到端推理成本降低五分之一

2026 年 7 月 29 日,OpenAI 公布一组数据,震惊整个 AI 行业:GPT-5.6 Sol 通过 Codex 参与优化 OpenAI 的生产推理栈,最终实现端到端服务成本下降 20%,Token 生成效率提升超 15%​ 。

次日,OpenAI 宣布 Luna 降价 80%、Terra 降价 20%,Sol 则新增极速模式(Fast mode),最高可达标准模式 2.5 倍运行速度 。

这并非普通层面的成本优化。模型上线生产环境后接到的第一项重大任务,就是给自己系统动手术。

模型化身自身的运维工程师

OpenAI 总裁格雷格·布罗克曼直言:GPT-5.6 Sol 能够做到"性能强悍、定价低廉",一大关键在于持续提升线上生产服务的运行效率。Codex 负责人蒂博·索蒂奥将这套思路总结为两步:先训练出能力足够强大的模型,再利用该模型优化所有组件——包括支撑自身运行的基础设施、推理堆栈与计算内核 。

业内将这套机制命名为 RSI(递归自优化,Recursive Self-Improvement),即让 AI 进入持续提升自身能力的闭环反馈链路。在 OpenAI 内部 RSI 测评中,GPT-5.6 Sol 得分相比前代 GPT-5.5 高出 16.2 分,目前位居 RSI 指数榜单首位。

投入真实生产环境之后,GPT-5.6 系统性攻克四大技术难题 :

第一大难题:负载均衡

OpenAI 的请求会先按照地区、算力容量、加速硬件类型进行初步分发,再依据集群内部负载、上下文长度、缓存可用状态二次调度。Sol 依托 Codex 分析线上真实流量,定位工程师此前未能发现的负载失衡问题,测试全新路由策略,并持续迭代启发式调度规则。

第二大难题:GPU 计算内核(最难攻克环节)

模型前向传播依靠 GPU 内核完成各类数学运算;而不合理的内存管理、同步机制、数据排布方式,会造成大量 GPU 算力空耗。Sol 识别出可预计算、可跳过、可并行执行的运算任务,使用 OpenAI 维护的两门 GPU 编程语言 Triton 与 Gluon,自主重写、优化生产内核。Triton 语言之父菲利普·蒂莱正是该项目核心作者。OpenAI 同时借助开源工具 FpSan(浮点精度校验工具),核验模型编写内核代码的正确性 。

第三大难题:推测解码

该技术原理为:先用小型草稿模型预生成若干 Token,再交由主模型并行校验。Sol 围绕草稿模型开展数百组架构实验,调整模型规模、结构与功能配置;甚至自主启动、监控训练流程,主动介入处理硬件故障、训练不稳定等异常。最终 Token 生成效率提升 15% 以上 。

第四大难题:KV 缓存与参数调优

批处理、模型分片、KV 缓存管理的最优配置高度依赖业务负载,可调参数空间巨大,以往主要依靠工程师经验调试。Sol 分析线上各类负载特征,生成并评估候选配置方案,最大化释放过去难以精细化调整的性能空间。

💡 需要客观指出的是:OpenAI 将这一过程明确定义为"在人类主导的流程中(Within a human-led process)"。代码能否上线、安全风险如何评估、优化目标如何设定,最终决策权依旧掌握在人类手中。模型确实可以实现自我优化,但"修改哪些内容、优化到什么程度、改动之后能否正式投产",人类仍处在整个决策环路之内。

20% 成本降幅从何而来,红利流向哪里

这 20% 的成本节省并非单一优化带来的成果,而是请求路由、加速器利用率、缓存机制、任务调度、内存迁移等多层优化叠加的效果 。

核心增益来自内核层:GPT-5.6 Sol 借助 Codex 改写 Triton、Gluon 内核,直接拉高 GPU 硬件利用率。除此之外,推测解码优化带来 15% 以上的 Token 生成效率提升,叠加负载均衡优化、KV 缓存复用,共同促成端到端服务成本下降 20% 。

优化带来的成本红利,第二天直接体现在官方定价表中 :

模型

调整前(7/9 发布)

调整后(7/30 起)

变化

Luna

输入 1 美元 / 输出 6 美元

输入 0.20 美元 / 输出 1.20 美元

降价 80%

Terra

输入 2.50 美元 / 输出 15 美元

输入 2 美元 / 输出 12 美元

降价 20%

Sol

输入 5 美元 / 输出 30 美元

输入 5 美元 / 输出 30 美元(新增 Fast 模式,速度为标准 2.5 倍)

价格不变 + 加速档

注:数据综合自 OpenAI 官方博文与财联社、大众新闻报道 。

OpenAI 策略十分清晰:旗舰型号定价分毫不动。​ 核心业务客户更看重结果与性能,对价格并不敏感。而 Luna 0.2 美元的输入单价,已经和谷歌 Gemini 2.0 Flash、自家 GPT-4o mini 处在同一梯队——这意味着 OpenAI 正在把"支撑智能体干活的模型"卖到过去"简单小模型的价位" 。

自演化闭环正式跑通

真正具备里程碑意义的不是 20% 这个数字,而是一套闭环系统成功落地 。

模型观测生产系统 → 定位性能瓶颈 → 输出优化方案 → 开展对照实验 → 处理各类故障 → 将验证有效的改进方案部署回支撑自身运行的基础设施。

一旦这套循环稳定运转,代表 AI 系统拥有了底层的自我演化能力。OpenAI 透露相关工作仍在持续推进,旨在构建更紧密的反馈循环:随着模型能力持续增强、自主工作范围扩大,效率提升速度也会不断加快 。

当然,现阶段还远未实现完整形态的递归自优化。人类仍处在整个决策环路之内。

但趋势已经清晰:模型正在从被优化的对象,转变为执行优化的主体。GPT-5.6 Sol 依托 Codex 对接生产推理堆栈,直击推理系统最核心的模块。一个模型学会 Triton 与 Gluon 语言,继而自主改写运行在 GPU 上的底层代码 。

AI 开始为自身运转服务,而这一切仅仅是开端。

从 OpenAI 的基础设施降本,到企业侧的接入降本

OpenAI 用 Sol 给自己"动手术",把端到端服务成本压低了 20%——这是基础设施层的降本。而当企业开发者想要把 GPT-5.6、Gemini 3.6 Flash、Claude Opus 5 等最新旗舰模型大规模接入生产环境时,同样面临一道现实的"成本关":高强度智能体工作流、长上下文、高并发调用,会让 Token 账单迅速膨胀。

在这一背景下,UseAIAPI​ 作为全球热门 AI 大模型的聚合接入服务平台,为企业用户提供了一条更为从容的路径 。

平台一站式覆盖 Gemini(含 3.6 Flash、3.5 Flash、3.1 Pro 等最新模型)、Claude、ChatGPT、DeepSeek 等主流厂商的最新旗舰模型。企业无需分别与各家厂商签约、对接、结算,即可通过统一接口灵活调用多模型能力,并根据业务场景自由切换——这对需要在"隐私合规""推理质量""响应速度""单 Token 成本"之间反复权衡的生产环境而言,意味着更高的架构韧性与更低的运维复杂度。

在具体的成本优化上,平台为企业用户提供了低至官方价格五折的优惠权益。以 Gemini 主力模型为例,通过 UseAIAPI 接入后的实际成本为 :

模型

官方价(输入/输出,每百万 Token)

UseAIAPI 接入价(输入/输出)

Gemini 3.6 Flash

1.50 / 7.50 美元

0.75 / 3.75 美元

Gemini 3.5 Flash

1.50 / 9.00 美元

0.75 / 4.50 美元

Gemini 3.1 Pro(≤200K)

2.00 / 12.00 美元

1.00 / 6.00 美元

Gemini 3.1 Pro(>200K)

4.00 / 18.00 美元

2.00 / 9.00 美元

注:上述权益数据源自 UseAIAPI 官方披露 。

叠加 Google 原生 Batch API 异步批处理 50% 折扣,对文档处理、分类、批量内容生成等离线友好型业务,成本优化空间显著。以 Gemini 3.1 Pro 处理超过 200K 上下文的重消耗场景为例,原本 18 美元/百万 Token 的输出价格,通过 UseAIAPI 接入可降至 9 美元——单这一项权益,就让原本因预算门槛而却步的大规模智能体工作流具备了落地可行性

更重要的是,UseAIAPI 提供企业级定制化部署服务,可根据业务规模、调用峰值、合规要求等因素,量身定制接入方案与技术支持 :

  • 海外合规节点直连原厂机房,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险;

  • 企业级 SLA 保障,提供高可用服务承诺与专业技术支持;

  • 可视化财务看板与精细化成本管控,支持按项目、模型溯源消耗;

  • 多模型统一路由,结合各厂商原生的 Batch、缓存机制,让"在正确的场景路由正确的模型"这一成本控制策略得以低成本实施。

💡 对开发者而言,AI API 的成本控制早已不是"选最便宜的模型",而是"选最便宜的任务完成成本"。OpenAI 用 Sol 给自己降本 20%,企业则可以通过 UseAIAPI 这样的聚合层把单位成本压到最低——真正实现"无忧接入、按需扩展",不再为高强度内容生成的消耗而担忧。

当模型开始"左脚踩右脚"、为自己优化基础设施,AI 产业的成本曲线正在被重新书写。OpenAI 的 20% 降本发生在云端,而企业的降本发生在接入层——两层降本叠加,才是这场"递归自优化"革命真正落到生产环境的完整图景。

选对模型只是起点,让模型"用得起、用得稳、用得合规",才是下一阶段 AI 工程化的真正考题。