
左脚踩右脚登天,紧接着直接降价八成:GPT-5.6 的"自优化"与全球大模型价格战新局
2026 年 7 月 30 日,OpenAI 宣布优化 GPT-5.6 系列模型定价和性能。其中,GPT-5.6 Luna 模型价格下调 80%,GPT-5.6 Terra 模型价格下调 20%;旗舰模型 Sol 价格不变,但在 API 中推出 Fast 模式,取代此前的 Priority Processing 服务,最高可提升至标准模式 2.5 倍处理速度,价格为标准模式的 2 倍,且模型能力保持不变 。
这是继 7 月 9 日 GPT-5.6 系列发布仅三周之后的又一次重大调整。降价消息由 OpenAI CEO 萨姆·奥尔特曼亲自在 X 平台公布,他写道:"我们希望在每个层级都提供最佳的价格与智能水平的平衡。"
三款模型,三套打法
调整后的 GPT-5.6 系列价目表如下 :
模型 | 输入(旧→新,每百万 Token) | 输出(旧→新,每百万 Token) | 定位 |
|---|---|---|---|
Luna | 1.00 → 0.20 美元 | 6.00 → 1.20 美元 | 速度最快、成本最低 |
Terra | 2.50 → 2.00 美元 | 15.00 → 12.00 美元 | 日常工作平衡型 |
Sol | 5.00(不变) | 30.00(不变) | 旗舰推理 |
注:数据综合自 OpenAI 官方公告与奥尔特曼 X 平台发文 。
换算成人民币,Luna 输入单价大约从 6.8 元降至 1.35 元,输出从 40.6 元降至 8.1 元——这是直接砍去 80% 费用,不是八折优惠。Luna 0.2 美元的输入单价,已经和谷歌 Gemini 2.0 Flash、OpenAI 自家 GPT-4o mini 处在同一梯队 。
Luna 价格击穿市场,Terra 温和调价,Sol 不降价、单独售卖"算力速度"。 三款模型,三种商业策略,定位之清晰在 OpenAI 历史上是罕见的。
降价省下的成本从何而来?
OpenAI 的解释十分耐人寻味:这笔让利空间,是 GPT-5.6 Sol 自己挣出来的 。
准确来说,Sol 部署至 OpenAI 真实生产集群后,接手了原本需要工程师手动落地的多项工作 :
第一,梳理全链路生产数据流。 扫描全球推理集群,定位负载不均衡节点,测试全新路由调度策略,将请求分发至最合适的算力节点。
第二,重写 GPU 计算内核。 模型在 GPU 上完成运算,离不开底层程序支撑。Sol 使用 Triton、Gluon 两门 GPU 编程语言自主改写部分线上生产内核代码。Triton 语言之父菲利普·蒂莱,正是该项目核心作者。2021 年 OpenAI 发布 Triton 1.0 时,目标是让不懂 CUDA 的开发者写出接近专家水准的 GPU 程序;时隔五年,模型已经能够借助 Triton,改写自身运行在 GPU 上的底层代码。OpenAI 同时借助开源工具 FpSan(浮点精度校验工具)验证模型编写内核代码的正确性 。
第三,优化推测解码。 这项技术用小型草稿模型先生成候选 Token,再由主模型并行验证。Sol 围绕草稿模型自主设计、开展数百组架构实验,主动监控训练进程,遇到硬件故障、训练波动时自动介入处置。改进后 Token 生成效率提升 15% 以上 。
第四,自动搜寻最优部署参数。 面对短对话、超长上下文、代码任务等不同业务负载,自主寻找批处理、模型分片、KV 缓存管理的最优组合方案 。
四项优化叠加落地后,端到端服务成本下降 20% 。这套机制被业内命名为 RSI(递归自优化,Recursive Self-Improvement)——让 AI 进入持续提升自身能力的闭环反馈链路。
💡 需要客观指出的是:OpenAI 将这一过程定义为"在人类主导的流程中(Within a human-led process)"。代码能否上线、安全风险如何评估、优化目标如何设定,最终决策权依旧掌握在人类手中。模型确实可以实现自我优化,但"修改哪些内容、优化到什么程度、改动之后能否正式投产",人类仍处在整个决策环路之内。
这早已不止"AI 写代码",而是"AI 优化承载自己运行的整套系统"。 一套自循环闭环成功跑通:模型观测生产系统 → 定位性能瓶颈 → 输出优化方案 → 开展对照实验 → 处理各类故障 → 部署经过验证的改进方案。效率提升带来成本下降,成本下降最终反映为对外定价下调。
极速模式:把响应速度单独拆出来售卖
Sol 维持原价不变,但 Fast 模式背后的商业逻辑值得深入拆解。
这是 OpenAI 首次将"响应速度"独立设置为付费增值项。 标准版速度不够?支付双倍费用,获得 2.5 倍提速,模型智能能力保持不变。目标客户十分清晰:实时对话、流式内容生成、高并发服务等对延迟敏感的企业应用 。
背后的工程意义在于:OpenAI 已经实现"速度"与"模型智能度"解耦。过去想要更快的生成速度,往往要牺牲输出质量;现在不必如此。你多花一倍资金购买的是算力调度优先权,而非降级后的模型能力。
这套思路放在价格战里相当高明:旗舰型号不降价,守住"性能最强"的心理锚点;同时给愿意额外付费的客户提供更快交付结果的选项。不降基础定价,而是增加增值服务。
更深层次的行业变革
本次调价之后,Luna 的输入价格已经和前代 GPT-5.4 nano 持平,输出价格甚至便宜 0.05 美元。但两款模型能力完全不在一个层级:Nano 仅适合分类、信息提取这类简单杂活;Luna 支持工具调用、超长上下文处理与多步骤工作流执行 。
OpenAI 正在以过去小型轻量化模型的定价,售卖具备智能体(Agent)能力的大模型。
这件事的意义远超降价本身。低价模型不再只承担分类、信息提取这类传统"基础杂务",开始涉足代码评审、后端监控、工具调用等需要逻辑判断的场景。OpenAI 宣布,ChatGPT 应用与 Codex CLI 中的 Auto-review 功能将从 GPT-5.4 升级到 GPT-5.6 Luna,叠加模型迭代与降价,相关业务成本预计降至原先的十分之一 。
三款模型的分工如今一目了然:
Luna:预算敏感、大规模吞吐任务
Terra:常规日常业务
Sol:高难度复杂推理
Sol + Fast 模式:连标准版等待时延都无法接受的高价值场景
价目表之外的信号
本次距离 GPT-5.6 系列正式对外发布仅三周。如此快速的调价动作,意味着成本优化的节奏正在持续加快。Luna 调价之后,0.2 美元的输入单价已经低于 DeepSeek 同类产品,全球大模型价格战持续升温 。
但真正值得关注的并非冰冷的定价数字。Sol 参与优化自身赖以运行的系统,并把优化节省下来的成本转化为价目表上的优惠。一旦这套"左脚踩右脚"的正向循环持续运转,未来降价节奏只会越来越快。
AI 开始为自身运转服务,而它优化系统创造出的收益,直接印在了对外报价单上。
从 OpenAI 的基础设施降本,到企业侧的接入降本
OpenAI 用 Sol 给自己"动手术",把端到端服务成本压低了 20%——这是基础设施层的降本。而当企业开发者想要把 GPT-5.6、Gemini 3.6 Flash、Claude Opus 5 等最新旗舰模型大规模接入生产环境时,同样面临一道现实的"成本关":高强度智能体工作流、长上下文、高并发调用,会让 Token 账单迅速膨胀。
在这一背景下,UseAIAPI 作为全球热门 AI 大模型的聚合接入服务平台,为企业用户提供了一条更为从容的路径 。
平台一站式覆盖 Gemini(含 3.6 Flash、3.5 Flash、3.1 Pro 等最新模型)、Claude、ChatGPT、DeepSeek 等主流厂商的最新旗舰模型。企业无需分别与各家厂商签约、对接、结算,即可通过统一接口灵活调用多模型能力,并根据业务场景自由切换——这对需要在"隐私合规""推理质量""响应速度""单 Token 成本"之间反复权衡的生产环境而言,意味着更高的架构韧性与更低的运维复杂度。
在具体的成本优化上,平台为企业用户提供了低至官方价格五折的优惠权益。以 Gemini 主力模型为例,通过 UseAIAPI 接入后的实际成本为 :
模型 | 官方价(输入/输出,每百万 Token) | UseAIAPI 接入价(输入/输出) |
|---|---|---|
Gemini 3.6 Flash | 1.50 / 7.50 美元 | 0.75 / 3.75 美元 |
Gemini 3.5 Flash | 1.50 / 9.00 美元 | 0.75 / 4.50 美元 |
Gemini 3.1 Pro(≤200K) | 2.00 / 12.00 美元 | 1.00 / 6.00 美元 |
Gemini 3.1 Pro(>200K) | 4.00 / 18.00 美元 | 2.00 / 9.00 美元 |
注:上述权益数据源自 UseAIAPI 官方披露,官方定价参考 Google AI 2026 年公开定价 。
叠加 Google 原生 Batch API 异步批处理 50% 折扣,对文档处理、分类、批量内容生成等离线友好型业务,成本优化空间显著。以 Gemini 3.1 Pro 处理超过 200K 上下文的重消耗场景为例,原本 18 美元/百万 Token 的输出价格,通过 UseAIAPI 接入可降至 9 美元——单这一项权益,就让原本因预算门槛而却步的大规模智能体工作流具备了落地可行性。
更重要的是,UseAIAPI 提供企业级定制化部署服务,可根据业务规模、调用峰值、合规要求等因素,量身定制接入方案与技术支持 :
海外合规节点直连原厂机房,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险;
企业级 SLA 保障,提供 99.9% 以上的服务可用性承诺与 7×24 小时专业技术支持;
可视化财务看板与精细化成本管控,支持按项目、模型溯源消耗,支持对公结算;
多模型统一路由,结合各厂商原生的 Batch、缓存机制,让"在正确的场景路由正确的模型"这一成本控制策略得以低成本实施。
💡 对开发者而言,AI API 的成本控制早已不是"选最便宜的模型",而是"选最便宜的任务完成成本"。OpenAI 用 Sol 给自己降本 20%,企业则可以通过 UseAIAPI 这样的聚合层把单位成本压到最低——真正实现"无忧接入、按需扩展",不再为高强度内容生成的消耗而担忧。
当模型开始"左脚踩右脚"、为自己优化基础设施,AI 产业的成本曲线正在被重新书写。OpenAI 的 20% 降本发生在云端,而企业的降本发生在接入层——两层降本叠加,才是这场"递归自优化"革命真正落到生产环境的完整图景。
选对模型只是起点,让模型"用得起、用得稳、用得合规",才是下一阶段 AI 工程化的真正考题。大模型价格战的下一枪由 OpenAI 打响,而真正决定企业能否享受到这波红利的,往往是接入层的那最后一步。