← 返回 Blog

AI 给自己写代码成真!GPT-5.6 Sol 重写 Triton/Gluon 内核,服务成本直降 20%

2026 年 7 月 30 日,OpenAI 发布官方博文披露:GPT-5.6 Sol 部署至真实生产环境后,通过 Codex 自主参与优化 OpenAI 的生产推理栈,最终实现端到端服务成本下降 20%,Token 生成效率提升超 15% 。同日发布的另一篇博文显示,在 ARC-AGI-3 基准上改用保留推理的评测配置后,Sol 的公开集得分从 13.3% 升至 38.3%,约为原来的 3 倍 。 GPT-5.6 Sol 是 7 月 9 日正式发布的旗舰模型,主打复杂代码开发、科研运算与网络安全场景 。但真正震撼 AI 行业的,并非它本身有多强大,而是它接到的第一项重大任务——给自己"动手术"。

OpenAIChatGPTGPT-5.6 Sol 的"自优化"实践与产业启示

当模型化身自身的运维工程师:GPT-5.6 Sol 的"自优化"实践与产业启示

武侠小说里那种"左脚踩右脚、凌空腾跃"的轻功,被 OpenAI 用一篇技术报告变成了现实。

2026 年 7 月 30 日,OpenAI 发布官方博文披露:GPT-5.6 Sol 部署至真实生产环境后,通过 Codex 自主参与优化 OpenAI 的生产推理栈,最终实现端到端服务成本下降 20%,Token 生成效率提升超 15% 。同日发布的另一篇博文显示,在 ARC-AGI-3 基准上改用保留推理的评测配置后,Sol 的公开集得分从 13.3% 升至 38.3%,约为原来的 3 倍 。

GPT-5.6 Sol 是 7 月 9 日正式发布的旗舰模型,主打复杂代码开发、科研运算与网络安全场景 。但真正震撼 AI 行业的,并非它本身有多强大,而是它接到的第一项重大任务——给自己"动手术"。

手术刀,我们亲手交给了模型

OpenAI 总裁格雷格·布罗克曼直言:GPT-5.6 Sol 能够做到"性能强悍、定价低廉",一大原因就是持续优化线上生产服务的运行效率 。

这背后是一套完整的工程理念。Codex 负责人蒂博·索蒂奥将其总结为两步:首先训练出能力足够强大的模型,再利用这个模型优化一切系统组件——包括承载自身运行的基础设施、推理堆栈与计算内核。

技术圈给这套逻辑起了一个专有名词:RSI(递归自优化,Recursive Self-Improvement),也就是让 AI 进入"持续提升自身能力"的闭环反馈体系。

GPT-5.6 正式投产后,Sol 主要完成了四项核心工作 :

第一,分析全链路生产数据流。​ 扫描 OpenAI 全球推理集群,定位负载不均衡的节点,测试全新路由策略,把用户请求调度至最合适的算力节点;集群内部还会参考负载、上下文长度、缓存可用性等因素分发任务。

第二,重写生产计算内核。​ 这是难度最高的一环。深入解析模型前向传播流程,识别可合并运算、可跳过计算、可并行执行的模块;依托 Codex,自主使用 Triton、Gluon 这两门 GPU 编程语言改写底层内核代码。Triton 语言之父菲利普·蒂莱,正是该项目的作者之一。正确性由开源工具 FpSan(浮点精度校验工具)验证 。

第三,优化推测解码机制。​ 推测解码的原理是先用小型草稿模型预生成若干 Token,再由大模型并行校验。GPT-5.6 Sol 自主设计并完成数百轮架构实验,测试不同草稿模型的规模、结构与参数,主动监控训练流程、自动处理硬件故障 。

第四,自动搜寻最优部署参数。​ 面对短对话、超长上下文、代码任务等不同业务负载,自主调试批处理、模型分片、KV 缓存管理的最优组合方案。

💡 需要客观指出的是:OpenAI 在官方博文中明确将这一过程定义为"在人类主导的流程中(Within a human-led process)" 。代码能否上线、安全风险如何评估、优化目标如何设定,最终决策权依旧掌握在人类手中。模型确实可以实现自我优化,但"修改哪些内容、优化到什么程度、改动之后能否正式投产",人类仍处在整个决策环路之内。

当四项工作串联起来,GPT-5.6 就不再只是一款"供工程师调用的工具",而是一名改造整套模型运行体系的工程师。

20% 的成本降幅,究竟从何而来

服务成本降低 20%,并不是单一优化带来的成果,而是整套系统性优化叠加后的综合效果 。

最核心的贡献来自内核层。GPT-5.6 Sol 借助 Codex 改写 Triton 与 Gluon 内核,直接拉高 GPU 硬件利用率。OpenAI 同时使用开源工具 FpSan 验证模型编写内核代码的正确性。

另一部分增益来自推测解码的升级。OpenAI 报告显示,优化后 Token 生成效率提升 15% 以上,意味着单次推理请求可以用更少算力产出更多文本 。

除此之外,负载均衡优化、KV 缓存复用、请求调度策略调整……多项改进叠加在一起,最终达成 20% 的服务成本下降。

比省下 20% 成本更关键:闭环体系成功跑通

真正值得关注的,并不是 20% 这个数字本身,而是一套自循环系统顺利落地 。

模型观测生产系统 → 定位性能瓶颈 → 输出优化方案 → 开展对比实验 → 处理各类故障 → 将经过验证的改进方案部署回支撑自身运行的基础设施。

一旦这套循环稳定运转,意味着 AI 系统具备了底层自我演化能力。OpenAI 在博文中写道:"这项工作仍在继续,形成了一个更紧密的反馈循环:随着我们的模型不断改进并能够更自主地工作,我们提升效率的能力也在加速。"

这套逻辑带来的连锁反应,已经直接体现在定价层面。7 月 30 日,OpenAI 宣布对 GPT-5.6 系列进行价格调整 :

模型

调整前(7/9 发布)

调整后(7/30 起)

变化

Sol

输入 5 美元 / 输出 30 美元

输入 5 美元 / 输出 30 美元(新增 Fast 模式,速度为标准 2.5 倍,价格 ×2)

价格不变 + 加速档

Terra

输入 2.50 美元 / 输出 15 美元

输入 2 美元 / 输出 12 美元

降价 20%

Luna

输入 1 美元 / 输出 6 美元

输入 0.20 美元 / 输出 1.20 美元

降价 80%

注:数据综合自 OpenAI 官方博文与海峡导报等媒体报道 。

依托 GPT-5.6 Sol 的自主优化能力,OpenAI 把 Luna 的降价幅度做到了 80%。OpenAI 官方表示,Luna 当前的综合能力已能对标一年前的顶尖模型,但成本仅相当于当时的 6%,推理速度提升 9 倍;在专业工作基准测试 Agents' Last Exam 中,Luna 的表现优于 Anthropic 的 Claude Fable 5,而每项任务的成本降低近 99% 。

趋势已经十分清晰:模型正在从被优化的对象,转变为执行优化的主体。Triton 诞生之初,目标是让不熟悉 CUDA 的开发者,写出接近专家水准的 GPU 程序。五年过去,GPT-5.6 已经能够使用 Triton,改写自身运行在 GPU 上的底层代码 。

AI 开始为自己工作。而这一切,仅仅只是开端。

从 OpenAI 的基础设施降本,到企业侧的接入降本

OpenAI 用 Sol 给自己"动手术",把端到端服务成本压低了 20%——这是基础设施层的降本。而当企业开发者想要把 GPT-5.6、Gemini 3.6 Flash、Claude Opus 5 等最新旗舰模型大规模接入生产环境时,同样面临一道现实的"成本关":高强度智能体工作流、长上下文、高并发调用,会让 Token 账单迅速膨胀。

在这一背景下,UseAIAPI​ 作为全球热门 AI 大模型的聚合接入服务平台,为企业用户提供了一条更为从容的路径。

平台一站式覆盖 Gemini(含 3.6 Flash、3.5 Flash、3.1 Pro 等最新模型)、Claude、ChatGPT、DeepSeek 等主流厂商的最新旗舰模型。企业无需分别与各家厂商签约、对接、结算,即可通过统一接口灵活调用多模型能力,并根据业务场景自由切换——这对需要在"隐私合规""推理质量""响应速度""单 Token 成本"之间反复权衡的生产环境而言,意味着更高的架构韧性与更低的运维复杂度。

在具体的成本优化上,平台为企业用户提供了低至官方价格五折的优惠权益。以 Gemini 主力模型为例,通过 UseAIAPI 接入后的实际成本为 :

模型

官方价(输入/输出,每百万 Token)

UseAIAPI 接入价(输入/输出)

Gemini 3.6 Flash

1.50 / 7.50 美元

0.75 / 3.75 美元

Gemini 3.5 Flash

1.50 / 9.00 美元

0.75 / 4.50 美元

Gemini 3.1 Pro(≤200K)

2.00 / 12.00 美元

1.00 / 6.00 美元

Gemini 3.1 Pro(>200K)

4.00 / 18.00 美元

2.00 / 9.00 美元

叠加 Google 原生 Batch API 异步批处理 50% 折扣,对文档处理、分类、批量内容生成等离线友好型业务,成本优化空间显著。以 Gemini 3.1 Pro 处理超过 200K 上下文的重消耗场景为例,原本 18 美元/百万 Token 的输出价格,通过 UseAIAPI 接入可降至 9 美元——单这一项权益,就让原本因预算门槛而却步的大规模智能体工作流具备了落地可行性

更重要的是,UseAIAPI 提供企业级定制化部署服务,可根据业务规模、调用峰值、合规要求等因素,量身定制接入方案与技术支持:

  • 海外合规节点直连原厂机房,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险;

  • 企业级 SLA 保障,提供 99.9% 以上的服务可用性承诺与 7×24 小时专业技术支持;

  • 可视化财务看板与精细化成本管控,支持按项目、模型溯源消耗,支持对公结算;

  • 多模型统一路由,结合各厂商原生的 Batch、缓存机制,让"在正确的场景路由正确的模型"这一成本控制策略得以低成本实施。

💡 对开发者而言,AI API 的成本控制早已不是"选最便宜的模型",而是"选最便宜的任务完成成本"。OpenAI 用 Sol 给自己降本 20%,企业则可以通过 UseAIAPI 这样的聚合层把单位成本压到最低——真正实现"无忧接入、按需扩展",不再为高强度内容生成的消耗而担忧。

当模型开始"左脚踩右脚"、为自己优化基础设施,AI 产业的成本曲线正在被重新书写。OpenAI 的 20% 降本发生在云端,而企业的降本发生在接入层——两层降本叠加,才是这场"递归自优化"革命真正落到生产环境的完整图景。

选对模型只是起点,让模型"用得起、用得稳、用得合规",才是下一阶段 AI 工程化的真正考题。