← 返回 Blog

7 月 21 日 GA!Gemini 3.6 Flash 输出降价 $1.5/M,智能体规划能力大幅跃升

2026 年 7 月 21 日,谷歌 DeepMind 一次性推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber。三款模型各司其职,但 Gemini 3.6 Flash 毫无疑问处于核心 C 位——正式全面可用(GA)当日,模型即通过 Gemini API、Google AI Studio、Vertex AI 等渠道向所有开发者开放,没有排队配额、没有受限预览,上线即可使用。

GeminiGemini 3.6 Flash 深度解读

Gemini 3.6 Flash 深度解读:不靠智力跑分,凭借执行效率抢占智能体赛道

2026 年 7 月 21 日,谷歌 DeepMind 一次性推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber。三款模型各司其职,但 Gemini 3.6 Flash 毫无疑问处于核心 C 位——正式全面可用(GA)当日,模型即通过 Gemini API、Google AI Studio、Vertex AI 等渠道向所有开发者开放,没有排队配额、没有受限预览,上线即可使用。

定价方面,3.6 Flash 输入令牌单价 1.5 美元/百万,输出 7.5 美元/百万。输入价格与 3.5 Flash 保持一致,输出价格从 9 美元下调至 7.5 美元,每百万输出令牌节省 1.5 美元。对于智能体这类输出令牌占据成本大头的场景,单位调用成本的下降趋势不言而喻。

智力评分未见增长,实战工作能力显著增强

将 3.6 Flash 简单称作"升级版本"其实并不准确。

第三方评测机构 Artificial Analysis 给出的数据显示,3.6 Flash 智力指数恰好为 50 分,和 Gemini 3.5 Flash 完全持平。网络上随即出现大量论调:"谷歌史上最差模型""智力毫无提升"。

但若仔细研读 3.6 Flash 在实战基准上的成绩单,事实并非如此。谷歌 DeepMind 官方模型卡显示,在多项核心智能体基准上,3.6 Flash 相比 3.5 Flash 取得实质性跃升:

基准测试

测试焦点

3.6 Flash

3.5 Flash

变化

DeepSWE v1.1

长周期软件工程

49%

37%

+12 分

MLE-Bench

机器学习工程

63.9%

49.7%

+14.2 分

OSWorld-Verified

智能体电脑操作

83.0%

78.4%

+4.6 分

SWE-Bench Pro

多样化智能体编码

58.7%

55.1%

+3.6 分

Terminal-Bench 2.1

智能体终端编码

78.0%

76.2%

+1.8 分

GDPval-AA v2

知识工作 Elo

1421

1349

+72

传统基准测试偏向"能不能答对题目";而上述基准检验模型能否完整落地工作:给定资料、可用工具、约束条件与交付标准,考核最终任务完成度。在这个维度上,Flash 系列迈出了一大步。

💡 本次升级核心关键词不是"变得更聪明",而是"少走弯路"。

智能体任务规划能力:从"知道怎么做"进化为"快速落地"

智能体任务规划能力——也就是 AI 拆解复杂任务、规划执行链路、调用工具完成多步骤工作的能力,是 3.6 Flash 最突出的优化方向。

一系列数据背后有着统一规律:处理多步骤任务时,该模型所需的推理轮次、工具调用次数更少。

举一个直观对比:代码迁移对照实验中,3.6 Flash 规划耗时 20 秒,低于 3.5 Flash 的 24 秒;整体迁移耗时从 2 分 08 秒缩短至 1 分 20 秒,总耗时降幅约 34%。

这并非智力水平提升,而是路径规划效率优化。好比两名智力相当的快递员,一人四处绕路,另一人掌握最优路线,后者可以优先完成配送。

"精简无效输出"本身就是重要能力

3.6 Flash 还有一处容易被忽视的优化:输出更加简洁,减少冗余文字

根据 Artificial Analysis 指数,相较 3.5 Flash,3.6 Flash 平均输出令牌数量降低 17%;在 DeepSWE 这类长周期代码工程场景中,输出令牌消耗量最高可下降约 65%。

谷歌官方数据显示,3.6 Flash 输出速度约 304 令牌/秒。

对于开发者意味着什么?智能体执行任务令牌消耗降低 17%,结合输出单价下调 16.7%,单任务有效成本可下降 30% 左右——三重优势叠加。一旦系统每日承载成百上千条智能体任务,这就不再是微小优化,而是量级层面的差距。

为何效率优化远比单纯"提高智力分数"更重要

谷歌对 3.6 Flash 的定位相当克制。官方模型卡直白写明:Gemini 3.6 Flash 适用于智能体工作流、编码任务以及持续数周的企业级流程

而这份克制恰恰值得深思。

过去两年,各大大模型厂商竞争主线是"谁能打造智力更强的模型"。时至 2026 年,AI 真正大规模落地生产环境,成为每日亿万次调用的基础设施,单任务成本、响应速度、运行稳定性,会比智力榜单上区区几分差距更加关键。

推出 3.6 Flash 本质上是回答一道问题:当 AI 智能体成为流水线里的执行者,我们更看重它的理论智力,还是实际执行效率?

谷歌给出的答案是后者。不再执着追逐智力指数的数字竞赛,而是让模型在真实业务任务中少走弯路、少说废话、控制开销。这或许缺少噱头,但对于真正依靠 AI 搭建产品的开发者而言,价值远胜于刷新基准榜单。

7 月 21 日正式 GA 上线当天,谷歌没有发布一款跑分更高的模型,而是推出一款任务执行效率更强的模型。在 AI 行业从"探索可能性"迈向"创造实用价值"的当下,这或许是更加正确的演进方向。

当效率成为核心竞争力,模型接入更需稳定底座

3.6 Flash 的发布揭示了一个确定性趋势:AI 智能体大规模落地的瓶颈,已经从"模型够不够强"转向"调用够不够省、够不够稳"。对于需要大规模调用 Gemini、Claude、ChatGPT、DeepSeek 等全球主流大模型的团队而言,逐一注册海外账号、配置跨境支付、应对地区可用性限制,往往比模型本身更难攻克。

UseAIAPI​ 一站式聚合上述全球主流大模型的最新版本,支持企业级定制化部署,让开发者无需为每个大模型分别注册海外账号,一套 API Key 即可打通多模型调用

在具体权益上,平台的优势体现为三个层面:

显著的价格优惠。UseAIAPI 平台折扣最低可达官方价格的 50%。叠加谷歌原生 Batch 与 Flex 模式的 5 折机制(Flex 利用非高峰闲置算力提供标准价 5 折、Batch 异步批处理同样 5 折),单位成本可以进一步压低。对于以 3.6 Flash 为底座的高并发智能体场景,这意味着每一个任务的调用成本都能打到行业极低水位——谷歌官方下调输出单价 16.7%、3.6 Flash 自身再省 17% 输出令牌,叠加 UseAIAPI 的 5 折权益,单任务有效成本较 3.5 Flash 时代可实现数量级优化。

企业级定制能力。平台支持按需定制并发、配额与路由策略,满足高强度内容生成、自动化智能体、大规模文档处理等重消耗场景。企业用户可根据业务特征灵活配置,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低,真正让 3.6 Flash 的"高吞吐、低成本"红利跑到极致。

合规的基础设施。通过海外合规节点接入官方 API,提供企业级 SLA 保障,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险。平台层面可对接 Gemini API 原生的项目支出上限与使用分层机制,让开发者同样享受到谷歌 2026 年推出的预算管控能力,实现成本精细化管控。

💡 当 3.6 Flash 把"前沿能力 + 降价 16.7%"变成行业新常态,真正决定企业竞争力的,是以多低的成本、多高的稳定性,把每一次模型迭代的红利稳定地用起来。通过 UseAIAPI 接入,叠加最低官方价 5 折的优惠权益与谷歌原生的 Flex/Batch 5 折折扣,让 3.6 Flash 级别的"高吞吐、低成本"红利真正落到工程实践中,不再为高频调用的成本压力而担忧。

从 3.6 Flash 的"执行效率优先"定位,到 UseAIAPI 的模型接入普惠——AI 规模化落地的完整基础设施,正在一次次迭代中清晰成形。而当这套能力真正触达每一位开发者时,"AI 劳动力"才不再是一句比喻,而是每一次 API 调用中真实运转的现实。