← 返回 Blog

Gemini 3.6 Flash 来了:更聪明、更省 token、输出再降价

2026 年 7 月 21 日,财报前夕,Google DeepMind 一口气发布三款全新 Gemini 模型。 舆论场的反应十分耐人寻味。Arena.ai 前端代码竞技场数据显示,Gemini 3.6 Flash 得分 1537,位列第 12 名,跌出全球前十;Artificial Analysis 给出的智能指数为 50 分,和 3.5 Flash 完全持平。"智力零提升""史上最差"之类的标题铺天盖地。

GeminiGemini 3.6 Flash 的"效率优先"突围

当"智力零提升"成为头条:Gemini 3.6 Flash 的"效率优先"突围

2026 年 7 月 21 日,财报前夕,Google DeepMind 一口气发布三款全新 Gemini 模型。

舆论场的反应十分耐人寻味。Arena.ai 前端代码竞技场数据显示,Gemini 3.6 Flash 得分 1537,位列第 12 名,跌出全球前十;Artificial Analysis 给出的智能指数为 50 分,和 3.5 Flash 完全持平。"智力零提升""史上最差"之类的标题铺天盖地。

但如果只盯着"智力没有提升"这一点,你就错过了真正值得关注的部分。

谷歌的算盘:不当赛马,当耕牛

官方对 3.6 Flash 的定位只有一句话:主力干活模型(workhorse model)。它不是赛马,而是耕牛。Google 算盘打得很明白:比拼的不是智力上限,而是每一美元能换来多少有效产出

先看硬指标。根据谷歌官方数据与 Artificial Analysis 实测:

关键指标

Gemini 3.5 Flash

Gemini 3.6 Flash

变化

输入价格(每百万 token)

1.50 美元

1.50 美元

持平

输出价格(每百万 token)

9.00 美元

7.50 美元

下调 16.7%

输出速度

约 165 token/秒

约 304 token/秒

提升约 84%

单任务平均耗时

2.7 分钟

1.3 分钟

缩短 52%

输出 token 消耗量

基准

减少 17%

效率显著提升

Artificial Analysis 智能指数

50

50

持平

数据来源:

输出价格从 9 美元降至 7.5 美元——谷歌释放的信号十分明确:希望你用这款模型做"输出密集型"工作,例如智能体调用、代码生成、批量推理。

更关键的是 token 利用效率。谷歌官方数据显示,3.6 Flash 的输出 token 消耗量相比 3.5 Flash 平均下降 17%;在 DeepSWE 代码测试等部分基准中,token 消耗最高可节省 65%。Artificial Analysis 测算单任务成本从 0.59 美元降至 0.50 美元,降幅约 18%。

💡 把价格下降与 token 效率提升叠加,才是 3.6 Flash 真正的成本红利:调用同一套 API、完成同样的任务,输出 token 数量减少近两成;在特定的编程智能体场景中,降幅甚至超过 60%。

它真的"没变聪明"吗?

智能指数分数没有上涨,依旧维持 50 分。但在真实业务负载下,3.6 Flash 的提升肉眼可见:

  • DeepSWE(软件工程):37% → 49%

  • MLE-Bench(机器学习工程):49.7% → 63.9%

  • OSWorld-Verified(计算机操作):78.4% → 83.0%

  • GDPval-AA v2(知识工作):1349 → 1421

  • BenchLM 评测:平均分 83.0,远高于上代的 69.4

多模态视觉上,Roboflow 独立评测表明,3.6 Flash 在绝大多数图像任务上持平或优于 3.5 Flash,在视频理解上甚至拿下第一。唯一短板是目标检测:模型有点"偷懒",倾向输出一个大框,而非多个紧凑的小框。

所以,我们需要重新定义何为"更聪明"。

如果"聪明"指 Artificial Analysis 的综合智能指数,那它确实没有变化。但如果"聪明"指真实场景下,用更少 token、更短时间、更低成本完成同一任务,那它确实变强了。

谷歌的战略转向:效率优先

面对 Anthropic Fable 5 的高分、OpenAI GPT-5.6 的深度推理,Google 选择另一条赛道:把模型"效率"作为第一优化目标

这不是放弃竞争,而是重新定义竞争维度。开发者越来越关心"每一美元能拿到多少有效输出"。此时,一款"智力不涨,但跑得更快、效率更高"的模型,或许远比"智力涨 5 分、价格翻倍"的模型更有吸引力。

Gemini 3.6 Flash 保留 100 万 token 上下文窗口,知识库更新至 2026 年 3 月(较上代前进 14 个月),支持文本、图像、音频、视频多模态输入。它没有变笨,只是把优化优先级,从"变得更聪明"转向了"变得更高效"。

至于跳票的 Gemini 3.5 Pro,有传闻称其性能未达内部预期。彭博社披露,谷歌在 6 月下旬更新训练数据试图改善 coding 能力的尝试"结果令人失望"。谷歌 CEO 皮查伊在二季度财报电话会上坦言,公司已启动迄今为止规模最大的 Gemini 4 预训练项目,将 TPU 算力优先供给 AGI 前沿模型开发;业内预测 Gemini 4 大概率在 2026 年 11—12 月正式对外发布。

⚠️ 在 Pro 产品线缺位、Gemini 4 尚未到来的窗口期,3.6 Flash 就是 Gemini 生态里最务实的选择——不是因为它最强,而是因为它最懂得怎么把活干好。

企业如何把"效率红利"进一步放大

对于企业和开发者而言,3.6 Flash 的官方定价(1.50/7.50 美元每百万 token)已经具备了极强的竞争力,尤其是面对高频智能体调用、大规模代码重构等重消耗场景。但要真正把这份红利转化为企业账面上的成本优势,还需要解决三个现实问题:多模型统一管理、跨厂商灵活切换、企业级账单与稳定性

UseAIAPI​ 作为源头大模型 API 供应商,提供了一条颇具成本效益的接入路径:

  • 成本优势显著:依托全球算力集采优势压降成本,优惠折扣最低可达官方价格的 50%。以 3.6 Flash 为例,借助 UseAIAPI 接入,可在谷歌官方 1.50/7.50 美元每百万 token 的定价基础上进一步下探,让高频智能体调用、大规模代码重构、长文档分析等重消耗场景的单位成本压到更低;对于需要使用 3.1 Pro 处理深度推理任务的企业,50% 折扣同样意味着每百万输出 token 从 12 美元降至 6 美元,单次复杂推理任务的账单压力大幅缓解

  • 模型覆盖全面:一站式聚合 Gemini(含 3.6 Flash、3.5 Flash-Lite、3.1 Pro 等最新模型)、Claude、ChatGPT、DeepSeek 等全球 120+ 主流大模型,单一接口无缝调用,官方能力秒级同步。无论是当前的 Gemini 3.6 Flash,还是未来正式发布的 Gemini 3.5 Pro、Gemini 4,都能在第一时间接入使用,业务永远保持领先

  • 企业级定制能力:支持企业级定制化部署,提供可视化财务看板,支持按项目、模型溯源消耗;结合 Batch API 机制叠加优惠,可将长上下文、高并发、持续运行的智能体工作流单位成本进一步压低。企业可以根据业务环节灵活路由——用 3.6 Flash 处理 80% 的日常规模化任务(编码、文档、智能体编排),用 3.1 Pro 应对 20% 的深度推理高价值任务,把"在每一步应用最有用的智能,并为它创造的价值支付合适的价格"这一策略落到实处

  • 金融级可靠性:海外合规节点直连原厂机房,自研智能负载均衡,99.99% SLA 保障;全球边缘节点加速,45ms 骨干网络超低延迟,8.2k+ 企业与开发者信赖,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险

💡 在实际生产中,3.6 Flash 的"17% token 节省 + 16.7% 官方降价"已经让单任务成本下降约 30%;再叠加 UseAIAPI 的最低 50% 折扣权益与 Batch API 异步机制,对于每天数百万次调用的智能体工作流而言,整体成本较直接使用 3.5 Flash 官方价可压缩 60% 以上——这才是"效率优先"策略在企业账面上的真实体现。

简而言之,通过 UseAIAPI 的统一接口,开发者和企业可以根据业务场景灵活路由——用 3.6 Flash 承接 80% 的日常规模化任务、用 3.1 Pro 应对 20% 的深度推理——在 Gemini 3.5 Pro 或 Gemini 4 正式发布后亦可第一时间平滑接入,无忧接入、按需扩展,把大模型迭代的红利转化为真实的生产力。

9 月即将到来,Gemini 3.5 Pro 能否结束多次跳票正式登场?Gemini 4 又将在 11—12 月带来怎样的惊喜?答案将由时间揭晓。

可以肯定的是,在"效率优先"与"深度优先"两条路线的博弈中,选对接入策略,比押注单个模型更重要。对于企业而言,建立灵活的模型接入层,方能在谷歌、Anthropic、OpenAI、DeepSeek 四方混战的不确定性中,始终以最优成本享受最前沿的 AI 能力。