← 返回 Blog

7 月 21 日 Google 三连发:3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 全解析

2026年7月21日,Google DeepMind一口气发布三款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。本次没有旗舰Pro系列,全部为Flash产品线——主打轻量、高效、面向生产落地。

GeminiGemini 3.6 Flash

7月21日谷歌三连发:一场围绕"效率"的军备竞赛

2026年7月21日,Google DeepMind一口气发布三款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。本次没有旗舰Pro系列,全部为Flash产品线——主打轻量、高效、面向生产落地。

市场反馈十分直白。Alphabet单日股价下跌约4.4%,市值蒸发约2000亿美元。投资者期待的是Gemini 3.5 Pro的重磅亮相,等来的却是三款主打"省油高效"的模型。第三方评测机构Artificial Analysis的数据显示,谷歌当前主力Gemini系列综合实力已经跌至全球榜单十名以外,在头部大模型竞速赛道中显现压力。

⚠️ 但如果只盯着股价和榜单排名,就会错过真正值得关注的核心——谷歌这次主动放弃了"智力军备竞赛",转而发起了一场"效率军备竞赛"。

Gemini 3.6 Flash:不追求智力拔高,聚焦效率提升

3.6 Flash是本次发布的主角,官方定位为"主力干活模型(workhorse)"。它不是竞速赛马,而是务实耕牛。

它的核心卖点并非"变得更聪明",而是"更省钱"。根据Artificial Analysis的评测数据,对比3.5 Flash,3.6 Flash输出token消耗量平均下降约17%;在DeepSWE这类复杂代码任务中,token节省幅度最高可达65%。完成同等任务,更少废话、更少无效迂回,账单也随之变薄。

定价:输入1.50美元/百万token,输出7.50美元/百万token。对比3.5 Flash输出9.00美元/百万token,降幅约16.7%。速度表现尤为亮眼:第三方评测显示持续输出速度约 303 token/秒,是3.5 Flash(165 token/秒)的1.84倍;单任务平均耗时从2.7分钟压缩至1.3分钟,降幅超50%。

基准测试提升同样扎实:

  • DeepSWE(软件工程):37% → 49%

  • MLE-Bench(机器学习工程):49.7% → 63.9%

  • OSWorld-Verified(计算机操作):78.4% → 83.0%

  • GDPval-AA v2(知识工作):1349 → 1421

  • 知识截止时间:从2025年1月更新至 2026年3月

但有一个数字引爆舆论:Artificial Analysis智能指数50分,与3.5 Flash完全持平。"智力零提升""跌出全球前十"的报道铺天盖地。

而这恰恰是谷歌的设计意图。3.6 Flash并非智力迭代,而是效率优化。当下AI生产侧的大量开销集中在智能体工具调用、检索、代码辅助等高并发场景。一款智力够用、速度更快、成本更低的模型,价值或许远高于智力涨5分但价格翻倍的模型。

Gemini 3.5 Flash-Lite:专为跑量而生

如果说3.6 Flash是主力,Flash-Lite就是跑大规模流量的利器。

定价:输入0.30美元/百万token,输出2.50美元/百万token,输出速度最高可达350 token/秒,是3.6 Flash输入价格的约五分之一。面向分类、信息抽取、路由分发、摘要、轻量智能体、合成数据生成这类任务量大、单轮逻辑简单的场景。上下文窗口100万token,支持多模态输入。

在Artificial Analysis的评测中,Flash-Lite的智力指数从上一代的25分提升至36分,对于预算级轻量模型属于不小进步。但代价是连续三代token单价上涨:从0.10/0.40美元,到0.25/1.50美元,再到如今0.30/2.50美元。标准负载下,单任务成本近乎翻倍(0.04→0.09美元),不过单任务耗时下降约50%。

💡 结论十分清楚:Flash-Lite 不是"更弱的 3.6 Flash",而是 Agent 系统的"执行层"——主 Agent 拆解任务后,海量子 Agent 并行跑的粗活,交给它最划算。

Gemini 3.5 Flash Cyber:足够廉价,可无限扫描

第三款模型定位最为特殊。3.5 Flash Cyber基于3.5 Flash改造,是面向网络安全的专用模型,用于软件漏洞的发现、验证与修复。谷歌的出发点:AI挖掘漏洞的速度,已经超过人类修复漏洞的速度。要解决这种失衡,不需要更昂贵的大模型,而是需要一款足够便宜、可以无限次扫描调用的模型。

Cyber的价值就在于此:搭配谷歌自研的CodeMender代码安全智能体,通过多子Agent并行工作机制,可高效完成代码扫描、漏洞识别、风险验证、补丁生成、修复落地全流程作业。在CyberGym基准上,每份报告最多调用该模型5次,即可取得与更大、更昂贵的网络安全模型具有竞争力的结果;在Chrome生产环境提交扫描中,针对未公开漏洞测试,该模型相比主线Flash的成功率大幅提升。

由于存在明显的两用风险,谷歌仅向政府与可信合作伙伴开放有限试点,并通过Gemini Enterprise Agent Platform将CodeMender的基础能力开放给企业客户,并未公开独立API定价。

三支利箭齐发,指向同一个方向

三款模型覆盖从超低价到企业级、安全垂直领域的完整价格带。谷歌正在走一条差异化路线:面对Anthropic Fable 5的高分、OpenAI GPT-5.6的深度推理,它把效率与场景落地作为第一优化目标

模型

定位

输入/输出价(美元/百万token)

速度

开放状态

Gemini 3.6 Flash

主力效率型,承接复杂Agent、代码与知识工作

1.50 / 7.50

~303 token/s

已全面开放

Gemini 3.5 Flash-Lite

高吞吐、低延迟,跑量利器

0.30 / 2.50

350 token/s

已全面开放

Gemini 3.5 Flash Cyber

网络安全专用,基于3.5 Flash微调

未公开(按token计费低于大模型)

仅限政府与可信伙伴,通过CodeMender试点

数据来源:

跳票的Gemini 3.5 Pro,传闻因代码能力未达内部目标而延期,目前仍处于partner阶段测试中。谷歌已启动迄今为止规模最大的Gemini 4预训练项目。在Pro缺位、Gemini 4尚未面世的窗口期,这三款Flash模型就是Gemini生态下最务实的选择。

不求最强,但求最会干活。这大概就是谷歌想要传递的信号。

企业如何把"效率红利"进一步放大

对于企业和开发者而言,3.6 Flash的官方定价(1.50/7.50美元每百万token)与Flash-Lite(0.30/2.50美元)已经具备了极强的竞争力,尤其是面对高频智能体调用、大规模代码重构、批量文档处理等重消耗场景。但要真正把这份红利转化为企业账面上的成本优势,还需要解决三个现实问题:多模型统一管理、跨厂商灵活切换、企业级账单与稳定性

UseAIAPI作为源头大模型API供应商,提供了一条颇具成本效益的接入路径:

  • 成本优势显著:依托全球算力集采优势压降成本,优惠折扣最低可达官方价格的50%。以Gemini为例,借助UseAIAPI接入,3.6 Flash可从官方价1.50/7.50美元降至 0.75/3.75美元每百万token;3.5 Flash-Lite从0.30/2.50美元进一步下探至 0.15/1.25美元;即便是Gemini 3.1 Pro(200K以内),也可从官方2/12美元降至 1/6美元。让高频智能体调用、大规模代码重构、长文档分析等重消耗场景的单位成本压到更低

  • 模型覆盖全面:一站式聚合Gemini(含3.6 Flash、3.5 Flash-Lite、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球120+主流大模型,单一接口无缝调用,官方能力秒级同步。无论是当前的Gemini 3.6 Flash,还是未来正式发布的Gemini 3.5 Pro、Gemini 4,都能在第一时间接入使用,业务永远保持领先

  • 企业级定制能力:支持企业级定制化部署,提供可视化财务看板,支持按项目、模型溯源消耗;结合Batch API机制叠加优惠(谷歌官方Batch模式本身提供50%折扣,UseAIAPI在此基础上可进一步叠加),可将长上下文、高并发、持续运行的智能体工作流单位成本进一步压低。企业可以根据业务环节灵活路由——用Flash-Lite承接子Agent并行跑量、用3.6 Flash处理主Agent复杂编排、用3.1 Pro应对深度推理,把"在每一步应用最有用的智能,并为它创造的价值支付合适的价格"这一策略落到实处

  • 金融级可靠性:海外合规节点直连原厂机房,自研智能负载均衡,99.99% SLA保障;全球边缘节点加速,45ms骨干网络超低延迟,8.2k+企业与开发者信赖,规避个人开发者难以解决的地区可用性门槛与数据中心IP风控风险

💡 在实际生产中,3.6 Flash的"17% token节省 + 16.7% 官方降价"已经让单任务成本下降约30%;再叠加UseAIAPI的最低50%折扣权益与Batch API异步机制,对于每天数百万次调用的智能体工作流而言,整体成本较直接使用3.5 Flash官方价可压缩 60%以上——这才是谷歌"效率优先"策略在企业账面上的真实体现。

简而言之,通过UseAIAPI的统一接口,开发者和企业可以根据业务场景灵活路由——用Gemini 3.5 Flash-Lite承接高并发跑量、用Gemini 3.6 Flash处理复杂智能体编排、用Gemini 3.1 Pro应对深度推理——在Gemini 3.5 Pro或Gemini 4正式发布后亦可第一时间平滑接入,无忧接入、按需扩展,把大模型迭代的红利转化为真实的生产力。

9月即将到来,Gemini 3.5 Pro能否结束多次跳票正式登场?Gemini 4又将在何时带来怎样的惊喜?答案将由时间揭晓。

可以肯定的是,在"效率优先"与"深度优先"两条路线的博弈下,选对接入策略,比押注单个模型更重要。对于企业而言,建立灵活的模型接入层,方能在谷歌、Anthropic、OpenAI、DeepSeek四方混战的不确定性中,始终以最优成本享受最前沿的AI能力。