
Gemini 3.6 Flash发布、App月活突破9.5亿:谷歌用"低成本主力模型"撬动AI规模时代
2026年7月21日,谷歌DeepMind一次性发布三款全新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及面向安全领域的Gemini 3.5 Flash Cyber。次日Alphabet发布第二季度财报,披露Gemini App月活跃用户突破9.5亿,Gemini模型API每分钟处理Token量达到220亿,近90%的《财富》100强企业已在使用Gemini Enterprise。
两件事放在同一时间轴上审视,一个战略信号清晰浮现:谷歌正用"低成本、高吞吐"的Flash系列作为主力引擎,驱动AI在消费端与企业端的规模扩张。
一台"节能型"算力引擎:3.6 Flash的产品定位
Gemini 3.6 Flash的设计目标十分清晰——用更少的Token完成更多的任务。
据谷歌官方及Artificial Analysis数据,3.6 Flash在Artificial Analysis Index上的输出Token消耗量相比前代3.5 Flash减少17%;在完成多步骤工作流时,所需的推理步骤与工具调用次数也显著下降。在DeepSWE等智能体编程基准测试中,输出Token节省幅度最高可达65%。
定价同步下调。3.6 Flash现行价格为每百万输入Token 1.5美元、每百万输出Token 7.5美元,而前代3.5 Flash输出定价为9美元——输出价格降幅约17%。
💡 速度表现同样亮眼。Artificial Analysis实测数据显示,Gemini 3.6 Flash输出速度达到251.3 Token/秒,在同类模型中处于领先水平;在Intelligence Index智能评测中获得50分,高于同类模型31分的平均水平。
皮查伊在财报电话会上明确表示:"我们看到市场对旗舰级Gemini Flash系列需求旺盛,因为它在性能与成本之间找到了绝佳平衡点。"这句话精准概括了3.6 Flash的产品哲学——不做最聪明的模型,而做"够用且最划算"的主力模型。
9.5亿月活从何而来:生态分发+低成本模型的双轮驱动
9.5亿月活不是一个孤立数字。从去年10月的6.5亿,到今年2月的7.5亿,再到本季度的9.5亿——不到一年时间净增3亿用户,过去一年日活规模翻至原先三倍。
与此同时,模型API每分钟处理Token量从上季度的160亿飙升至220亿,单季度环比提升近四成。这两个数字结合起来,勾勒出一幅清晰的图景:用户规模与使用频次的双重爆发,背后是Flash这类低成本模型在大规模支撑。
更值得关注的是企业侧的同步增长。谷歌云二季度营收同比大涨82%至248亿美元,营业利润从去年同期的28.26亿美元大幅提升至88.14亿美元;Alphabet同步将2026年全年资本开支指引上调至1950亿至2050亿美元。皮查伊在电话会上强调:"我们的AI投资正在重新定义业务每个环节的可能性。"
9.5亿月活的真实驱动力,是谷歌"生态分发+低成本模型"的组合拳:
生态侧:Gemini被嵌入搜索、安卓、Chrome、Gmail、YouTube等十亿级产品矩阵,用户无需主动下载App即可在日常使用中调用;
模型侧:Flash系列以远低于旗舰模型的单价,承接了海量的日常推理请求,让"高频使用"在商业上变得可持续;
企业侧:近90%的《财富》100强通过Gemini Enterprise落地AI方案,每分钟220亿Token中有相当部分是来自企业的智能体调用。
客观看待3.6 Flash:效率跃升,但智力评分持平
任何技术产品都不可能完美。3.6 Flash在大幅降低单位任务成本的同时,也面临一些客观评价。
Artificial Analysis的Intelligence Index评测显示,3.6 Flash得分为50分,与前代3.5 Flash持平,未实现智力水平的跃升。在横向对比中,其综合得分排在Claude Fable 5、GPT-5.6 Sol、Grok 4.5、GLM-5.2等模型之后。
不过,单纯以"智力评分持平"来评判3.6 Flash并不公允。更全面的评测数据显示:
任务成本:Artificial Analysis跑完Intelligence Index整套评测,3.5 Flash花费1041美元,3.6 Flash花费727美元,成本降低约30%;单任务平均成本从0.59美元降至0.50美元;
任务耗时:平均任务完成时间从2.7分钟压缩至1.3分钟;
编程能力:DeepSWE评分从37%提升至49%,MLE-Bench从49.7%跃升至63.9%;
长上下文:GDM-MRCR v2在100万Token上下文测试中从26.6%跃升至54.0%,此前被诟病的"长上下文崩塌"问题得到大幅修复。
有独立评测机构给出"Faster, Cheaper, Same Brain"(更快、更便宜、智力相同)的精准概括——3.6 Flash不是一次"更聪明"的升级,而是一次"更高效"的升级。
⚠️ 需要客观呈现的是:部分开发者在社交媒体反馈,3.6 Flash在前端代码生成、空间关系推理等场景中表现不及预期。但瑕不掩瑜,对于"编程、知识工作、多模态任务"等谷歌官方定位的主战场,3.6 Flash在效率、速度、成本三个维度均实现了实质性进步。
一场深思熟虑的战略取舍
在旗舰模型Gemini 3.5 Pro延期未发的背景下,谷歌依旧大力推广3.6 Flash,其背后逻辑值得深思。
皮查伊在电话会上透露,谷歌已经启动Gemini 4的预训练,计划"几乎每月推出新模型版本"。这意味着谷歌的产品节奏是"双轨并行":
Flash轨道:以3.6 Flash、3.5 Flash-Lite承接当下的规模化和低成本需求,用"够用的智能+极致的成本效率"锁定用户习惯;
旗舰轨道:Gemini 4瞄准下一代前沿能力,待时机成熟再以"性能跃升"收割高端市场。
这套策略与PayPal早年"补贴用户、抢占支付网络"的思路如出一辙,只是补贴标的从"注册账号"变成了"Token消耗"。谷歌想要锁定的,是AI时代数十亿用户的默认交互入口。
3.6 Flash算不上完美模型,但足够廉价、响应足够迅速,是一台"节能型"引擎。谷歌依靠它驱动一盘更大的棋局:先让9.5亿人养成使用Gemini的习惯,旗舰模型的延期也就不那么致命。
企业级AI接入:当"规模时代"遇上"成本现实"
谷歌用Flash系列证明了"低成本主力模型"的产业价值——每分钟220亿Token的处理规模之所以能够成立,离不开3.6 Flash将单位任务成本压低约30%的贡献。但底层模型的降本,要真正转化为千行百业的生产力,还需要一道关键桥梁:稳定、低成本、跨模型的企业级接入服务。
对于企业开发者而言,要将Gemini以及Claude、ChatGPT、DeepSeek等全球最新主流模型的能力稳定嵌入自身业务系统,面临着三重共性挑战:
模型矩阵复杂:企业往往需同时调用多家厂商的不同模型,每家原厂API规范各异,技术栈对接成本高;
成本压力陡增:高性能模型在高强度推理场景下Token消耗巨大,以3.6 Flash每百万输出Token 7.5美元的官方价格计算,大规模智能体部署的算力账单仍不容小觑;
合规与可用性要求严苛:企业级场景对数据合规、服务可用性、审计追溯有严格要求,单一厂商服务难以覆盖全场景。
在这一背景下,具备源头供应能力的企业级API服务平台价值凸显。UseAIAPI作为SVIP企业级API服务平台,为企业提供了破解上述困境的系统方案:
🌐 120+全生态大模型统一接入
平台覆盖对话、推理、多模态、智能体调度等全场景,ChatGPT、Gemini、Claude、DeepSeek等全球120余款前沿大模型均可即接即用。开发者使用一个API Key即可调度全品类AI能力,无需分别对接多家原厂,技术栈大幅简化——这意味着企业无需锁定单一供应商,可在统一接口下灵活调度全球最强模型矩阵,为"智能体工作流"提供最优的模型组合,并可根据任务特性在Flash(高吞吐)与Opus(深推理)等不同定位的模型间灵活切换。
🏢 企业级定制化服务保障
依托全球边缘节点加速,平台提供45ms骨干网络超低延迟、99.9%极致可用性保障;支持可视化财务看板、按项目与模型溯源消耗、对公结算,能够融入核心系统并通过财务审计,适配集团化架构,满足关键业务的严苛可用性要求。
💰 极具竞争力的成本优化
依托全球算力集采优势,UseAIAPI推出长期专属企业权益,优惠折扣最低可达官方定价的50%。以Gemini 3.6 Flash为例,官方输出定价为7.5美元/百万Token,通过UseAIAPI接入可大幅降低单位调用成本;配合智能语义缓存等降本机制,能够显著缓解高强度智能体执行场景下的算力消耗压力。这意味着同样的预算下,企业可支撑的推理调用量最高可扩展至原先的两倍,让AI原生应用的规模化部署不再受困于算力账单——正如谷歌用3.6 Flash将单位任务成本降低30%一样,UseAIAPI让这一降本效应在企业侧进一步放大。
🔧 全流程技术护航
从技术对接、合规部署到运维保障,平台提供企业级定制化服务,让不同规模的企业与开发者都能实现"无忧接入、顺畅使用"。
写在最后:规模时代的真正命题
从Gemini 3.6 Flash的发布,到Gemini App月活突破9.5亿,谷歌正在用行动回答一个根本性问题:在AI规模时代,最优策略不是"打造最聪明的模型",而是"把够用的模型以可承受的成本送到最多人手中"。
Flash系列的17% Token节省、30%任务成本下降、251 Token/秒的输出速度,构成了谷歌AI战略的经济底座。当每分钟220亿Token的推理规模成为常态,单位成本的每一次下降,都意味着全球AI应用普及度的一次跃升。
但对于千行百业的企业而言,底层模型的降本红利,需要借助UseAIAPI这类企业级服务平台,才能真正转化为可负担、可稳定、可规模化的AI生产力。毕竟,在AI能力民主化的时代,企业不该被挡在"企业级"的门槛之外;而真正的企业级AI接入,应当是"模型自由+成本可控+服务可靠"的三重兼得。
谷歌用Gemini 3.6 Flash证明了"低成本主力模型"的产业方向,而UseAIAPI正在证明:统一接入与成本优化,是企业将这场规模革命转化为业务竞争力的必由之路。当9.5亿用户与220亿Token/分钟的算力洪流,经由稳定、低成本的API通道流向万千企业时,AI时代的真正红利才开始惠及每一个参与者。