← 返回 Blog

旗舰模型Gemini 3.5 Pro延期,谷歌为何反手发Flash?220亿Token/分钟的算力账本揭秘

2026年7月21日,谷歌DeepMind一次性推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。同日,皮查伊在财报电话会上透露,Gemini 4预训练已经启动,"将是迄今最具雄心的预训练计划"。

Gemini谷歌Gemini的"效率优先"战略转向

旗舰模型缺位,三款"配菜"顶上:谷歌Gemini的"效率优先"战略转向

2026年7月21日,谷歌DeepMind一次性推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。同日,皮查伊在财报电话会上透露,Gemini 4预训练已经启动,"将是迄今最具雄心的预训练计划"。

但所有人心中都萦绕同一个疑问:Gemini 3.5 Pro去哪了?

今年5月谷歌I/O开发者大会上,皮查伊公开承诺Gemini 3.5 Pro将于6月发布。6月悄然过去,产品杳无音信;7月中旬已过,依旧不见踪影。彭博社援引知情人士消息称,这款旗舰模型已经延期,主因是代码生成能力难以达到谷歌内部设定的性能指标。消息披露后,Alphabet盘后股价跌超3%,最终收跌4.2%。

旗舰为何难产:卡在代码能力这一关

Gemini 3.5 Pro的瓶颈究竟在哪?

据媒体报道,最大痛点在于代码生成能力。上月末谷歌更新训练数据集,试图改善代码表现,但测试结果依旧不及预期。在当下大模型赛道,编程能力早已不是锦上添花的附加功能,而是企业级AI应用中增长最快、商业价值最高的场景之一。与此同时,OpenAI、Anthropic的竞品模型进一步拉大了代码生成层面的差距。

皮查伊在财报电话会上也坦承:"Gemini前沿模型在编程能力等方面仍须改进。"这句话从谷歌CEO口中说出,分量不言而喻。

更棘手的是内部组织壁垒。谷歌云、DeepMind、安卓团队各自独立面向开发者研发AI编程工具,多个部门重复造轮子。内部甚至存在一批态度保守的工程师,认为关键代码必须全程由人工编写,才能达到谷歌的内部标准。

💡 旗舰模型的难产,折射出整个行业的集体困境:当模型能力竞赛进入"代码智能"这一深水区,单纯堆参数的路径已经走到尽头。

三道"配菜":省Token、降成本、抢市场

旗舰缺位的背景下,谷歌推出的三款轻量化模型指向同一个核心方向:运行效率

Gemini 3.6 Flash——主力干活模型

被谷歌定位为"workhorse model"(驮载工)。相比前代3.5 Flash,输出Token消耗量降低17%;在DeepSWE等编程评测基准上,最高可节省65%的Token开销。定价同步下调:输出Token单价由每百万9美元降至7.5美元,输入单价1.5美元,知识库截止时间更新至2026年3月。硬性指标方面,SWE Bench Pro得分从55.1%提升至58.7%,MLE Bench由49.7%上涨至63.9%,OSWorld-Verified桌面智能体基准从78.4%跃升至83.0%。

Gemini 3.5 Flash-Lite——极致性价比

该系列中性价比最高的模型,输入0.30美元/百万Token、输出2.50美元/百万Token,与Mistral Small、Llama 4形成直接价格对抗,主打高并发文本摘要、信息预处理、实时翻译等对延迟敏感的业务。

Gemini 3.5 Flash Cyber——垂直安全模型

经过专项微调的安全模型,专为发现和修复网络安全漏洞而设计。谷歌表示,该模型将作为限量访问试点项目的一部分,仅向政府机构和受信合作伙伴开放。

三款模型各有分工:一个当主力,一个跑量,一个负责安全。大模型已经开始像一支工程团队那样分工。

但需要客观呈现的是,3.6 Flash发布后引发了一些争议。第三方评测机构Artificial Analysis给出的智能指数显示,3.6 Flash仅拿到50分,与3.5 Flash完全持平。部分分析师认为,为强行压低输出Token成本,谷歌在后训练阶段裁剪了模型生成冗余结构标签的倾向,直接造成模型省略必要的嵌套封装层级与样式重置代码。有开发者实测反馈,3.6 Flash在前端代码生成、空间关系推理等场景中表现不及预期,"你以为它速度变快,本质却是智力持平"。

每分钟220亿Token的算力账本

既然旗舰模型迟迟难产,谷歌为何还要大力推广饱受争议的3.6 Flash?

答案藏在Alphabet二季度财报的一组数据里。

皮查伊在电话会上披露:Gemini模型API每分钟处理约220亿个Token,较上一季度的160亿提升37.5%;Gemini App月活跃用户达9.5亿,日活规模增至去年同期的3倍;每月超过900万名开发者通过API和核心开发者产品使用Gemini模型。

💡 皮查伊在财报电话会议上直言:"市场对旗舰级Gemini Flash系列需求旺盛,因为它在性能与成本之间找到了绝佳平衡点。"他将Flash称作承担业务负载的"主力干活模型"。

与此同时,资本开支的压力也在急剧放大:

  • 第二季度资本支出达449.2亿美元,同比翻倍;

  • 全年资本开支指引由1800亿—1900亿美元上调至1950亿—2050亿美元

  • CFO阿什肯纳齐表示,2027年资本开支还将"显著高于"2026年;

  • 受高额AI基础设施投入影响,Alphabet第二季度自由现金流降至-58.55亿美元,为上市数十年来首次单季转负。

财报发布后,谷歌股价盘后大跌超4%。市场担忧的核心,并非谷歌"烧钱"本身,而是这种强度的投入能否在合理周期内收回。

一场深思熟虑的战略转向

3.6 Flash算不上完美模型,但它足够廉价、响应足够迅速,是一台"节能型"算力引擎。

行业正在形成全新共识:竞争重心从"比拼参数、比拼基准跑分"转向比拼运行效率、比拼单位任务成本。用更少算力完成同等乃至更多任务,几乎所有科技巨头都在全力推进。

谷歌的战略目标并非"打造全球最强模型",而是以最快速度,把够用的模型交付给最多用户

  • 9.5亿月活用户,日活一年翻三倍;

  • API每分钟220亿Token吞吐量,单季度环比提升37.5%;

  • 近90%的《财富》100强企业已经部署Gemini Enterprise;

  • Google Cloud单季营收247.7亿美元,同比暴涨82%,云业务积压订单首次突破5000亿美元。

一系列数字勾勒出清晰图景:谷歌以Flash这类低成本模型作为跳板,优先让Gemini成为用户日常使用习惯。至于旗舰模型?皮查伊明确表示,Gemini 4训练工作已经启动,未来迭代节奏将接近"月度更新"。3.5 Pro的延期,或许只是奔赴下一个主战场之前的短暂休整。

这套策略与PayPal早年"补贴用户、抢占支付网络"的思路如出一辙,只是补贴标的从"注册账号"变成了"Token消耗"。谷歌想要锁定的,是AI时代数十亿用户的默认交互入口

企业级AI接入:当"规模时代"遇上"成本现实"

谷歌用Flash系列证明了"低成本主力模型"的产业价值——每分钟220亿Token的处理规模之所以能够成立,离不开3.6 Flash将单位任务成本压低约17%的贡献。但底层模型的降本,要真正转化为千行百业的生产力,还需要一道关键桥梁:稳定、低成本、跨模型的企业级接入服务

对于企业开发者而言,要将Gemini以及Claude、ChatGPT、DeepSeek等全球最新主流模型的能力稳定嵌入自身业务系统,面临着三重共性挑战:

  • 模型矩阵复杂:企业往往需同时调用多家厂商的不同模型,每家原厂API规范各异,技术栈对接成本高;

  • 成本压力陡增:以3.6 Flash每百万输出Token 7.5美元的官方价格计算,大规模智能体部署的算力账单仍不容小觑;当企业同时进行多模型调用时,成本压力进一步放大;

  • 合规与可用性要求严苛:企业级场景对数据合规、服务可用性、审计追溯有严格要求,单一厂商服务难以覆盖全场景。

在这一背景下,具备源头供应能力的企业级API服务平台价值凸显。UseAIAPI作为SVIP企业级API服务平台,为企业提供了破解上述困境的系统方案:

🌐 120+全生态大模型统一接入

平台覆盖对话、推理、多模态、智能体调度等全场景,ChatGPT、Gemini、Claude、DeepSeek等全球120余款前沿大模型均可即接即用。开发者使用一个API Key即可调度全品类AI能力,无需分别对接多家原厂,技术栈大幅简化——这意味着企业无需锁定单一供应商,可在统一接口下灵活调度全球最强模型矩阵,为"智能体工作流"提供最优的模型组合,并可根据任务特性在Flash(高吞吐)与Opus(深推理)等不同定位的模型间灵活切换。

🏢 企业级定制化服务保障

依托海外节点直连原厂机房与自研智能负载均衡架构,平台提供极致性能与高并发专线能力,稳健承载百万美元级API吞吐,确保超低延迟与零拥堵,晚高峰依然稳定可靠;支持可视化财务看板、按项目与模型溯源消耗、对公结算,能够融入核心系统并通过财务审计,适配集团化架构,满足关键业务的严苛可用性要求。

💰 极具竞争力的成本优化

依托全球算力集采优势,UseAIAPI推出长期专属企业权益,优惠折扣最低可达官方定价的50%。以Gemini 3.6 Flash为例,官方输出定价为7.5美元/百万Token,通过UseAIAPI接入可大幅降低单位调用成本;配合智能语义缓存等降本机制,能够显著缓解高强度智能体执行场景下的算力消耗压力。这意味着同样的预算下,企业可支撑的推理调用量最高可扩展至原先的两倍,让AI原生应用的规模化部署不再受困于算力账单——正如谷歌用3.6 Flash将单位任务成本降低17%一样,UseAIAPI让这一降本效应在企业侧进一步放大。

🔧 全流程技术护航

从技术对接、合规部署到运维保障,平台提供企业级定制化服务,让不同规模的企业与开发者都能实现"无忧接入、顺畅使用"。

写在最后:规模时代的真正命题

从Gemini 3.5 Pro的延期,到三款轻量模型"三箭齐发",谷歌正在用行动回答一个根本性问题:在AI规模时代,最优策略不是"打造最聪明的模型",而是"把够用的模型以可承受的成本送到最多人手中"

3.6 Flash的17% Token节省、7.5美元/百万Token的输出定价、全面超越前代的编程与智能体基准得分,构成了谷歌AI战略的经济底座。当每分钟220亿Token的推理规模成为常态,单位成本的每一次下降,都意味着全球AI应用普及度的一次跃升。

但对于千行百业的企业而言,底层模型的降本红利,需要借助UseAIAPI这类企业级服务平台,才能真正转化为可负担、可稳定、可规模化的AI生产力。毕竟,在AI能力民主化的时代,企业不该被挡在"企业级"的门槛之外;而真正的企业级AI接入,应当是"模型自由+成本可控+服务可靠"的三重兼得。

谷歌用Gemini 3.6 Flash证明了"低成本主力模型"的产业方向,而UseAIAPI正在证明:统一接入与成本优化,是企业将这场规模革命转化为业务竞争力的必由之路。当9.5亿用户与220亿Token/分钟的算力洪流,经由稳定、低成本的API通道流向万千企业时,AI时代的真正红利才开始惠及每一个参与者。