← 返回 Blog

Gemini 3.5 Pro 跳票了吗?Pro 线停在 3.1,Flash 线已卷到 3.6

2026 年 5 月 19 日,谷歌 I/O 开发者大会。CEO 桑达尔·皮查伊站上舞台,自信地宣布 Gemini 3.5 Pro 将于次月上线,台下掌声雷动。 此后,便杳无音信。 6 月未发布,7 月依旧缺席。7 月末,谷歌改口称"该模型正在合作伙伴内部测试,待准备就绪后广泛上线"。到了 8 月,权威研究机构 SemiAnalysis 直接爆料:Gemini 3.5 Pro 项目已被取消。 三次跳票,事态每况愈下。旗舰产品线反复卡壳的同时,Flash 轻量线已经从 3.5 迭代到 3.6 版本。

GeminiGemini 家族的分裂时刻

Pro 版停滞,Flash 版狂飙:Gemini 家族的分裂时刻

2026 年 5 月 19 日,谷歌 I/O 开发者大会。CEO 桑达尔·皮查伊站上舞台,自信地宣布 Gemini 3.5 Pro 将于次月上线,台下掌声雷动。

此后,便杳无音信。

6 月未发布,7 月依旧缺席。7 月末,谷歌改口称"该模型正在合作伙伴内部测试,待准备就绪后广泛上线"。到了 8 月,权威研究机构 SemiAnalysis 直接爆料:Gemini 3.5 Pro 项目已被取消

三次跳票,事态每况愈下。旗舰产品线反复卡壳的同时,Flash 轻量线已经从 3.5 迭代到 3.6 版本。

Pro 版究竟卡在哪里

据彭博社援引 10 位谷歌现任及前员工的爆料,最大瓶颈在于代码编程能力。上月末,谷歌更新 Gemini 训练数据,试图提升代码生成表现,但测试结果令人失望。知情人士透露,谷歌在上月末替换了部分训练数据,寄希望于改善编程能力,但测试结果依旧不达预期。

编程恰恰是 AI 付费商业化的核心驱动力。分析指出,谷歌 AI 模型的代码能力,相比业界顶尖水平大约落后 6 个月。在 AI 按月迭代的行业节奏里,6 个月就是整整一代的代差。

竞争对手还在加速拉大差距。OpenAI、Meta 近期发布的新模型,进一步拉开了代码生成能力的领先优势。得益于深耕企业级代码与自动化场景,Anthropic 在 2026 年 4 月的年化营收已经超越 OpenAI。

谷歌的内部问题远比技术问题更深。一位前员工形容:要推动所有业务部门朝同一个目标发力,"难如煮沸整片海洋"。谷歌云、DeepMind、安卓团队,都在各自独立面向开发者开发 AI 编程工具,多部门重复造轮子,资源难以集中。与此同时,内部算力争夺,也让工程师在实际使用 AI 工具时频繁遭遇算力瓶颈。

Flash 系列在另一条赛道狂飙突进

7 月 21 日,谷歌一口气推出三款 Flash 模型:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber,全部主打高速、低成本。

Gemini 3.6 Flash​ 定价:输入 1.5 美元/百万 token,输出 7.5 美元/百万 token。对比 3.5 Flash,输出 token 消耗平均下降 17%,部分场景最高可节省 65%。生成速度达到 303 token/秒,在 Artificial Analysis 追踪的 186 款模型中排名第一。单任务平均耗时从 2.7 分钟压缩至 1.3 分钟,降幅超 50%。

关键指标

Gemini 3.5 Flash

Gemini 3.6 Flash

变化

输入价格(美元/百万 token)

1.50

1.50

持平

输出价格(美元/百万 token)

9.00

7.50

下调 16.7%

输出 token 消耗

基准

减少 17%

效率显著提升

DeepSWE 代码场景 token 消耗

约 27.6 万

约 9.7 万

节省 65%

生成速度

165 token/秒

303 token/秒

提升约 84%

单任务平均耗时

2.7 分钟

1.3 分钟

缩短 52%

数据来源:

💡 谷歌试图把衡量标准从"每百万 token 多少钱",进一步推向"完成一项任务总共多少钱"。做同样一个 Agent 任务的实际成本,大概会下降三成左右。

但一个数字引爆舆论:Artificial Analysis 智能指数 50 分,与 3.5 Flash 完全持平"。"智力零提升""跌出全球前十"的报道铺天盖地。

更令人唏嘘的是今昔对比。2025 年 11 月,Gemini 3 Pro 一经发布便登顶大模型竞技场。短短一年时间,从榜首跌落至前十开外。在 Artificial Analysis 最新智能指数榜单中,谷歌没有任何一款模型进入前五——开源的 Kimi K3 拿到 60 分,阿里 8 月初发布的 Qwen3.8-Max 为 53 分,都排在它前面。Arena.ai 数据显示,Gemini 3.6 Flash 在前端代码竞技场得分 1537,位列第 12 名。

两条产品线的强烈反差

Pro 系列代表谷歌的前沿野心,然而 3.5 Pro 连内部代码测试都没能通过;Flash 系列代表务实的效率路线,但 3.6 Flash 智力水平陷入停滞,部分表现甚至不及国内头部开源模型与 Grok 4.5。

谷歌的策略,是靠三款中端 Flash 模型拼命补齐产品矩阵,同时官宣 Gemini 4 启动预训练。但 SemiAnalysis 的报告直接给 Gemini 写下判词:Gemini 已经退出前沿模型竞赛

这让人想到一个经典商业悖论:当你的旗舰产品一再跳票,而你拼命优化的中端产品恰恰证明,你的旗舰或许真的遇到了根本性难题。3.6 Flash 的智能指数与 3.5 Flash 毫无变化,说明谷歌在"把模型变聪明"这件事上已经摸到天花板;而 3.5 Pro 代码能力迟迟不达标,意味着这个天花板可能比想象中更低。

Pro 版停留在 3.1,Flash 一路卷到 3.6。​ 版本数字反差背后,是外界对谷歌还能否做出顶尖模型的信任危机。Gemini 3.1 Pro 发布于 2026 年 2 月,至今整整六个月。在按月迭代的 AI 竞赛中,旗舰半年不更新,几乎等同于主动退出竞争。

谷歌并非没有努力。联合创始人谢尔盖·布林一直在推动 AI 编程产品加速落地,却受困于内部派系博弈。DeepMind 内部也组建了专门的 AI 编程团队。但这些补救调整能否扭转局面,依旧未知。

人事巨震:一次以失利姿态到来的转折

8 月 5 日,谷歌母公司 Alphabet 官宣重磅人事调整:

  • 德米斯·哈萨比斯卸任 Google DeepMind CEO,转任 DeepMind 董事长兼 Alphabet 首席科学家,聚焦 AGI 长期研究与战略

  • 杰夫·迪恩在谷歌效力 27 年后正式离职,与桑杰·格马瓦特、Oriol Vinyals、Quoc Le 共同创办 AI 科研公司 Discovery Loop

  • 科雷·卡武克丘奥卢接任 Google DeepMind 高级副总裁,接管日常运营,直接向皮查伊汇报

消息公布当日,Alphabet 盘中暴跌超 5%,收盘跌幅约 4%,单日市值蒸发超 1800 亿美元

这不是一次普通人事变动,而是谷歌 AI 从"实验室时代"转向"产品战争时代"的转折点——只不过,这场转折是以失利的姿态到来。

⚠️ 值得客观指出的是:Gemini 跌落的是"前沿声誉",而非"用户盘"。皮查伊在 8 月 5 日的信中强调,Gemini 应用月活已达 9.5 亿;Sensor Tower 上半年报告显示,ChatGPT 份额首次跌破 50%,Gemini 升至 27.7%;近 90% 的财富 100 强使用 Gemini Enterprise。谷歌失去的是"最强模型"的位置,没有失去用户。

企业如何把"效率红利"进一步放大

对于企业和开发者而言,3.6 Flash 的官方定价(1.50/7.50 美元每百万 token)与 3.5 Flash-Lite(0.30/2.50 美元)已经具备了极强的竞争力,尤其是面对高频智能体调用、大规模代码重构、批量文档处理等重消耗场景。但要真正把这份红利转化为企业账面上的成本优势,还需要解决三个现实问题:多模型统一管理、跨厂商灵活切换、企业级账单与稳定性

UseAIAPI​ 作为源头大模型 API 供应商,提供了一条颇具成本效益的接入路径:

  • 成本优势显著:依托全球算力集采优势压降成本,优惠折扣最低可达官方价格的 50%。以 Gemini 为例,借助 UseAIAPI 接入,3.6 Flash 可从官方价 1.50/7.50 美元降至 0.75/3.75 美元每百万 token——这意味着在 DeepSWE 代码场景中本就节省 65% token 的基础上,企业单任务成本可进一步压缩至原来的约 1/6;3.5 Flash-Lite 从 0.30/2.50 美元进一步下探至 0.15/1.25 美元,让高并发跑量场景的单位成本压到更低;即便是 Gemini 3.1 Pro(200K 以内),也可从官方 2/12 美元降至 1/6 美元,单次复杂推理任务的账单压力大幅缓解

  • 模型覆盖全面:一站式聚合 Gemini(含 3.6 Flash、3.5 Flash-Lite、3.1 Pro 等最新模型)、Claude、ChatGPT、DeepSeek 等全球 120+ 主流大模型,单一接口无缝调用,官方能力秒级同步。无论是当前的 Gemini 3.6 Flash,还是未来正式发布的 Gemini 3.5 Pro、Gemini 4,都能在第一时间接入使用,业务永远保持领先

  • 企业级定制能力:支持企业级定制化部署,提供可视化财务看板,支持按项目、模型溯源消耗;结合 Batch API 机制叠加优惠(谷歌官方 Batch 模式本身提供 50% 折扣,UseAIAPI 在此基础上可进一步叠加),可将长上下文、高并发、持续运行的智能体工作流单位成本进一步压低。企业可以根据业务环节灵活路由——用 Flash-Lite 承接子 Agent 并行跑量、用 3.6 Flash 处理主 Agent 复杂编排、用 3.1 Pro 应对深度推理,把"在每一步应用最有用的智能,并为它创造的价值支付合适的价格"这一策略落到实处

  • 金融级可靠性:海外合规节点直连原厂机房,自研智能负载均衡,99.99% SLA 保障;全球边缘节点加速,45ms 骨干网络超低延迟,8.2k+ 企业与开发者信赖,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险

💡 在实际生产中,3.6 Flash 的"17% token 节省 + 16.7% 官方降价"已经让单任务成本下降约 30%;再叠加 UseAIAPI 的最低 50% 折扣权益与 Batch API 异步机制,对于每天数百万次调用的智能体工作流而言,整体成本较直接使用 3.5 Flash 官方价可压缩 60% 以上——这才是谷歌"效率优先"策略在企业账面上的真实体现。而当 Gemini 3.5 Pro 正式发布、Gemini 4 启动预训练后,通过 UseAIAPI 接入所拥有的"多模型灵活路由 + 叠加折扣"优势,将成为企业在谷歌 AI 路线调整期最具确定性的选择。

简而言之,通过 UseAIAPI 的统一接口,开发者和企业可以根据业务场景灵活路由——用 Gemini 3.5 Flash-Lite 承接高并发跑量、用 Gemini 3.6 Flash 处理复杂智能体编排、用 Gemini 3.1 Pro 应对深度推理——在 Gemini 3.5 Pro 或 Gemini 4 正式发布后亦可第一时间平滑接入,无忧接入、按需扩展,把大模型迭代的红利转化为真实的生产力。

9 月即将到来,Gemini 3.5 Pro 能否结束多次跳票正式登场?Gemini 4 又将在何时带来怎样的惊喜?答案将由时间揭晓。

可以肯定的是,在"效率优先"与"深度优先"两条路线的博弈下,选对接入策略,比押注单个模型更重要。对于企业而言,建立灵活的模型接入层,方能在谷歌、Anthropic、OpenAI、DeepSeek 四方混战的不确定性中,始终以最优成本享受最前沿的 AI 能力。