← 返回 Blog

谷歌承认:Gemini 3.5 Pro 未达标,史上最大 Gemini 4 预训练已启动

2026年7月21日,谷歌DeepMind一次性发布三款全新模型:一款承担主力通用任务,一款主打低成本承接海量业务,还有一款专攻安全漏洞挖掘。三款模型各司其职、分工清晰,但所有人都留意到同一个事实:本该占据核心位置的Gemini 3.5 Pro依旧没有亮相。 这次延期,早已不只是一次普通的产品跳票。

GeminiGemini 3.5 Pro 跳票背后谷歌的AI焦虑与战略对冲

旗舰缺席,先行推出过渡版本:Gemini 3.5 Pro 跳票背后,谷歌的AI焦虑与战略对冲

2026年7月21日,谷歌DeepMind一次性发布三款全新模型:一款承担主力通用任务,一款主打低成本承接海量业务,还有一款专攻安全漏洞挖掘。三款模型各司其职、分工清晰,但所有人都留意到同一个事实:本该占据核心位置的Gemini 3.5 Pro依旧没有亮相

这次延期,早已不只是一次普通的产品跳票。

代码能力短板,不止是单纯技术难题

Gemini 3.5 Pro究竟卡在何处?据彭博社援引十名谷歌现任及前员工爆料,最大瓶颈在于代码编程能力。上月末,谷歌更新训练数据集,试图提升代码生成表现,但实测结果不及预期。

在当下大模型赛道竞争中,编程能力早已不是锦上添花的附加功能,而是企业级AI应用里增长最快、商业价值最高的场景之一。OpenAI、Meta近期发布的新一代模型,在代码生成能力上与谷歌现有产品进一步拉开差距。更令谷歌焦虑的是,依托深耕企业编程与自动化赛道,Anthropic在2026年4月实现年化营收对OpenAI的反超。

💡 第三方评测榜单数据显示,谷歌当前主力Gemini系列综合实力已经跌至全球榜单十名以外,在头部大模型竞速赛道中显现压力。

但谷歌面临的困境远不止技术层面。

"试图煮沸整片海洋":比技术更难跨越的阻碍

某种意义上,谷歌当前的窘境是典型的大企业病。不同于OpenAI、Anthropic这类聚焦单一AI产品的竞争对手,谷歌需要把最新AI能力嵌入庞大的产品矩阵,覆盖搜索、地图、YouTube等众多业务。一名前员工形容,推动所有业务部门朝着统一目标协同,无异于试图煮沸整片海洋——目标过于宏大、统筹推进难度极高。

雪上加霜的是内部资源分散、部门相互竞争。谷歌云、DeepMind、安卓团队各自独立面向开发者研发AI编程工具,部分消费级产品团队也参与其中,多个部门重复造轮子。工程师日常使用AI工具时,经常因为内部算力争夺遭遇算力配额不足。

除此之外还有内部固有观念带来的阻力。谷歌内部存在一批持保守观点的工程师,坚持认为关键代码必须完全由人工编写才能达到谷歌标准。项目早期,公司甚至限制员工使用Gemini编写、分析代码,担忧内部专有代码泄露,混入模型训练数据。尽管后续相关政策有所放宽,但前期错失的大量实验迭代窗口期难以弥补。

联合创始人谢尔盖·布林一直在推动加速AI编程产品研发,却遭遇内部不同派系博弈牵制。谷歌首席AI架构师科雷·卡武丘奥卢尝试统一内部各类AI编程工具,DeepMind也在内部组建专门的AI编程团队。但这些补救调整能否扭转局势,依旧未知。

比产品延期更加危险的是人才流失。多名前员工透露,已有部分研究员因对谷歌在AI竞赛中的处境感到失望,跳槽至Anthropic等企业。

三款Flash系列,三份过渡答卷

旗舰缺席之际,谷歌交出三份"过渡答卷"。

Gemini 3.6 Flash主打效能优化路线,输出词元平均消耗量较前代减少17%;在DeepSWE这类长周期任务中,降幅最高可达65%。输出定价由每百万词元9美元下调至7.5美元,输入维持1.5美元。基准指标同步提升:DeepSWE得分自37%升至49%,MLE-Bench由49.7%上涨至63.9%,OSWorld-Verified从78.4%提升至83%。

Gemini 3.5 Flash-Lite走极致性价比路线,输出速度可达每秒350词元,输入每百万词元仅0.3美元,输出2.5美元。最重磅的突破是:在多项代码与智能体评测中,性能超越规格更高的前代Gemini 3 Flash——SWE-Bench Pro拿到54.2%(3 Flash为49.6%),OSWorld-Verified拿到74.0%(3 Flash为65.1%)。

Gemini 3.5 Flash-Cyber专门针对网络安全漏洞挖掘调优,基于3.5 Flash微调,嵌入CodeMender代码安全智能体中运行,现阶段仅面向政府机构与可信合作伙伴开放。

三款模型分工明确,如同一支配合有序的工程团队,但万众期待、代表旗舰硬实力的正式答卷,依旧迟迟未能提交。

另一桩耐人寻味的布局

就在3.5 Pro持续跳票的同一天,谷歌DeepMind对外宣布,启动公司史上"规模最宏大"的Gemini 4预训练项目。

一边是当前旗舰难产,另一边下一代模型训练已经启动。行业分析认为,这或许意味着资源重心发生转移。按照谷歌常规训练节奏推算,Gemini 4有望在年内推出。

但问题随之而来:倘若3.5 Pro尚且无法攻克代码能力难关,Gemini 4就能跨越这道障碍?一支受困于内部组织内耗、保守文化束缚的团队,仅仅更换项目代号,就能跑得更快吗?

市场的反应十分直白

消息曝光当日,Alphabet股价盘中一度下跌3.2%。在随后的二季度财报电话会上,皮查伊一反常态采取防御性姿态,承认"编程能力和智能体编程正是需要改进的领域的其中之一",并反复强调Gemini Flash系列的商业价值。

市场用脚投票的速度,远比任何分析报告更加诚实。

三款Flash系列发布、Pro版本持续难产、Gemini 4提前预热,几件事叠加勾勒出清晰图景:谷歌正在用"未来更强的下一代预期",对冲"当下旗舰交付延期"带来的压力。

这套布局兼具战略考量,也充满无奈。Flash系列稳住企业市场基本盘,Gemini 4承载外界高期待,而3.5 Pro夹在中间:当下性能算不上最强,又并非最值得等待的下一代。它陷入最尴尬的处境:想要扛起旗舰定位,硬实力尚有欠缺;想充当过渡版本,发布时机又完全错位

谷歌在5月开发者大会I/O上承诺6月推出3.5 Pro。如今7月过半,交付日期依旧遥遥无期。这场延期背后,是这家科技巨头同时承受技术、组织、战略三重压力下的艰难博弈。

让全球主流大模型能力,以更优成本触手可及

Gemini 3.5 Pro的跳票清晰地传递出一个信号:全球主流大模型的竞争格局正在剧烈重组,单一厂商的旗舰交付时间表充满不确定性。但对于广大国内企业而言,业务不能等待——想要顺畅调用Gemini、Claude、ChatGPT、DeepSeek等全球最新模型能力,就需要一套能够抵御"单点供应风险"的基础设施。

在这一背景下,UseAIAPI提供了一个稳健的解决方案:

  • 顶尖模型一站式接入:单一接口无缝调用GPT、Claude、Gemini(含3.6 Flash与3.5 Flash-Lite)、DeepSeek等全系120+主流与前沿模型,官方能力秒级同步。即便某一厂商旗舰跳票,企业也能通过平台即时调用其他厂商的同级别能力,保障业务连续性;

  • 价格优势显著,让高强度生成不再"烧钱":平台优惠折扣低至官方价格的50%。以Gemini 3.6 Flash输出定价7.5美元/百万词元计算,通过UseAIAPI调用实际成本可压缩至约3.75美元/百万词元;Claude、GPT等模型同样享受对应折扣——这意味着企业大规模、高并发部署生产级AI智能体时,单位经济模型优势尤为突出,让"给AI员工发薪"的成本进一步下降;

  • 企业级高可用保障:海外节点直连原厂机房,自研智能负载均衡,99.9%极致可用性保障,45ms骨干网络超低延迟,稳健承载百万美元级API吞吐,晚高峰依然稳定可靠;

  • 安全与合规内置:提供超越模型原厂的卓越服务体验,支持对公结算,是"能融入核心系统、通过财务审计、适配集团架构的AI基础设施",而非简单的接口转发;企业可在平台层面对模型调用设置权限边界、耗时预算、写入动作审批等安全管控;

  • 灵活的多模型路由:企业可按任务复杂度自由匹配最优性价比模型——高并发低延迟业务路由至Gemini 3.5 Flash-Lite或DeepSeek,高价值的复杂推理任务调用Claude Opus、GPT,日常智能体工作负载选用Gemini 3.6 Flash或Claude Sonnet。借助各模型自带的"effort调节"能力,配合平台的精细化路由,可将综合成本进一步压低,更能在某一家厂商旗舰延期时无缝切换至其他厂商的最优替代。

从Gemini用"三款Flash"稳住企业市场基本盘、将未来押注于Gemini 4,到企业通过统一、稳定、可控的接口调用全球顶尖模型,AI生产力的最后一公里正在被打通。

"智能体"与"供应链韧性"的天平正在被重写——它不再代表"押注单一旗舰",而是代表"以合理的成本、稳定的服务、可控的安全框架,将最合适的模型匹配到最合适的任务"。这或许才是Gemini 3.5 Pro跳票留给行业最深远的启示:当大模型迭代充满不确定性,企业真正需要的不再是谁家的旗舰"最强",而是谁能以合理的成本、稳定的服务,构建一个不被单一厂商交付节奏绑定的AI基础设施。UseAIAPI所提供的不只是接入通道,更是这套"多模型、优成本、高稳定"的AI基础设施,让每一次模型迭代的红利,都能第一时间转化为企业真实的生产力。