← 返回 Blog

谷歌悄悄换掉了 AI 竞赛的赛制:从"谁更强"变成"谁更快"

2026年5月19日,谷歌I/O开发者大会。桑达尔·皮查伊站在台上,没有率先发布综合实力最强的Gemini 3.5 Pro,而是推出名为Flash的模型——Gemini 3.5 Pro此后才在内部分布,预计次月正式推出。

GeminiGemini 3.5 Pro

谷歌悄然改写AI竞赛的游戏规则:当"中杯"开始重新定义"够用"

2026年5月19日,谷歌I/O开发者大会。桑达尔·皮查伊站在台上,没有率先发布综合实力最强的Gemini 3.5 Pro,而是推出名为Flash的模型——Gemini 3.5 Pro此后才在内部分布,预计次月正式推出。

放在一年前,这种发布顺序会被视作反常。Pro是门面担当,Flash只是"便宜但智力有限"的备选。但这一次,谷歌彻底颠倒了二者的定位。

这就是竞赛规则的改变:比拼的不再是谁更强,而是谁更快、谁更便宜、谁能真正跑通智能体工作流。

一场刻意安排的定位分工

谷歌DeepMind的规划十分清晰:Pro负责高阶推理与任务规划;Flash作为大量子智能体,承担高频、低成本的执行工作。并非所有任务都需要最强模型,不同层级的模型应当被放置在性价比、效率最优的位置。

根据谷歌官方数据,Gemini 3.5 Flash输出速度可达其他前沿模型的4倍,在Antigravity平台上经过优化后甚至可达竞品的12倍。处理智能体任务的费用通常不到其他前沿模型的一半。

更关键的是定价结构。谷歌官方定价显示,Gemini 3.5 Flash标准付费层级为输入每百万token 1.5美元、输出每百万token 9美元;提示词缓存输入价仅为每百万token 0.15美元(相当于标准输入价的1折);若使用Batch API异步批处理,输入可降至0.75美元、输出降至4.50美元。

💡 这套定价结构的战略意图十分明显:把"每次调用的单价"和"智能体循环中的实际成本"拉开差距。智能体工作流的特征是长上下文、多轮调用、重复system prompt——当80%以上的token消耗来自缓存命中的上下文历史时,实际单位成本可能只有标价的1/5到1/10。

不打折扣的综合性能

倘若速度与低价是以牺牲能力为代价,那仅仅只是"低端市场的胜利"。但Gemini 3.5 Flash在多项关键指标上已经超越前代旗舰Gemini 3.1 Pro。

根据谷歌官方模型卡公布的基准数据:

基准测试

衡量维度

Gemini 3.5 Flash

Gemini 3.1 Pro

Terminal-Bench 2.1

智能体终端编码

76.2%

70.3%

MCP Atlas

多步骤工具协同

83.6%

78.2%

SWE-Bench Pro

真实软件工程

55.1%

54.2%

GDPval-AA

经济价值知识工作(Elo)

1656

1314

CharXiv Reasoning

复杂图表信息综合

84.2%

83.3%

Finance Agent v2

金融分析决策

57.9%

43.0%

数据来源:

当然短板客观存在。Humanity's Last Exam测试中Flash得分40.2%,低于Gemini 3.1 Pro的44.4%;ARC-AGI-2抽象推理拿到72.1%,不及Pro版本的77.1%。

但可以观察到一个明确特征:Flash在偏向应试的基准上落败,却在面向真实工作的基准上取胜。编码、智能体工具调用、多步骤任务执行、金融分析——这些才是企业真正关心的场景。谷歌主动让Flash在传统知识类基准上做出取舍,把释放出来的全部能力,押注到"帮人落地做事"这一维度。

在Artificial Analysis智能指数上,Gemini 3.5 Flash稳居"高智能—高速度"象限的右上方,是目前唯一稳居该最优区间的公开模型。

智能体经济学的底层逻辑

中国台湾科技媒体TechOrange捕捉到本届I/O最重要的信号:AI的竞争重心,正从模型能力转向"智能体经济学"

当AI智能体开始长时间运行、调用工具、执行多步骤任务,企业不再只关心"这个模型有多聪明",而是关心"每次推理消耗多少token、速度够不够快、能否支撑大规模自动化工作流"。

皮查伊在主题演讲中算了一笔账:一家在谷歌云每日处理约1万亿token的企业,如果把80%工作负载迁移至Flash搭配旗舰模型的混合架构,每年可以节省超10亿美元。"有些企业五月份还没结束,全年的token预算就已经耗尽。"他直言,这套模型不只是技术突破,更是企业的"财务救命稻草"。

这已经不能简单概括为"模型更便宜"。AI由此从奢侈品变成消耗品。单次调用成本低到几乎可以忽略,企业才敢把AI嵌入每一条业务流程——不再是"偶尔问一问",而是被持续调用。

架构层面的速度优势

高性能并非靠一味堆砌算力换来。

Gemini 3.5 Flash拥有100万token的上下文窗口,最大输出达65536 token,动态思考(Dynamic thinking)默认开启。这意味着模型在处理长周期任务时,不需要将内容切分成片段断点续读,推理链条不会中断——这正是智能体工作流最核心的底层需求。

提示词缓存(Prompt cache)是另一张王牌。对于智能体循环中反复调用系统提示词的场景,缓存输入定价仅为每百万token 0.15美元。谷歌在官方公告中明确表示,Gemini 3.5 Flash"非常适合应对长周期的智能体任务",包括"智能体工作流、编码任务,以及跨数周的企业级流程"。

游戏规则已经改写

过去两年,AI竞赛的铁律是"谁先拿下基准榜单,谁就获胜"。而谷歌借着Gemini 3.5 Flash走出一步险棋:把竞争维度从"能力上限"下拉到"落地下限"——不再比拼模型理论智商有多高,而是比拼在真实业务环境里,能跑得多快、成本有多低、能否支撑生产级的智能体工作流。

Pro模型依旧会拥有更强的智力上限。但绝大多数企业真正需要的,从来不是"最聪明"的模型;而是可以持续运行、成本可控、响应迅速的模型。Gemini 3.5 Flash直接把这一门槛压到极低——它已成为Gemini App和Google搜索AI Mode的全球默认模型,为全场景智能体提供算力支撑。

游戏规则已经改写。谷歌没有在旧赛道死磕,而是重新划下了新的起跑线。

大模型时代,企业如何把"智能体经济学"真正用到位

Gemini 3.5 Flash的发布,标志着大模型从"拼参数上限"转向"拼单位任务经济性"的产业拐点。对于企业而言,这既是机遇,也是挑战。

机遇在于,以Gemini、Claude、ChatGPT、DeepSeek为代表的生成式AI大模型,正在重塑企业工作流的可能性边界——从智能客服到代码生成,从文档处理到数据分析,大模型的引入让"AI员工"从概念走向现实。Gemini 3.5 Flash"输出速度约为其他前沿模型的4倍、处理智能体任务的费用通常不到其他前沿模型的一半"的官方定位,更是为企业智能体工作流提供了极具性价比的算力底座。

挑战在于,大模型时代,计费单元已从"一次对话"变为"一个任务"。模型自主拆步骤、调工具、反复重试,一个任务背后往往是几十上百次模型调用。单价看似不高,乘以调用次数,账单可能相差数量级。对于高强度内容生成、长周期自动化流程而言,算力成本依然是绕不开的课题。

在这一背景下,UseAIAPI作为全球领先的API聚合服务平台,为企业提供了一条更具成本效益的接入路径:

🌐 一站式接入全球主流大模型

平台提供Gemini、Claude、ChatGPT、DeepSeek等全球热门AI大模型的最新版本,企业无需在不同厂商之间反复切换,一套接入即可调度全球顶尖模型能力。对于代码生成、长文本处理、批量内容产出、多智能体并行等高频企业场景,开发者可以继续沿用熟悉的工作流,无缝调用最新Gemini 3.5 Flash,让"4倍速度+不到前沿模型一半价格"的性价比优势在企业内部真正跑起来。

💰 官方价最低50%的折扣权益

通过UseAIAPI接入Gemini 3.5 Flash,优惠折扣最低可达官方价格的50%。叠加谷歌官方的1.5/9美元定价,以及0.15美元/百万token的缓存输入价、Batch API的0.75/4.5美元定价,企业可以将长上下文、高并发、持续运行的智能体工作流的单位成本压到极低——让皮查伊台上那句"处理智能体任务的费用通常不到其他前沿模型的一半",从谷歌的财报数字,变成企业自己账单上的真实节省。在代码生成、长文本处理、批量内容产出、多智能体并行等高频企业场景里,月度调用成本相较直连官方通常能降40%—50%。

🏢 企业级定制化服务

UseAIAPI还能提供企业级定制化服务,结合按会话管理开销的精细化运营要求,为企业量身打造适配自身业务规模的接入方案,让长链路智能体任务的算力开销真正可控、可观测、可优化。海外账号、汇损、封号这些琐事可以一并省掉。

🛡️ 无忧直接接入使用

平台提供稳定可靠的API服务,企业无需为高强度内容生成的消耗担心,可将更多精力投入到AI工作流本身的搭建与优化中,加速办公智能体、研发智能体、运维智能体从试点走向全员普及。

💡 对于追求"无忧接入、按需扩展"的企业用户而言,通过UseAIAPI接入Gemini 3.5 Flash,能够在谷歌官方"不到前沿模型一半价格"的基础上进一步放大成本优势——让"以一半价格拿到前沿级智能"这样的效率跃迁,真正以可控的预算在企业内部落地。

结语:Gemini 3.5 Flash的发布,标志着大模型从"拼参数上限"转向"拼智能体经济学"的产业拐点。当一款Flash模型在编码、智能体、工具调用等真实工作流基准上越过自家Pro旗舰,当输出速度达到竞品4倍、单位任务成本不到一半——企业真正要回答的问题,不再是"AI有多强",而是"我的工作流,准备好迎接这台成本可控的AI引擎了吗?"

而选择合适的接入伙伴,让这场效能转型"用得起、用得稳、用得久",正是企业在效率革命中胜出的关键一步。