← 返回 Blog

从 3.1 Flash 到 3.5 Flash:Gemini 应用默认模型迭代,63% 语音用户背后的算力底座升级

2026年5月19日谷歌I/O开发者大会上,首席执行官桑达尔·皮查伊宣布:Gemini 3.5 Flash正式发布,并成为Gemini全系列应用、谷歌搜索AI模式的全球默认模型,即刻向全球数十亿用户开放。 这绝非一次普通的模型版本更新,而是一次核心引擎换代——彻底替换驱动全球数亿用户AI助手的底层核心。

GeminiGemini 3.5 Flash

Flash逆袭前代Pro

2026年5月19日谷歌I/O开发者大会上,首席执行官桑达尔·皮查伊宣布:Gemini 3.5 Flash正式发布,并成为Gemini全系列应用、谷歌搜索AI模式的全球默认模型,即刻向全球数十亿用户开放。

这绝非一次普通的模型版本更新,而是一次核心引擎换代——彻底替换驱动全球数亿用户AI助手的底层核心。

而这次更新真正颠覆性的亮点,另有所在。

层级反转:轻量模型在智能体任务上反超旗舰

以往Flash系列的固有定位是"以性能换取速度":小幅牺牲智能能力,换取更快的响应速度。但Gemini 3.5 Flash打破了这条惯例。

谷歌DeepMind官方模型卡数据显示,在代码生成、智能体相关基准测试当中,3.5 Flash全方位超越Gemini 3.1 Pro

  • Terminal-Bench 2.1(智能体终端编码任务):Flash 76.2%,3.1 Pro 70.3%

  • MCP Atlas(通过MCP协议的大规模工具调用):Flash 83.6%,3.1 Pro 78.2%

  • GDPval-AA(具有经济价值的智能体工作):Flash 1656 Elo,3.1 Pro 1314

  • CharXiv Reasoning(复杂图表信息综合):Flash 84.2%,3.1 Pro 83.3%

在智能体调用工具的稳定性层面,Flash甚至优于Claude Opus 4.7(MCP Atlas 79.1%)以及GPT-5.5(MCP Atlas 75.3%)。

这意味着:主打高速的轻量化模型,在实际任务执行能力上,比上一代高端旗舰模型更加可靠

当然,在纯抽象推理(ARC-AGI-2:Pro 77.1% vs Flash 72.1%)、长文本上下文检索(MRCR v2 128K:Pro 84.9% vs Flash 77.3%)场景,3.1 Pro依旧保持优势。能力边界已经十分清晰:智能体自动化任务交由Flash处理,超高难度深度推理交给Pro版本。而Gemini应用、搜索AI模式承载的绝大多数任务——语音提问、实时对话、多步骤连续操作,恰好都属于前者。

每秒289令牌与4倍速度

速度是本次升级的另一张王牌。

Gemini 3.5 Flash输出速度可达每秒289令牌,谷歌官方称综合性能约为同类前沿模型的4倍。依托反重力平台优化版本,响应速度最高可达竞品的12倍。

这是一个什么概念?人完整眨眼一次大约需要100–150毫秒。当AI的响应速度从"数秒"压缩至毫秒级别,语音交互的本质将会彻底改变——不再是等待AI思考完毕再回复,而是几乎实现同步应答。

此前Gemini Live已经验证:语音对话场景下,用户愿意进行更长沟通,平均会话时长是文字聊天的5倍。但当底层引擎换上3.5 Flash,等待耗时从"秒级"压缩至毫秒级,语音交互才真正迈入"实时"时代。

"极速响应"如何支撑10亿用户的语音交互

2026年8月,谷歌公布Gemini月活跃用户突破10亿,成为谷歌史上增长最快的产品;仅半年时间,用户规模就从7.5亿增长至10亿。

其中63%的用户直接使用语音和Gemini交互,"纯语音"用户占比持续上升;在Gemini Live使用者中,五分之一的对话不再局限于纯语音交流,用户借助实时摄像头画面、屏幕共享解决现实问题;Gemini每日生成图像超1.5亿张;可跨越40余款主流应用执行自动化操作。

63%这个数字不只是用户偏好,更是人类生理特征催生的使用趋势。支撑这63%语音用户体验的,正是这套全新更换的核心引擎——Gemini 3.5 Flash。

💡 每秒289令牌的输出速度意味着:以往一道复杂问题需要十余秒才能生成完整答复,如今两三秒就能输出完毕。你不再漫长等候AI梳理思路,而是流畅收听AI持续给出解答。

成本优势与战略布局

接口定价标准:输入每百万令牌1.5美元,输出每百万令牌9美元,相比Gemini 3.1 Pro便宜约40%。执行各类AI智能体任务时,综合成本通常不足其他顶级大模型的一半。谷歌测算:大型科技企业倘若将八成日常业务负载迁移至Gemini 3.5 Flash,每年能够节省超十亿美元开销。

更值得关注的是谷歌的战略抉择。谷歌打破了"先主推Pro旗舰、后上线Flash轻量化版本"的惯例:3.5 Pro版本延期发布,Flash率先亮相并且直接设定为默认模型。

Google DeepMind首席技术官科雷·卡武库奥格鲁在发布前表示:"3.5 Flash兼顾出色智能水平与低延迟,在绝大多数基准测试中超越我们最新的前沿模型3.1 Pro。"

皮查伊表述更为直白:3.5 Flash拥有旗舰模型大约90%的性能水准,速度大幅提升,定价仅为旗舰版本的三分之一至二分之一。

简言之,谷歌做出一项务实的工程决策:与其让用户等待一套全能但反应迟缓的旗舰模型,不如把性能够用、响应迅捷的模型作为日常场景的默认选择。这并不是牺牲智能换取速度,而是依靠极致速度,重新定义"够用的智能标准"。

从3.1 Flash迈向3.5 Flash

梳理迭代脉络,背后思路一目了然。

早期Flash版本,只是在速度与智能之间寻找平衡点;到3.5 Flash,"平衡"升级成为"超越"——在代码、智能体任务领域直接赶超前代Pro。依托MoE稀疏激活架构与注意力机制优化,长文本处理效率大幅提升。

这不是一次普通迭代,而是范式变革:模型从"速度快,但智能尚有短板",进化为"速度飞快,同时足够聪明"。

2024年,人们关心语音助手能不能听懂话语;

2025年,人们关心它能不能妥善处理事务;

2026年,随着Gemini 3.5 Flash成为默认模型,我们迎来新的思考:当AI响应快到几乎感知不到延迟,语音交互将会演化成什么样子?

答案或许比我们预想来得更早。每秒289令牌、4倍于前沿竞品的速度。全新引擎已经正式就位。63%选择语音交互的用户,就是它稳定运行最直观的证明。

当"高速+智能体能力"成为默认,模型接入便是底座

Gemini 3.5 Flash的发布折射出一个朴素的行业真相:当AI真正走入"高速响应+智能体执行+多模态交互"的新范式,无论是前端的交互流畅度,还是后端的智能体编排,都需要稳定、合规、可负担的模型接入能力作为支撑。

对于需要长期、大规模调用全球主流大模型的团队而言,频繁遭遇地区可用性门槛、账号风控、跨境支付与多平台对接的摩擦,本身就是一个隐性成本。在这方面,UseAIAPI提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。

平台提供极具竞争力的优惠权益,折扣最低可达官方价格的50%,显著降低了高频次接口调用、高强度内容生成的重度使用成本,让团队无需为高昂的消耗而顾虑。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。

📌 当AI从"对话"走向"行动"、从"聆听"走向"理解",一套"无忧接入、按需扩展"的模型接入基础设施,与模型能力本身同样重要——这恰恰是UseAIAPI所致力于解决的问题。

真正决定产品能走多远的,除了模型能力本身,还有让每一次调用都稳定、合规、可负担的接入底座。当"高速响应+前沿智能"成为AI产品的默认标准,AI走进千行百业的脚步,才会走得更快、更稳。