
Gemini 3.5 Flash-Lite 定价曝光:0.30 美元/百万令牌,谷歌角逐"子智能体"赛道
2026 年 7 月 21 日,谷歌一次性发布三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。其中讨论热度最高的并非性能更强的主力版本,而是带有 Lite 后缀、成本最低、推理速度最快的型号。
其定价标准:输入令牌 0.30 美元/百万,输出令牌 2.50 美元/百万,输出速度约 350 令牌/秒。
但真正的核心看点不在于价格数字本身,而是谷歌将这款模型精准瞄准一块全新赛道:子智能体(Subagent)市场。
单价有所上调,综合价值反而更高
先看一个反直觉事实:Gemini 3.5 Flash-Lite 定价高于前代产品。
上一代 Gemini 3.1 Flash-Lite 价格为输入 0.25 美元、输出 1.50 美元/百万令牌。Flash-Lite 系列单价已经连续三代上调:0.10/0.40 → 0.25/1.50 → 0.30/2.50。
伴随涨价的是智能能力大幅跃升。谷歌官方数据显示,独立智能评分从前代 25 分提升至 36 分,涨幅约 44%;Terminal-Bench 2.1 基准得分从 31% 提升至 54%;长上下文召回率由 60.1% 上涨至 72.2%;GDPval-AA v2 真实任务评分从 642 跃升至 1140。
💡 谷歌同步开放了 Batch 与 Flex 模式,Flash-Lite 在两类模式下价格均为输入 0.15 美元/百万令牌、输出 1.25 美元/百万令牌——较标准价直接 5 折。对于文档批量处理、大规模翻译等无需实时返回的负载,单位成本可比标准价再降一半。
"子智能体":被重新定义的模型角色
Flash-Lite 真正的变革不在价目表,而在于产品定位。
谷歌官方定义:3.5 Flash-Lite 是 Gemini 3.5 系列中速度最快、成本最低的模型,专为高吞吐量执行而优化,面向智能体搜索、文档处理、从大型电商数据集中提取特征、翻译、收据总结等规模化场景。
何为子智能体?简单理解:主智能体拆解复杂任务之后,大量子智能体并行执行海量"基础性粗加工任务"——内容分类、路由分发、信息抽取、文档解析、轻量代码处理。这类任务不需要顶级深度推理能力,但要求速度快、适合批量调度、可控成本。
这是谷歌首次不以"模型尺寸/推理速度"划分梯队,而是依据智能体职能定义模型层级。Flash-Lite 不再简单归类为"小型模型",而是明确定位为:执行任务的工作型模型。
谷歌在公告中明确指出:3.5 Flash-Lite"为智能体系统的高效扩展提供支持"(enables efficient scaling for agentic systems),开发者可根据工作负载,通过配置极简(minimal)或低(low)思考等级来优先满足高容量任务的低延迟、低成本执行,或使用更高的思考等级来处理多步子智能体工作负载。
厘清定位差异,看懂战略意图
对比同期谷歌自家模型矩阵,定位差异一目了然:
模型 | 输入价(美元/百万令牌) | 输出价(美元/百万令牌) | 定位 |
|---|---|---|---|
Gemini 3.6 Flash | 1.50 | 7.50 | 新主力,编程与多模态智能体任务 |
Gemini 3.5 Flash-Lite | 0.30 | 2.50 | 高吞吐子智能体专用 |
Gemini 3.5 Flash Cyber | 未公开 | 未公开 | 网络安全漏洞修复,仅限政府及可信伙伴试点 |
Flash-Lite 与 3.6 Flash 同日发布,但版本号保留 3.5。谷歌给出解释:版本号跟随模型本体迭代进度,而非发布时间。3.6 Flash 完成跨代重大升级,因此提升版本号;Flash-Lite 虽为全新模型,依旧归入 3.5 产品线。
这个细节释放信号:在谷歌内部,Flash-Lite 定位偏向稳定可靠,而非前沿探索型号。它不需要最顶尖的极限能力,优先保障行为可预测、便于横向扩容、能够放心交给自动化流水线大规模调用。
谷歌战略:依靠"集群人海策略"填充各类场景
如果把 Gemini 3.6 Flash 视作主力核心,那么 3.5 Flash-Lite 就是谷歌用来覆盖海量场景的"集群人海战术"载体。
谷歌本次策略十分巧妙:没有掀起全面价格战,而是通过模型分层,在能力、令牌消耗、响应速度、单任务成本之间寻找全新平衡点。在 OpenAI、Anthropic 持续推出更强旗舰模型的行业背景下,谷歌选择差异化路线——全力填补 AI 智能体商业化落地周边的空白场景。
3.5 Flash-Lite 支持可自定义思考等级(极简/低/较高),开发者能够针对每一次请求,自主平衡推理深度与调用成本。追求极速响应的批量任务选用极简模式;需要严谨判断的任务调高思考档位。灵活可调本身就是一套成本管控手段。
并非完美无缺
当然,Flash Lite 依旧存在短板。
它是谷歌"最具成本效益的正式版模型",针对高调用量智能体任务、翻译和简单的数据处理进行了优化。在轻量化应用场景下,面对最前沿的深度推理与代码生成,能力天花板依然不及 GPT、Claude 最新系列旗舰。
但核心区别在于:那些通用小型模型从未被定位成"子智能体专用模型",而被描述为适配广泛任务的低成本通用模型;而 Flash-Lite 从立项之初,就被设计为多智能体流水线里的标准化组件。定位差异,决定两者面向完全不同的开发者选型场景。
一处细节解读
0.30 美元/百万输入令牌只是一个数字。真正值得关注的,是数字背后的行业判断:
AI 下一轮主战场不再单纯比拼"谁更聪明",而是比拼"低成本规模化执行任务"。
谷歌借助 Flash-Lite 抢占的,正是子智能体这片尚未充分开发的蓝海。当主智能体(如 3.6 Flash)负责编排与深度推理,数以百计的 Flash-Lite 子智能体并行执行分类、抽取、路由、总结——这才是谷歌描绘的多智能体商业化未来。
当子智能体成为标配,模型接入更需稳定底座
Flash-Lite 的出现,意味着企业可以在生产环境中同时运行数十乃至数百个高吞吐子智能体。但当子智能体协同成为工程常态,模型调用的稳定性、成本与合规性,就成为决定业务能否规模化的关键变量。
对于需要大规模调用 Gemini、Claude、ChatGPT、DeepSeek 等全球主流大模型的团队而言,逐一注册海外账号、配置跨境支付、应对地区可用性限制,往往比模型本身更难攻克。UseAIAPI 一站式聚合上述全球主流大模型的最新版本,支持企业级定制化部署,让开发者无需为每个大模型分别注册海外账号,一套 API Key 即可打通多模型调用。
在具体权益上,平台的优势体现为三个层面:
显著的价格优惠。UseAIAPI 平台折扣最低可达官方价格的 50%。
企业级定制能力。平台支持按需定制并发、配额与路由策略,满足高吞吐子智能体集群、自动化智能体、大规模文档处理等重消耗场景。企业用户可根据业务特征灵活配置,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低,真正让"集群人海战术"跑得稳、跑得省。
合规的基础设施。通过海外合规节点接入官方 API,提供企业级 SLA 保障,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险。平台层面可对接 Gemini API 原生的项目支出上限与使用分层机制,让开发者同样享受到谷歌 2026 年推出的预算管控能力,实现成本精细化管控。
💡 当子智能体集群成为生产系统的标准架构,真正的竞争力不仅在于"用得起多少个 AI",更在于"以多低的成本、多高的稳定性,把每一次模型迭代的红利稳定地用起来"。通过 UseAIAPI 接入,叠加最低官方价 5 折的优惠权益与谷歌原生的 Batch/Flex 5 折折扣,让 Flash-Lite 级别的"高吞吐、低成本"红利真正落到工程实践中,不再为高频调用的成本压力而担忧。
从 Flash-Lite 的"子智能体专用"定位,到 UseAIAPI 的模型接入普惠——AI 规模化落地的完整基础设施,正在一次次迭代中清晰成形。而当这套能力真正触达每一位开发者时,"AI 劳动力"才不再是一句比喻,而是每一次 API 调用中真实运转的现实。