← 返回 Blog

每秒 350 token、百万 token 只要 0.3 美元:Gemini 3.5 Flash-Lite 重新定义"便宜快"

美国当地时间2026年7月21日,谷歌DeepMind正式推出Gemini 3.5 Flash-Lite。官方将其定位为3.5系列中速度最快、性价比最高的模型。第三方机构Artificial Analysis实测数据更加直观:每秒可输出350个词元,输入定价每百万词元仅0.3美元,输出定价2.5美元。

GeminiGemini 3.5 Flash-Lite重新定义"规模化的性价比"

每秒350词元,百万词元输入仅需0.3美元:Gemini 3.5 Flash-Lite重新定义"规模化的性价比"

从事大中型AI商业化项目的从业者都算过一笔账:当智能体每日要处理数十万份文档时,模型每多输出一个词元,最终账单上都会多出一笔清晰的开销。速度关乎体验,成本直接决定盈亏。

美国当地时间2026年7月21日,谷歌DeepMind正式推出Gemini 3.5 Flash-Lite。官方将其定位为3.5系列中速度最快、性价比最高的模型。第三方机构Artificial Analysis实测数据更加直观:每秒可输出350个词元,输入定价每百万词元仅0.3美元,输出定价2.5美元。

这个价位是什么水平?对比之下一目了然。OpenAI GPT-5.6系列输入价格区间1至5美元,输出6至30美元;Kimi K3输入3美元、输出15美元。3.5 Flash-Lite直接把输入单价压至0.3美元,约为一众竞品的十分之一。需要客观指出的是,与上一代3.1 Flash-Lite相比,新模型单价并未进一步下调,但由于能力提升带来的输出精简,综合成本仍具优势。

速度是它另一张王牌。每秒350输出词元,大约是上一代3.1 Flash-Lite的两倍。在Artificial Analysis速度评级中,3.5 Flash-Lite拿到满分4/4。对于智能体检索、文档处理这类对响应延迟敏感的场景,这意味着上千页的文件可以在数分钟内完成解析。

性能达标,低价才有真正意义

倘若低价、高速是以牺牲模型能力为代价,那终究逃不开"便宜没好货"的评价。

3.5 Flash-Lite在各项基准测试中的表现证明,它不只是单纯廉价,能力确实实现提升。对比3月发布的3.1 Flash-Lite:

  • Terminal-Bench 2.1(编程智能体):从31%跃升至54%;

  • GDM-MRCR v2(长上下文理解):由60.1%上涨至72.2%;

  • GDPval-AA v2(真实任务执行):从642大幅增长至1140。

更值得关注的是,3.5 Flash-Lite在部分Agent和编程评测中甚至超过了定位更高的Gemini 3 Flash:SWE-Bench Pro测试得分54.2%,高于3 Flash的49.6%;OSWorld-Verified测试以74.0%的成绩优于3 Flash的65.1%。

Artificial Analysis智力指数从25分提升至36分,远超同档位模型16分的平均水平。这也是最令开发者心动之处:速度翻倍,同时模型能力持续上涨。模型迭代史上,"更轻、更快、更强"三者兼得的案例并不多见。

它究竟适合哪些场景

谷歌清晰划定了3.5 Flash-Lite的目标负载:高吞吐、低延迟业务,具体包括智能体检索、文档处理、数据提取、子智能体任务执行。

这类场景拥有共同特征:任务体量庞大,单次任务逻辑并不复杂,但整体调用总量极其惊人。举例来说,一套企业级智能检索系统每日可能承受百万次查询;文档解析流水线需要同时运行数千个智能体并行处理。达到这种规模后,单次调用细微的成本差距,最终会被放大到惊人的程度。3.5 Flash-Lite的低价与高速,正是为这种大规模重复性工作量身打造。

值得一提,3.5 Flash-Lite原生内置电脑操作(Computer Use)能力,进一步降低开发者集成成本。上下文窗口达到100万词元,知识库时效截止至2026年3月。这些硬性指标意味着,它可以处理整本书篇幅的超长文档,同时掌握时效性相对新鲜的行业资讯。

开发者还能根据工作负载调整模型的"思考层级":处理简单的高容量任务时,可设为最低思考以换取低延迟和低成本;面对多步骤子智能体任务时,再提高思考层级保证质量。这种"灵活旋钮"的设计,让单一模型就能覆盖从简单抽取到复杂编排的全链路需求。

容易被忽视的细节:前代模型变相"降权"

3.5 Flash-Lite上线之后,谷歌AI开发者论坛出现一条引人关注的讨论。多名开发者反馈,自新版本发布,3.1 Flash-Lite性能"明显下滑",以往能够稳定处理的任务,如今频繁出现异常。

背后传递的信号十分微妙。大模型服务商推出新版本时,经常会重新调度底层算力资源。旧模型能力变差,并非模型权重本身改动,而是推理阶段分配的算力资源遭到压缩。换句话说,谷歌正在把算力资源从旧型号倾斜至新款模型。

这也给开发者敲响警钟:依靠"够用又便宜"的旧模型并非长久之计。各模型的性价比曲线正在快速迭代右移,今天的最优选型,明天就可能被新版本替代,并且厂商不会提前告知资源调整计划。唯有建立灵活的模型路由机制,才能在厂商迭代浪潮中始终保持成本优势。

压低成本本身就是一套战略

AI行业正在形成新共识:竞争重心从"内卷参数、内卷跑分",转向"内卷运行效率、内卷单次任务成本"。3.5 Flash-Lite正是这条路线上最为激进的样本。

它算不上综合能力最强的模型,但对于企业业务而言,或许是性价比最优选择。每秒350词元、输入0.3美元、输出2.5美元,基准成绩全面超越前代——这套组合精准击中行业痛点:当AI从"能用"走向"大规模落地",成本就是最难复制的竞争壁垒。

谷歌的布局思路清晰明了:万众期待的旗舰3.5 Pro尚未登场,Gemini 4预训练刚刚启动。在各家竞品接连实现赶超的这个夏天,与其在通用智力赛道硬碰硬角逐,不如抢先铺好一张高性价比网络。3.5 Flash-Lite就是这张网上最锋利的支点:价格低到几乎可以忽略成本,速度快到让人感受不到等待。

每一分节省下来的调用成本,都是企业敢于扩大业务规模的理由。

让全球主流大模型能力,以更优成本触手可及

Gemini 3.5 Flash-Lite的发布,清晰地传递出一个信号:全球主流大模型正在集体进入"效率优先"的新阶段。但对于广大国内企业而言,想要顺畅调用Gemini、Claude、ChatGPT、DeepSeek等全球最新模型能力,仍面临跨境访问不稳定、多模型分别对接成本高、企业级集成门槛高等现实难题。

在这一背景下,UseAIAPI提供了一个稳健的解决方案:

  • 一站式接入全球主流模型:Gemini、Claude、ChatGPT、DeepSeek等最新大模型统一接入,无需企业分别与各家海外厂商谈判协议、分别对接接口,也无需为满足最低消费承诺而承担额外成本;

  • 价格优势显著:平台优惠折扣低至官方价格的50%,意味着在谷歌3.5 Flash-Lite本就低至0.3美元/百万词元的输入价格基础上,企业实际调用成本可进一步压缩,让"用得起、用得稳、用得久"成为可能;

  • 企业级定制化服务:支持业务系统直接接入,提供稳定、合规、可控的调用环境,免去自行搭建和维护的繁琐;

  • 灵活的多模型路由:在一个平台上按任务复杂度自由匹配最优性价比模型——高并发低延迟业务路由至Flash-Lite或DeepSeek,高价值的复杂推理任务调用Claude、Gemini 3.6 Flash,单位经济模型最优。

从Gemini用"更少Token、更低单价"重塑成本曲线,到通过统一接口以更优价格调用全球顶尖模型,AI生产力的最后一公里正在被打通。对于企业而言,真正的竞争优势不再仅仅是"是否使用了AI",而是"能否以合理的成本、稳定的服务,将AI深度嵌入日常业务流程"——这或许才是Gemini 3.5 Flash-Lite"每秒350词元、输入0.3美元"留给行业最深远的启示。