
省下的Token,就是实实在在省下的真金白银——谷歌Gemini三款新模型背后的"效率经济学"
从事AI产品开发的人都有一个共识:模型输出的每一行文字,都在烧钱。
智能体想要完成多步骤任务,往往需要调用数十种工具、反复推演,生成大量中间结果。等到任务收尾,账单上的数字常常令人心惊。过去两年,行业争相比拼模型参数、跑分成绩,却很少有人认真核算:让AI完整做完一项正式工作,究竟要花多少钱?
2026年7月21日,谷歌DeepMind一次性推出三款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。备受期待的旗舰版本Gemini 3.5 Pro依旧缺席,而Gemini 4的预训练工作已经启动。这场发布会真正的主角,并非所谓"最强模型",而是一道朴素的成本算术题 。
效率提升+价格下调,两道乘法叠加
Gemini 3.6 Flash的核心升级,藏在两组数据之中。
第三方机构Artificial Analysis指数显示,3.6 Flash相比上一代3.5 Flash,输出Token消耗量降低17%。在DeepSWE这类长期软件工程基准测试里,Token消耗降幅甚至可以达到65%。与此同时,模型完成整套多步骤工作流所需的推理步数、工具调用次数也同步减少 。
定价也同步下调:3.6 Flash输入定价每百万Token 1.5美元,输出每百万Token 7.5美元;上一代3.5 Flash输出价格为9美元 。
这里的关键不在于"单价降了16.7%",而在于两道乘法叠加。第三方测算机构TokenCost的分析指出:单价下调与Token消耗量下降同时作用,等效输出成本较上一代降低约31%——这意味着开发者无需修改任何提示词,只需切换模型ID,账单上的输出项就会显著缩水 。
效率带来的成本优势并非只体现在3.6 Flash身上。Flash-Lite走出了另一条路线:每秒可生成350个输出Token,输入单价每百万仅0.3美元,输出2.5美元 。它瞄准智能体检索、大规模文档处理等高吞吐、低延迟场景,这类业务对"单次任务成本"极其敏感。
指标提升不算惊艳,但增量实实在在
在缩减Token消耗的同时,各项硬性基准指标确实有所上涨 。
DeepSWE(长程软件工程):从37%提升至49%,无效代码改动变少,任务执行循环更短;
MLE-Bench(机器学习工程):由49.7%上升至63.9%;
OSWorld-Verified(电脑操作):从78.4%提升到83.0%,如今"电脑操作"已经成为Gemini API与企业版内置工具;
GDPval-AA v2(知识工作):从1349上涨至1421。
知识库截止时间更新至2026年3月(此前为2025年1月)——对于依赖最新资讯的企业客户而言,这个细节比任何跑分都更有现实意义 。
Hebbia、Harvey等企业客户给出正面反馈:3.6 Flash在处理复杂工作流、知识类任务时,平衡好了Token使用效率、准确率与响应速度 。
第三方评测:速度惊艳,智力指数原地踏步
然而事情并非一片向好。
第三方机构Artificial Analysis给3.6 Flash的智力指数打出50分,与上一代3.5 Flash持平 。也就是说,谷歌耗时数月迭代,模型综合"智能水平"几乎停滞不前。在Artificial Analysis智能榜单上,3.6 Flash落后于Claude Fable 5、GPT-5.6 Sol、Grok 4.5、GLM-5.2、Claude Sonnet 5、Meta Spark 1.1等一众竞品,排名第十一位 。
⚠️ 但换个角度看:3.6 Flash以远低于旗舰模型的单价,拿到了50分的智力指数——在同等价格区间内表现优异。它的生成速度达到每秒271个Token ,在Artificial Analysis速度榜上位列第二,仅次于每秒350 Token的3.5 Flash-Lite。
沙丘社区SQBench对3.6 Flash的实战评测也印证了这一点:220项真实工作任务中,实战能力得分从40.5分升至51.8分,提高11.3分 ;但完整任务总账反而上涨约10.5%——因为输入成本随着上下文拉长而上升 。这说明"模型单价≠任务成本≠业务成本",企业在算账时仍需结合自身业务结构综合评估。
一场深思熟虑的战略选择
谷歌为何推出一款"智能程度不够亮眼"的新模型?
答案或许不在于技术层面,而在于战略层面。行业共识正在转变:从内卷参数、内卷跑分,转向内卷运行效率、内卷单位成本。在多家竞品实现赶超的大背景下,谷歌的应对方案是:推出性价比更高的模型。
Flash系列从诞生之初定位就不是"更聪明",而是"更省钱":更少Token消耗、更少推理轮次、更少工具调用,最终账单金额更低。对于部署数千个智能体的企业来说,单次任务成本下降18%(第三方Artificial Analysis测算平均单任务成本从0.59美元降至0.50美元 ),再乘以每月数百万次调用,节省的开支清晰可见。效率本身就是一种智能,成本控制就是核心竞争力。
这套思路在Flash-Lite身上体现得更为极致:输出Token单价低至每百万2.5美元,生成速度拉到每秒350 Token 。谷歌押注一个趋势:当成本降到足够低时,企业愿意牺牲一小部分智能表现,换取业务规模扩张。
3.5 Flash Cyber选择了差异化路线:针对网络安全漏洞挖掘这一高价值场景单独优化,通过CodeMender智能体与多Agent协同,以低于大模型的单价提供代码安全检测能力,目前仅向政府与受信合作伙伴开放限量试点 。这种"专用模型匹配垂直场景"的模式部署更快、成本更优,未来大概率会被更多厂商效仿。
省下的Token,就是实实在在省下的真金白银。 谷歌本次新品发布的核心逻辑仅此而已。但问题随之而来:当所有厂商都开始重视运行效率,谷歌的效率护城河是否足够深厚?3.6 Flash单次任务成本0.50美元,DeepSeek、MiniMax、GLM等竞品定价更低。在这场成本竞速赛中,谷歌尚未建立难以撼动的优势。
AI行业下半场,比拼的不再是谁跑得更快,而是谁跑得更便宜。谷歌押下了后者。至于这步棋对错与否,等到Gemini 4问世之时,答案自然揭晓。
让全球主流大模型能力,以更优成本触手可及
Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber的发布,清晰地传递出一个信号:全球主流大模型正在集体进入"效率优先"的新阶段。但对于广大国内企业而言,想要顺畅调用Gemini、Claude、ChatGPT、DeepSeek等全球最新模型能力,仍面临跨境访问不稳定、多模型分别对接成本高、企业级集成门槛高等现实难题。
在这一背景下,UseAIAPI提供了一个稳健的解决方案:
一站式接入全球主流模型:Gemini、Claude、ChatGPT、DeepSeek等最新大模型统一接入,无需企业分别与各家海外厂商谈判协议、分别对接接口;
价格优势显著:平台优惠折扣低至官方价格的50%,意味着在谷歌3.6 Flash本就下调的单输出价格(7.5美元/百万Token)基础上,企业实际调用成本可进一步压缩,让"用得起、用得稳、用得久"成为可能;
企业级定制化服务:支持业务系统直接接入,提供稳定、合规、可控的调用环境,免去自行搭建和维护的繁琐;
灵活的多模型路由:在一个平台上按任务复杂度自由匹配最优性价比模型——高价值的复杂推理任务调用Claude、Gemini 3.6 Flash,高并发低延迟业务路由至Flash-Lite或DeepSeek,单位经济模型最优。
从Gemini用"更少Token"重塑成本曲线,到通过统一接口以更优价格调用全球顶尖模型,AI生产力的最后一公里正在被打通。对于企业而言,真正的竞争优势不再仅仅是"是否使用了AI",而是"能否以合理的成本、稳定的服务,将AI深度嵌入日常业务流程"——这或许才是谷歌Gemini三箭齐发留给行业最深远的启示。