← 返回 Blog

智能没涨、速度翻倍:Gemini 3.6 Flash 实测出炉,谷歌承认"不卷智商卷性价比"

美国东部时间7月21日,谷歌DeepMind一次性发布三款模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。万众期待的Gemini 3.5 Pro依旧缺席——谷歌曾在5月份I/O开发者大会上宣称该版本将在一个月内上线,如今两个月过去,依旧杳无音讯。而本次主推的3.6 Flash,在第三方评测机构Artificial Analysis的智力指数评分仅为50分,和3.5 Flash分数持平。

GeminiGemini 三款新模型背后的"效率经济学"

智能水平原地踏步,任务耗时直接减半:Gemini 三款新模型背后的"效率经济学"

AI分析师@Teksart在X平台发布的一条观点被大量转发:"谷歌此番优化的是运行效率,而非模型能力。Gemini 3.6 Flash运行成本更低,却没有变得更聪明。这更像是Gemini 4进入预训练阶段时推出的过渡占位产品。"

这段话一针见血,戳破了谷歌本次新品发布最为尴尬的一面。

美国东部时间7月21日,谷歌DeepMind一次性发布三款模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。万众期待的Gemini 3.5 Pro依旧缺席——谷歌曾在5月份I/O开发者大会上宣称该版本将在一个月内上线,如今两个月过去,依旧杳无音讯。而本次主推的3.6 Flash,在第三方评测机构Artificial Analysis的智力指数评分仅为50分,和3.5 Flash分数持平。

一次性能停滞不前的"版本升级"

Artificial Analysis智力指数综合了推理、知识储备、数学、编程等多维度测试。Flash系列在此榜单拿到50分,位列第11名,榜单第十名门槛分数为51分。排在它前面的包括Meta Muse Spark 1.1、GPT-5.6 Luna、Claude Sonnet 5、Grok 4.5、Kimi K3、GLM-5.2等模型。目前谷歌旗下尚无任何一款模型跻身这份全球智力榜单前十。

更值得玩味的是模型各项能力表现分化。在模拟真实知识工作的GDPval-AA v2测试中,3.6 Flash的Elo分值从1349提升至1421;但在当前难度顶尖的综合测试Humanity's Last Exam中,得分反而从41%下滑至38%。有升有降,综合实力整体陷入停滞。

开发者社区的评价更为直白。实测后不少开发者发现,在生成三层以上嵌套的React/Vue组件时,3.6 Flash标签闭合错误率高达42%。有开发者在社交平台直言,该模型前端能力薄弱,空间推理表现同样不佳。有人评论:"谷歌就像龟兔赛跑里的兔子,短暂领跑之后,便停下脚步开始沉睡。"

智能未见增长,运行速度近乎翻倍

虽然智力水平没有提升,但运行效率确实大幅跃升。

Artificial Analysis测试数据显示,在高推理配置下,3.6 Flash完成任务平均耗时从2.7分钟缩短至1.3分钟,降幅超过50%;输出速率从每秒165 Token飙升至304 Token。单次任务成本由0.59美元降至0.50美元;输出Token平均消耗量下降17%,在DeepSWE这类长期工程任务中,Token最高可节省65%。

输出端定价由每百万Token 9美元下调至7.5美元,输入价格维持每百万Token 1.5美元不变。

省下的Token,就是实打实省下的成本。Flash-Lite方案则走得更远:每秒生成350 Token,输入单价每百万Token仅0.3美元,输出2.5美元——它是Gemini 3.5家族中速度最快、价格最低的成员。

💡 需要说明的是,Flash-Lite虽然单价更低、速度更快,但Artificial Analysis实测其平均单任务成本从0.04美元升至0.09美元——因为新定价相对上一代3.1 Flash-Lite有所上调。这意味着"Lite≠绝对更省",企业在选型时仍需结合自身业务结构精细测算。

谷歌本次战略意图十分清晰:不求比任何人更强,但求比所有人更省钱。​ 在这场"全面被赶超的夏日",OpenAI、Anthropic、xAI接连推出号称"全球最强"的旗舰模型,谷歌给出的应对方案却是主打高性价比的经济型模型。

一场取舍博弈

有开发者测算,3.6 Flash单位Token成本高于GPT-5.6 Sol,但智力水平更低。一个尴尬的问题随之而来:成本更高、能力偏弱的Flash,还配得上Flash(极速版)这个名号吗?

3.6 Flash与Flash-Lite重心放在提升Token利用率、精简推理步骤,这类优化也是各大头部企业共同发力的方向。问题在于,当全行业都在深耕效率优化时,谷歌并没有构建起难以撼动的效率护城河。3.6 Flash单次任务成本0.50美元,DeepSeek、MiniMax、GLM等一众竞品定价比它更低。

DeepMind技术负责人洛根·基尔帕特里克在社交平台回应称,3.5 Pro目前正在和合作方开展测试,调试完成后将会立刻发布。与此同时,谷歌在官方博客提及,已经启动迄今为止规模最大的Gemini 4预训练工作

两条信息拼凑出清晰图景:谷歌推出3.6 Flash更多是权宜过渡产品。​ 重心已经全面转向Gemini 4,3.5 Pro仍在打磨优化,3.6 Flash主要是用来填补产品空窗期的方案。

有开发者评价:"缩短任务耗时固然是好事,但智力水平停滞,说明谷歌优先选错了衡量指标。创新需要深度,不能只比拼运行秒数。"

AI行业下半场确实要比拼谁的运行成本更低,但前提是大家先要站在同一条起跑线上。​ 当竞品不断冲击能力上限,谷歌却在持续打磨成本下限。这究竟是务实的战略转型,还是被动防守的无奈之举?答案或许要等到Gemini 4正式登场那天才能揭晓。

让全球主流大模型能力,以更优成本触手可及

Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber的发布,清晰地传递出一个信号:全球主流大模型正在集体进入"效率优先"的新阶段。但对于广大国内企业而言,想要顺畅调用Gemini、Claude、ChatGPT、DeepSeek等全球最新模型能力,仍面临跨境访问不稳定、多模型分别对接成本高、企业级集成门槛高等现实难题。

在这一背景下,UseAIAPI提供了一个稳健的解决方案:

  • 一站式接入全球主流模型:Gemini、Claude、ChatGPT、DeepSeek等最新大模型统一接入,无需企业分别与各家海外厂商谈判协议、分别对接接口;

  • 价格优势显著:平台优惠折扣低至官方价格的50%,意味着在谷歌3.6 Flash本就下调的单输出价格(7.5美元/百万Token)基础上,企业实际调用成本可进一步压缩,让"用得起、用得稳、用得久"成为可能;

  • 企业级定制化服务:支持业务系统直接接入,提供稳定、合规、可控的调用环境,免去自行搭建和维护的繁琐;

  • 灵活的多模型路由:在一个平台上按任务复杂度自由匹配最优性价比模型——高价值的复杂推理任务调用Claude、Gemini 3.6 Flash,高并发低延迟业务路由至Flash-Lite或DeepSeek,单位经济模型最优。

从Gemini用"更少Token"重塑成本曲线,到通过统一接口以更优价格调用全球顶尖模型,AI生产力的最后一公里正在被打通。对于企业而言,真正的竞争优势不再仅仅是"是否使用了AI",而是"能否以合理的成本、稳定的服务,将AI深度嵌入日常业务流程"——这或许才是谷歌Gemini三箭齐发留给行业最深远的启示。