
将"精打细算"刻进底层基因的编程模型
7月21日,谷歌深度思维一次性推出三款Flash系列模型:Gemini 3.6 Flash、3.5 Flash-Lite以及3.5 Flash Cyber。万众期待的Gemini 3.5 Pro依旧延期,但3.6 Flash凭借一组测试数据,让开发者群体重新核算使用成本。
DeepSWE评测得分从37%提升至49%,MLE-Bench由49.7%升至63.9%,OSWorld-Verified从78.4%上涨到83.0%,GDPval-AA v2知识工作Elo由1349分提升至1421分。
据谷歌官方与Artificial Analysis数据,3.6 Flash输出令牌消耗量较3.5 Flash降低17%;在DeepSWE等长期软件工程任务中,最高可下降65%。第三方评测机构Artificial Analysis给出的智能指数为50分,与3.5 Flash完全持平。
智能水平没有提升,但完成同等任务,不再需要兜大量圈子。这正是3.6 Flash想要解决的核心问题。
DeepSWE达到49%:成功率提升12个百分点,令牌消耗大幅削减
先来拆解DeepSWE测试。该基准用于衡量长期软件工程能力:模型需要在真实代码仓库中跨文件修改代码、重构项目、执行测试,并非"编写一段函数"这类单一简单任务。
据评测数据,旧版3.5 Flash在此测试中成功率37%;而3.6 Flash直接将成功率拉至49%。成功率提升12个百分点,在部分长周期工程任务中,单任务令牌消耗最高可削减约三分之二。
谷歌表示,3.6 Flash能够"减少不必要的代码修改与重复执行循环"。通俗来讲:以往执行编程任务时,模型会反复测试、不断调整,走大量弯路;新版Flash推理步骤更少、工具调用次数更少。它不是智商更高,而是判断更加精准,直击问题核心,不需要反复试探。
在SWE-Bench Pro测试中,3.6 Flash拿到58.7%,超越3.5 Flash的55.1%,同时胜过前代更大规格模型3.1 Pro的54.2%。一款中端Flash系列模型,编程能力已经超越上一代Pro旗舰。
MLE-Bench 63.9%:机器学习研究能力实现代际跨越
除代码开发外,MLE-Bench的飞跃同样值得关注。得分从49.7%上涨至63.9%,提升14.2个百分点。这项指标代表AI独立开展机器学习研究的核心能力。
这意味着什么?模型不只是能够编写代码,还可以理解机器学习实验的设计思路、复现流程与参数调优策略。企业能够以更低的单任务成本,开展更加复杂、持续的研发工作。
全方位的性能进阶,并非偶然现象。在GDPval-AA v2知识基准测试中,3.6 Flash的Elo由1349分提升至1421分;OSWorld-Verified电脑操作测试从78.4%升至83.0%。
多智能体编排:从单一智能体,走向群体协同调度
Flash真正的王牌不在于跑分,而是多步骤任务编排能力。
在Antigravity等平台上,3.6 Flash依托多智能体编排能力执行代码迁移任务,相比前代模型延迟更低、输出质量更高。在演示案例中,3.6 Flash充分展现多智能体协同能力,不仅顺利完成复杂代码迁移工作,在响应速度、代码质量层面,对3.5 Flash形成明显优势。
谷歌对3.6 Flash的定位十分清晰:以Flash档位的价格与速度,提供接近Pro级别的智能水平。
核心优化方向为多步骤任务编排、全栈代码重构、通用推理能力,令牌利用效率相比3.5 Flash大幅改善。据官方定价,输入价格为每百万令牌1.5美元,输出7.5美元,低于3.5 Flash的9美元。
💡 需要客观指出的是,Artificial Analysis的评测显示,3.6 Flash智能指数与3.5 Flash持平——智力的"天花板"并未显著抬高,但单位任务的令牌消耗、延迟与稳定性得到了实质优化。在Artificial Analysis的标准任务套件中,平均任务耗时从2.7分钟降至1.3分钟,单任务成本从0.59美元降至0.50美元。而这几点,恰好是大规模部署AI智能体最核心的需求。
如今3.6 Flash已经全面可用(GA),可以直接通过Gemini API接入谷歌AI Studio、安卓开发工作室(Android Studio)、Antigravity、Gemini Enterprise等平台。从开发工具到企业级平台,实现全线部署。
"效率优先"的产品理念
本次发布背后有着耐人寻味的行业背景。谷歌同时官宣,Gemini 4预训练工作已经启动,号称"公司史上最大规模项目";而3.5 Pro依旧处于合作伙伴内测阶段。
旗舰产品交付遇阻、下一代模型尚在路上的阶段,3.6 Flash交出了一份以"效率优先"的答卷。谷歌没有依靠"更强智能"博取市场眼球,而是聚焦成本、延迟、可靠性三大维度优化。而这三点,正是大规模部署AI智能体最核心的需求。
Artificial Analysis的评测结论直白中肯:3.6 Flash"速度显著提升(303.6令牌/秒),成本下降,但综合评测来看,并没有比前代更聪明"。谷歌为本代产品选定的优化主线,是"多智能体循环任务里的成本、延迟与稳定性",方向清晰,落地扎实。
DeepSWE 49%、MLE-Bench 63.9%、支持多智能体协同完成代码迁移……所有数据指向同一个事实:
3.6 Flash让AI智能体成本更低、稳定性更强,更擅长处理长期复杂任务。
它并非为刷新智能上限而来,目标是压低每一次智能体任务运行的成本。
而谷歌官方博客末尾埋下的Gemini 4预告,或许才是真正想要传递的信号:3.6 Flash仅仅是前菜,主菜还在筹备之中。
当"效率革命"成为AI竞争主轴,企业如何接住这波红利
3.6 Flash的发布揭示了一个朴素而深刻的产业转向:当Agent从Demo走向生产环境,账单比跑分更重要。令牌单价的下调、效率的提升,直接决定了智能体能否在真实业务中跑通成本模型。
然而现实落地中,企业往往面临多重门槛:
模型碎片化:GPT、Claude、Gemini、DeepSeek各有擅长,分别对接意味着重复开发、运维成本高企;
跨境调用难:以Gemini为例,面对地区策略收紧、官方价格走高的局面,自建通道的技术门槛与合规成本陡增;
高强度消耗下的成本压力:Agent化场景意味着高频次、长上下文、多轮调用,按官方原价计费,账单将呈指数级膨胀。
这正是UseAIAPI所致力于解决的问题。作为全球领先的API聚合服务平台,UseAIAPI为企业与开发者提供以下核心权益:
全生态模型一站式接入:单一接口无缝调用GPT、Claude、Gemini、DeepSeek等120余个顶级模型,覆盖对话、推理、多模态、嵌入等全场景,官方能力实时同步,业务始终站在技术前沿。
企业级高可用保障:海外节点直连原厂机房,依托自研智能负载均衡与全球边缘节点分发,实现毫秒级响应,提供99.9%极致可用性保障与45ms骨干网络超低延迟,稳健承载百万美元级API吞吐,晚高峰依然稳定可靠,无惧流量洪峰。
成本优化显著,缓解高强度消耗压力:平台专属优惠折扣最低可达官方定价的50%。依托全球算力集采优势压降成本,并提供可视化财务看板,支持按项目、模型溯源消耗,支持对公结算。对于高并发调用、高强度内容生成、长上下文Agent开发等重度使用场景,这一权益能够有效缓解成本压力——以Gemini 3.6 Flash为例,其输出单价已从9美元降至7.5美元每百万令牌,而通过UseAIAPI的高频调用综合成本可进一步压至官方定价的五成左右,让预算管控精准高效。
定制化服务体系:UseAIAPI定位为SVIP企业级API服务平台,"不仅是一个接口,更是能融入核心系统、通过财务审计、适配集团架构的AI基础设施"。提供超越模型原厂的卓越服务体验,从技术对接到合规部署、从运维保障到场景落地,全程护航。
从3.6 Flash在后端"少走弯路"省下的每一个令牌,到UseAIAPI在企业服务端提供的稳定、低成本、全模型覆盖的接入底座,AI产业正在从"拼智商"切实转向"拼性价比"。而当前沿智能真正成为可调用、可负担、可落地的基础设施,这场效率革命的红利,才能惠及每一位开发者和每一家企业。
UseAIAPI,让澎湃智能触手可及。