← 返回 Blog

DeepSWE 49% vs 37%、MLE Bench 63.9%:Gemini 3.6 Flash 代码基准实测解读

2026 年 7 月 21 日,谷歌 DeepMind 正式发布 Gemini 3.6 Flash,同步开放 Gemini 3.5 Flash-Lite 与 3.5 Flash Cyber。在官方公告的性能清单里,最引人注目的两组数据是:DeepSWE 由 37% 提升至 49%,MLE-Bench 由 49.7% 大幅上涨至 63.9%。 但这组数字背后究竟代表什么?是营销话术,还是实打实的能力进步?想要厘清这点,首先要搞懂这两项基准评测究竟衡量什么。

GeminiGemini 3.6 Flash 代码基准深度解读

DeepSWE 49% vs 37%、MLE-Bench 63.9%:Gemini 3.6 Flash 代码基准深度解读

2026 年 7 月 21 日,谷歌 DeepMind 正式发布 Gemini 3.6 Flash,同步开放 Gemini 3.5 Flash-Lite 与 3.5 Flash Cyber。在官方公告的性能清单里,最引人注目的两组数据是:DeepSWE 由 37% 提升至 49%,MLE-Bench 由 49.7% 大幅上涨至 63.9%。

但这组数字背后究竟代表什么?是营销话术,还是实打实的能力进步?想要厘清这点,首先要搞懂这两项基准评测究竟衡量什么。

DeepSWE:长期软件工程的"实战考场"

DeepSWE 是一项面向长周期软件工程的基准测试。它考核的不是"代码写得对不对",而是能否从头到尾独立完成一整套完整任务

传统 SWE 基准侧重于单点修复:给定明确 Bug,只需要修改单行代码。DeepSWE 截然不同,它模拟真实软件工程场景:提供完整代码仓库、问题描述,模型需要自主梳理上下文、定位故障、设计方案、编写代码、执行测试、反复调试直至任务收尾。这是一套包含多轮交互、跨文件、多步骤的端到端工作流程。

谷歌官方模型卡显示,3.6 Flash 在 DeepSWE v1.1 上取得 49%,而上一代 3.5 Flash 仅为 37%,更早的 3.1 Pro 只有 12%。

得分从 37% 跃升至 49%,意味着相比前代,3.6 Flash 独立完成完整软件工程任务的成功率足足提升 12 个百分点。

💡 谷歌在模型卡说明中提到,新版本在 DeepSWE 中准确度更高、无效代码改动更少、循环调试次数降低。通俗来讲:模型不再盲目修改代码、反复兜圈子、无休止执行无意义测试。

MLE-Bench:机器学习工程的"Kaggle 竞技场"

MLE-Bench 代表另一类考核维度,它让 AI 直接参与真实 Kaggle 竞赛场景:提供数据集与预测目标,模型自主完成特征工程、超参调优、模型训练,并输出最终提交结果。

这项测试考验的不只是会不会调用 sklearn,而是能否像一名正式机器学习工程师开展工作。目前 MLE-Bench 完成评测的模型数量有限,Gemini 3.6 Flash 以 63.9% 的分数位居谷歌自测模型第一

得分由 49.7% 提升至 63.9%,涨幅 14.2 个百分点。作为参照,Gemini 3.1 Pro 在该基准仅取得 42.6%。也就是说,这款定位轻量化的 Flash 模型,机器学习工程能力已经超越上一代旗舰 Pro 版本。

数据背后核心逻辑:精简冗余输出,高效落地任务

倘若只盯着百分比,很容易忽略关键信息。

在 DeepSWE 代码工程测试中,Gemini 3.6 Flash 最高可减少 65% 的令牌消耗;整体输出令牌用量相比 3.5 Flash 平均下降 17%

直观理解:在 DeepSWE 同类任务中,单次任务平均输出令牌从 27.6 万降至 9.7 万。同一任务,输出内容至少减少 18 万字。

输出变短并非模型"变笨",而是不再需要大量反复试错。推理轮次变少、工具调用精简、调试循环减少,直接锁定解决方案,而不是在代码仓库中不断摸索试错。

这正是 49% 这个分数的含金量所在:以更少令牌、更短时间,完成更高比例的任务

⚠️ 需要厘清的是:17% 是 Artificial Analysis 综合指数下的平均结果,65% 的令牌下降则绑定在 DeepSWE 这一具体评测中。官方并未给出一个能覆盖所有任务的统一比例,不同业务场景的实际降幅会有所差异。

一张完整的成绩单向我们说明了什么

把 3.6 Flash 在官方模型卡中的核心基准放在一起观察,趋势更加清晰:

基准测试

测试焦点

3.6 Flash

3.5 Flash

变化

DeepSWE v1.1

长周期软件工程

49%

37%

+12 分

MLE-Bench

机器学习工程

63.9%

49.7%

+14.2 分

OSWorld-Verified

智能体电脑操作

83.0%

78.4%

+4.6 分

SWE-Bench Pro

多样化智能体编码

58.7%

55.1%

+3.6 分

Terminal-Bench 2.1

智能体终端编码

78.0%

76.2%

+1.8 分

GDPval-AA v2

知识工作 Elo

1421

1349

+72

横向对比同代竞品,3.6 Flash 在 OSWorld-Verified 电脑操作(83.0%)、CharXiv 图表推理(带工具 89.4%)、GDM-MRCR 长上下文(128K 平均 91.8%)等指标上领跑全场;但在 DeepSWE 这一项上,GPT-5.6 Luna 以 67% 领先于 3.6 Flash 的 49%。

没有任何一款模型横扫全部榜单。​ 3.6 Flash 的明确优势区间集中在:智能体电脑操作、多模态图表推理、长上下文检索,以及工具调用密集型任务——这些都是真实生产环境中智能体工作流的核心维度。

一个反直觉结论

Artificial Analysis 实测得出一个有意思的结论:3.6 Flash 智力指数 50 分,与 3.5 Flash 完全持平。

"智力分数没有上涨,但干活能力变强",听起来矛盾,却恰好揭示 DeepSWE、MLE-Bench 这类基准的核心:它们不测试理论智力,测试实际执行能力

两名同等智商的人,一人思绪散漫、犹豫反复、废话繁多;另一人目标明确、行动专注。二者完成实际工作的效率差距可以达到一倍以上。Flash 本次迭代的进步,不在于"思考更深",而是执行更精准、响应更快、整体效率更高。

成本侧的另一重利好

基准能力提升之外,3.6 Flash 的定价调整同样值得关注。

谷歌官方定价为:输入 1.5 美元/百万令牌、输出 7.5 美元/百万令牌。相较 3.5 Flash,输入价格保持不变,输出价格从 9 美元下降至 7.5 美元——单这一项即为输出成本带来 16.7% 的降幅。

结合前文所述的令牌效率提升(综合 17%、DeepSWE 场景最高 65%),在智能体工作流中,单任务有效成本较 3.5 Flash 时代可实现 30%-40% 量级的优化。叠加 Batch 模式的 5 折机制(输入 0.75 美元、输出 3.75 美元)与上下文缓存能力,单位成本可以进一步压低。

谷歌官方在模型卡中明确指出:3.6 Flash 适用于智能体工作流、编码任务以及持续数周的企业级流程。这句话揭示了 3.6 Flash 的真正定位——它不是为了冲击智力榜单第一名,而是作为智能体流水线里的"高效执行者"

一点提醒

上文基准数据均来自谷歌官方自报结果,仍有待第三方独立评测验证。不过即便按照行业惯例,官方数据通常存在一定乐观偏差,从 37%→49%、49.7%→63.9% 这种幅度,已经远远超出普通微调带来的小幅改善。

DeepSWE 49%、MLE-Bench 63.9%,两组数字传递同一个信号:

AI 编程助手正在从"能够回答问题",迈向"可以独立交付完整任务"。​ Gemini 3.6 Flash 依靠更少令牌、更少冗余文本、更少无效试错、更低输出单价,在这条道路上迈出重要一步。

当"高效执行"成为智能体时代的主旋律,模型接入更需稳定底座

3.6 Flash 的发布揭示了一个确定性趋势:AI 智能体大规模落地的瓶颈,已经从"模型够不够强"转向"调用够不够省、够不够稳"。对于需要大规模调用 Gemini、Claude、ChatGPT、DeepSeek 等全球主流大模型的团队而言,逐一注册海外账号、配置跨境支付、应对地区可用性限制,往往比模型本身更难攻克。

UseAIAPI​ 一站式聚合上述全球主流大模型的最新版本,支持企业级定制化部署,让开发者无需为每个大模型分别注册海外账号,一套 API Key 即可打通多模型调用

在具体权益上,平台的优势体现为三个层面:

显著的价格优惠。UseAIAPI 平台折扣最低可达官方价格的 50%

企业级定制能力。平台支持按需定制并发、配额与路由策略,满足高强度内容生成、自动化智能体、大规模文档处理等重消耗场景。企业用户可根据业务特征灵活配置,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低,真正让 3.6 Flash 的"高吞吐、低成本"红利跑到极致。

合规的基础设施。通过海外合规节点接入官方 API,提供企业级 SLA 保障,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险。平台层面可对接 Gemini API 原生的项目支出上限与使用分层机制,让开发者同样享受到谷歌 2026 年推出的预算管控能力,实现成本精细化管控。

💡 当 3.6 Flash 把"前沿能力 + 降价 16.7%"变成行业新常态,真正决定企业竞争力的,是以多低的成本、多高的稳定性,把每一次模型迭代的红利稳定地用起来。通过 UseAIAPI 接入,叠加最低官方价 5 折的优惠权益与谷歌原生的 Batch/Flex 5 折折扣,让 3.6 Flash 级别的"高吞吐、低成本"红利真正落到工程实践中,不再为高频调用的成本压力而担忧。

从 DeepSWE 49% 的能力跃升,到 MLE-Bench 63.9% 的工程突破,再到 UseAIAPI 的模型接入普惠——AI 智能体规模化落地的完整基础设施,正在一次次迭代中清晰成形。而当这套能力真正触达每一位开发者时,"AI 劳动力"才不再是一句比喻,而是每一次 API 调用中真实运转的现实。