← 返回 Blog

DeepSWE 65.3%!Gemini 3.7 Flash把"写代码"卷到了新高度

将代码生成能力推向全新高度——Gemini 3.7 Flash在DeepSWE v1.1基准测试中拿到65.3%的得分。 分数从49.0%跃升至65.3%,提升16.3个百分点。数字背后蕴藏着一场根本性转变:AI代码开发正从"辅助工具"转变为核心主力。

GeminiGemini 3.7 Flash如何把AI代码开发推向"主力"位置

DeepSWE 65.3%:Gemini 3.7 Flash如何把AI代码开发推向"主力"位置

将代码生成能力推向全新高度——Gemini 3.7 Flash在DeepSWE v1.1基准测试中拿到65.3%的得分。

分数从49.0%跃升至65.3%,提升16.3个百分点。数字背后蕴藏着一场根本性转变:AI代码开发正从"辅助工具"转变为核心主力

2026年8月13日,谷歌发布Gemini 3.7 Flash。此时距离上一代3.6 Flash问世仅三周。三周时间,在大多数研发团队手里大概只够做完一轮消融实验,谷歌却用这段不长的时间,完成了一次产品能力、定价策略与定位的全面升级。

DeepSWE考验的不是"能不能写代码",而是"能不能独立完成工程任务"

要读懂65.3%的含金量,首先要厘清DeepSWE基准的定位。

它并非LeetCode类算法考题测评——这类测试中模型依靠背诵题库就能拿到高分。DeepSWE衡量的是长线软件工程实战能力

具体意味着什么?测试场景会提供一份真实开源项目代码仓库,仓库内存在程序漏洞、待开发功能、需要改造的模块。模型必须读懂整套项目架构,定位待优化区域,编写能够融入原有框架的代码,同时保证不破坏其他功能;整套流程涵盖多阶段方案规划、工具调用、结果校验。

这正是工程师日常面对的工作。因此从某种角度来说,DeepSWE的得分回答了一个极具现实意义的问题:这款AI能够独立完成多大体量的真实软件开发工作?

得分49.0%时,答案大约是"不足一半";来到65.3%,答案变成"接近七成"。

16.3个百分点的含金量:跨过"可用"的心理分界线

这次分数跨越的精妙之处,在于跨过了一条无形的行业心理分界线。

50%及以下代表什么?AI给出的解决方案里,超过一半都需要人工重写或大规模修改。开发者借助AI辅助编码的体验是:"AI提供思路,我负责落地实现"。虽然省去一部分构思方案的时间,但核心工作依旧依靠人力完成。

突破65%之后呢?将近七成任务可以一次性顺利通过。研发工作流随之改变:从"人主导编写代码、AI辅助查阅资料",转向"AI产出主体代码、人工负责审核校验"。人机分工边界正在迁移——由AI辅助人类,迈向人类监督AI

另一组数据同样值得关注:FrontierCode 1.1 Main得分从34.4%上涨至43.6%。这项基准专门衡量生产级代码一次性生成质量:评判标准不只是代码能够运行,代码规范、健壮性、可维护性都要满足线上投产标准。43.6%意味着近半数代码无需返工,可以直接投入使用。

两项基准结合在一起,逻辑清晰可见:DeepSWE证明模型能够驾驭复杂工程任务,FrontierCode证明交付代码具备可靠品质。前者解决"能不能做成",后者解决"做得好不好"。

把视野放到横向坐标系里,3.7 Flash的表现同样可圈可点:在FrontierCode 1.1 Main上,3.7 Flash的43.6%已经略高于Claude Sonnet 5的42.7%和GPT-5.6 Terra的41.3%;WebDev Code Arena上,它拿到1588 Elo,同样超过Claude Sonnet 5的1541与GPT-5.6 Terra的1523。当然,全面反超还远远谈不上——DeepSWE v1.1上,3.7 Flash的65.3%仍低于GPT-5.6 Terra的69.6%;Terminal-bench 2.1上,85.8%也稍逊于后者的87.4%。过去主要靠速度和价格打市场的Flash,如今已经能在部分编程与Web开发测试里,和旗舰模型坐到同一张桌子上

依靠算法优化迭代,而非重新训练底座模型

Gemini 3.7 Flash距离3.6 Flash发布仅相隔三周。三周时间不足以重新训练拥有数百亿参数的大模型。

谷歌在模型卡片中表述得十分直白:3.7 Flash基于3.6 Flash底座迭代,核心升级来自推理层面的算法创新。模型参数量没有发生明显改动,但模型的思考机制完成升级。

3.7 Flash新增可调节思考深度档位(低/中/高)。开发者能够依据任务复杂度动态分配推理算力预算:简单任务减少思考资源投入、快速响应;复杂任务开启深度思考,保障输出质量。更关键的是,谷歌表示新版模型会在多步骤规划、工具调用环节分配更多推理资源;遇到障碍时主动调整策略、主动澄清模糊需求,而非卡死停滞。

第三方评测机构Artificial Analysis给出了更立体的视角:3.7 Flash开启高推理模式后智能指数达到56分,相比3.6提升4分;输出速度约每秒340.1个词元,在参评的187个模型中速度排名第一。这意味着它在与GPT-5.6 Terra(智能指数57)极其接近的智能水平下,输出速度达到竞品的三倍左右——推理速度接近竞品三倍,智能水平仅有小幅差距。这正是Flash系列的差异化路线:不追求绝对最强,而是寻找"智能水平够用"与"运行速度足够快"之间的最优平衡点。

这和传统软件工程逻辑截然不同。传统软件修复漏洞需要修改源码、重新编译、部署上线;而大模型可以不改动权重参数,只调整推理阶段决策路径:何时启动深度思考、何时快速输出响应、如何处理模糊指令,让同一底座模型在特定任务上展现出巨大性能差异。

迭代周期从"模型训练周期"转变为"算法优化周期"——后者迭代速度高出一个数量级,三周一轮的更新节奏正是依托这套模式实现。

65.3%在榜单中处于什么位置?

65.3%尚未登顶榜首。依据谷歌公开的数据:GPT-5.6 Terra在DeepSWE拿到69.6%,Claude Opus 5以74.0%位居榜单第一。3.7 Flash得分低于两者,但已经超越Claude Sonnet 5的53.8%。

但这份榜单里有一处关键细节:3.7 Flash属于Flash产品线,并非Pro系列旗舰型号

Flash系列以往定位是"主力量产型号":响应速度快、成本低廉,适合大规模商用部署。Pro旗舰系列仍在持续打磨(原定6月发布的3.5 Pro至今尚未推出),而Flash已经在竞争最激烈的代码赛道跻身第一梯队,并且维持三周一次的迭代节奏。

正如Ars Technica在报道中直言,三周即推新版的节奏"更多是维持谷歌AI持续进步表象"的举措,且CharXiv Reasoning等少数基准上3.7 Flash甚至略有退步。客观看待:3.7 Flash并非完美无缺的里程碑,但它清晰地标志着——Flash不再只追求"快",而是进化为"全能通用主力"

定价腰斩:降低试用门槛,放大商业杠杆

2026年底之前,3.7 Flash定价为每百万输入Token 0.75美元、每百万输出Token 3.75美元,恰好是3.6 Flash原价的一半;2027年1月1日起,价格恢复至1.50美元、7.50美元。

限时半价表面看属于促销,底层逻辑是降低开发者尝试门槛。谷歌鼓励更多团队把AI编程智能体整合进研发流程,运行更多任务、沉淀使用数据。一旦形成使用依赖,切换模型就会产生迁移成本——开发者适应一套模型的输出风格与协作流程后,更换其他方案不存在零成本选项。

💡 在聊天类应用中,这种价格差异或许还不算显眼;但一旦进入每天执行数万甚至数百万次调用的Agent和企业级工作流场景,最终的成本差距就会被迅速放大。

DeepSWE 65.3%、FrontierCode 43.6%、三周一轮高速迭代、叠加限时半价策略,几条线索共同勾勒出清晰格局:大模型编程能力的竞争,已经从"比拼谁更聪明"转向"比拼如何让更多开发者便捷用上智能能力"。

65.3%这个分数本身很快就会被后续版本超越。但分数背后的核心思路才值得长期关注:依靠算法优化而非重训底座、采用高频迭代而非漫长大版本发布、主打高性价比而非单纯比拼纸面智能跑分。

企业接入最新大模型,合规与成本是关键一课

谷歌三周迭代的实践给行业留下了一个清晰的启示:全球领先大模型的能力边界正在以"周"为单位向前推进,AI赋能软件工程、智能体工作流与复杂知识任务,已经成为不可逆的趋势。但对于广大企业而言,能否合规、稳定、低成本地接入这些最新模型能力,往往比"用不用AI"本身更具现实挑战——尤其是在高强度内容生成、大规模代码辅助、长周期智能体调用等场景下,API调用的成本压力、合规风险与技术门槛,常常成为制约企业AI转型的隐性瓶颈。

在这一背景下,专业的企业级AI接入服务价值凸显。UseAIAPI作为一站式大模型API服务平台,聚合Gemini、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,提供企业级定制化部署能力,让开发者无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通多模型调用。

平台的核心权益体现在三个层面:

  • 明显的成本优化空间:依托全球算力集采优势,平台为企业用户提供明显优于官方标准价的调用成本,并配套可视化财务看板,支持按项目、模型溯源消耗,让预算管控精准高效,即便面对高强度内容生成与大规模智能体调用的重消耗场景,企业也无需为成本压力分心。

  • 企业级高可用保障:支持按需定制并发、配额与路由策略,依托海外合规节点直连原厂机房,提供99.9%极致可用性保障与45毫秒骨干网络超低延迟,无惧流量洪峰,满足自动化智能体、大规模文档处理等关键业务场景。

  • 合规与安全底座:通过海外合规节点接入官方API,规避个人开发者难以解决的地区可用性门槛与数据中心IP风控风险;支持详尽日志溯源、细粒度权限审计与子账号管控,架构符合上市企业及跨国集团的IT数据安全与合规标准。

⚠️ 谷歌三周迭代的另一重启示是:当模型能力以"周"为单位刷新,企业的AI基础设施必须具备同等的敏捷性。通过UseAIAPI这样合规、稳定、具备企业级服务保障的一站式接入平台,企业能够以更优的成本结构,第一时间用上Gemini 3.7 Flash等全球最新模型,让研发团队真正无忧地专注于业务创新本身。

结语

DeepSWE 65.3%、FrontierCode 43.6%、每秒340.1个词元的输出速度、三周一轮的迭代节奏——Gemini 3.7 Flash用一组紧凑而精准的数字证明,大模型竞赛的胜负手,正在从"底座规模"转向"迭代效率"与"单位任务成本"。

对于企业而言,真正的机会不在于追逐每一个新版本的跑分,而在于搭建一套能够快速适配模型迭代的AI基础设施——合规接入、成本可控、稳定高可用。这或许才是谷歌"三周迭代"给千行百业留下的、最值得沉淀的产业启示。而借助UseAIAPI这样的一站式接入平台,把"谷歌式迭代速度"转化为企业自身的创新加速度,正是当下最具现实意义的起点。