
网络安全领域的专精"瘦身模型":Gemini 3.5 Flash-Cyber 与"用 AI 上防守"的产业启示
做过代码审计的人都清楚一个行业真相:最危险的漏洞,往往潜藏在最复杂的执行路径当中。
安全团队面临的搜索空间呈指数级扩张,代码分支组合数量爆炸式增长。传统方案是调用昂贵的大模型反复穷举,每一次调用,都会在账单上增加一笔不小的开支。更尴尬的难题在于,高端大模型调用成本过高,只能有限调用一两次,最终漏检的代码路径远多于找到的漏洞。
漏洞挖掘本质上是一项搜索任务。单纯依靠单次高价大模型调用,好比拿狙击枪打地鼠:一次只能瞄准一处,可是地鼠洞口成百上千。
2026年7月21日,谷歌DeepMind推出一款针对该痛点定制的模型——Gemini 3.5 Flash-Cyber。它并非通用对话机器人,而是经过专项微调、专职"漏洞猎手"的轻量化智能体。模型基于3.5 Flash微调而来,核心目标是发现、验证并修复软件漏洞。
55个对比36个,差距不止一组数字
谷歌针对Chrome V8 JavaScript引擎开展高强度实测,结果颇具参考意义 :
Gemini 3.5 Flash-Cyber:成功挖出55个可独立确认的漏洞
Gemini 3.5 Flash:找到47个漏洞
Claude Opus 4.6:仅挖掘出36个漏洞
更关键的是,Cyber单独检出10个其他模型完全没能发现的漏洞。并且随着调用次数增加,它能够持续定位全新代码路径、挖掘出新漏洞。
这绝非只是多出几个漏洞数量的差距。在安全领域,漏报一处漏洞,代价可能就是大规模数据泄露。这10个独家发现的漏洞,意味着提前封堵了10条潜在攻击入口。
连续五次问询带来的质变
Cyber真正的杀手锏,在于独特的工作机制。
谷歌将Cyber集成至2025年10月发布的AI代码安全智能体CodeMender。CodeMender的设计思路十分巧妙:针对同一任务最多调用5次Cyber,每次从不同视角扫描代码路径,最后汇总全部输出生成完整报告 。
通俗来讲:同一个问题反复问询五次,整合多方结论交叉验证。
这不是简单重复执行,而是让同一个模型从多个维度反复审视同一段代码。如同五名侦探分头勘察同一个案发现场,再汇总线索,自然能最大限度减少遗漏。
谷歌测试结论显示:性能足够优秀的模型,随着调用次数增多,可以持续拓展覆盖范围、发现新增漏洞;能力偏弱的模型,则只会反复输出相同结论。
由此可见Cyber底层设计思路:用多次低成本调用,替代单次高价调用。单次调用成本更低,多次叠加之后,整体代码覆盖范围反而更广。在CyberGym基准测试中,这种"多智能体协作"架构让轻量模型达到了与规模大得多的前沿模型相媲美的表现 。
两小时检出远程代码执行漏洞
基准跑分是一回事,真实场景落地是另一回事。
谷歌云漏洞研究团队在真实业务环境中测试Cyber:仅仅两小时,它就在一处公开API发现远程代码执行漏洞(RCE),同时在核心生产服务中定位一处内存损坏漏洞。
更令人警惕的是,它随后生成一套稳定可用的漏洞利用程序,能够绕过地址空间布局随机化(ASLR)、写入与执行分离(W^X)等主流内存防护机制 。
Cyber现已部署在谷歌多条生产业务体系,覆盖Chrome、Android、谷歌云、广告业务、YouTube。它不是实验室里的演示样品,而是已经在谷歌内部持续值守的安全防线。在Big Sleep团队针对Chrome、Safari等全球最复杂代码仓库开展的测试中,Cyber的表现大幅优于标准版3.5 Flash与3.6 Flash,以及Claude Opus 4.6 。
为何暂不向公众全面开放
Cyber目前并未对外开放,谷歌将其纳入受限访问试点计划,仅面向政府机构与可信合作伙伴开放 。
DeepMind官方博客开篇就写明缘由:"鉴于这项技术具备双重用途属性,我们采取审慎的落地策略。"
⚠️ 能够自动挖掘、构造漏洞利用代码的AI,握在正派从业者手中是防护盾牌,落入攻击者手里就会变成攻击武器。谷歌不希望攻击方率先拿到这件利器。与此同时,谷歌也通过Gemini企业智能体平台,向普通企业客户开放CodeMender基础安全能力 。
谷歌布局的差异化竞争策略
Cyber的战略价值,远不止多挖出若干漏洞这么简单。
Anthropic依托Mythos模型,在自动化代码防御赛道早早建立领先优势。谷歌此番直接切入竞品的优势赛道,并且选择轻量化、低成本路线——不靠堆砌参数取胜,而是极致优化运行效率。
谷歌的底气源自数十年沉淀的安全基础设施:CodeMender于2025年10月发布,最初使用Gemini Deep Think模型构建自主代理,半年内向包括高达450万行代码的开源项目提交了72个安全补丁 ;OSV.dev汇总超过70万个开源漏洞,十余年OSS-Fuzz海量测试数据集,为AI模型复刻顶尖安全专家的分析思路提供高质量训练素材。
当整个行业还在比拼综合智力跑分时,谷歌走出另一条路线:把AI嵌入垂直工作流,专职处理特定任务。
3.6 Flash作为通用主力、Flash-Lite承接海量流量、Flash-Cyber深耕安全场景,多款模型分工明确,宛如一支分工清晰的工程团队。
Cyber诞生的目标,不是证明"我足够聪明",而是证明"我可以稳定产出业务价值"。
在漏洞价值动辄数百万美元的行业里,一款两小时就能挖出远程代码执行漏洞、成本远低于高端大模型的专用AI,无需依靠跑分证明自身价值。
让全球主流大模型能力,以更优成本触手可及
Gemini 3.5 Flash-Cyber的发布清晰地传递出一个信号:全球主流大模型正在分化为"智能极限突破"与"垂直场景深耕"两条赛道并行演进。但对于广大国内企业而言,想要顺畅调用Gemini、Claude、ChatGPT、DeepSeek等全球最新模型能力,仍面临跨境访问不稳定、多模型分别对接成本高、企业级集成门槛高等现实难题。
在这一背景下,UseAIAPI提供了一个稳健的解决方案:
顶尖模型一站式接入:单一接口无缝调用GPT、Claude、Gemini(含3.6 Flash与3.5 Flash-Lite)、DeepSeek等全系120+主流与前沿模型,官方能力秒级同步,让业务永远保持领先;
价格优势显著:平台优惠折扣低至官方价格的50%。以Gemini 3.6 Flash输出定价7.5美元/百万词元计算,通过UseAIAPI调用实际成本可压缩至约3.75美元/百万词元;Claude Sonnet 5首发优惠期2美元/百万词元的低价,折后优势更为突出——这意味着企业大规模、高并发部署生产级AI应用时,单位经济模型优势尤为突出;
企业级定制化服务:支持业务系统直接接入,提供稳定、合规、可控的调用环境,免去自行搭建和维护的繁琐;
灵活的多模型路由:企业可按任务复杂度自由匹配最优性价比模型——高并发低延迟业务路由至Gemini 3.5 Flash-Lite或DeepSeek,高价值的复杂推理任务调用Claude Sonnet 5、Opus或GPT,代码安全审计类工作负载可对接Gemini 3.6 Flash并配合企业自身安全流程。借助各模型自带的"effort调节"能力,配合平台的精细化路由,可将综合成本进一步压低。
从Gemini用"Flash-Cyber"证明垂直场景深耕的价值,到企业通过统一、稳定、可控的接口调用全球顶尖模型,AI生产力的最后一公里正在被打通。
"专精"二字的含义正在被重写——它不再代表能力阉割,而是代表"用更聪明的分工,做更聪明的事"。 这或许才是Gemini 3.5 Flash-Cyber留给行业最深远的启示:当一款轻量化模型都能在漏洞挖掘场景超越上代标准版与竞品旗舰,企业真正需要的不再是谁家的模型"最强",而是谁能以合理的成本、稳定的服务,将最合适的模型匹配到最合适的任务。UseAIAPI所提供的不只是接入通道,更是这套"多模型、优成本、高稳定"的AI基础设施,让每一次模型迭代的红利,都能第一时间转化为企业真实的生产力。