当地时间 9 月 2 日,谷歌发布 Gemini 3.8 Flash Cyber 安全专用模型,核心能力是自主漏洞挖掘。官方数据显示,其漏洞挖掘成功率突破 70%,谷歌内部已将该模型全面部署在代码安全防护岗位上,并通过 Fairwind 计划向首批受信任的安全防护团队开放。
漏洞挖掘成绩:专用模型的优势
Gemini 3.8 Flash Cyber 是 Gemini 3.8 系列的安全专用版本。在面向漏洞挖掘的行业基准 CyberGym 上,它超过了前代 3.5 Flash Cyber,也超过多款参数规模更大的前沿模型。
谷歌的内部基准测试覆盖 20 种编程语言的复杂代码工程,要求模型挖掘各类安全漏洞。该模型的漏洞挖掘成功率突破 70%,相比谷歌此前型号大幅提升。
在 CWE-Bench 测试中,Gemini 3.8 Flash Cyber 的首选正确率(Pass@1)达到 47.2%,紧追顶尖前沿模型的 47.8%,调用成本则显著更低。性能与成本的平衡是它的主要竞争力。
三个落地案例
谷歌披露了三组实测数据:
- Chrome 安全团队评测:针对 Chrome 浏览器的安全漏洞,3.8 Flash Cyber 生成有效修复补丁的数量达到顶尖商业模型的 2.6 倍,而后者的参数规模远大于它。
- 安全机构 Wiz 评测:相较其他顶尖前沿模型,该模型的漏洞召回率提高 7.5%–9.7%,调用成本降至原来的 1/5.2 到 1/2.3。
- Google 云漏洞研究团队:借助该模型不到 2 小时就挖出一处严重的底层架构漏洞;此前这类漏洞的调研与排查通常需要数月。
修复能力优先于攻击能力
谷歌在研发这款模型时,把为防御方提供专业能力作为核心目标,从一开始就重点投入漏洞修复,而不是漏洞利用这类攻击性手段。
出于安全考虑,Gemini 3.8 Flash 内置了针对化学、生物、放射性与核武器(CBRN)以及网络攻击滥用风险的防护机制。Cyber 版本适度放宽了网络安全领域的策略拦截限制,因此只面向需要更完备网络攻防能力的合规安全团队开放。
对安全团队意味着什么
从已披露的数据看,专用化是小模型追上大模型的一条可行路径:3.8 Flash Cyber 在漏洞挖掘任务上以明显更低的成本追平了顶尖模型的水平。对防御方来说,这类工具把过去需要数月的人工漏洞排查压缩到小时级,同时将补丁产出能力提高数倍。