当地时间9月2日,谷歌宣布推出Gemini 3.8 Flash Cyber模型,通过Fairwind计划面向首批受信任的安全防护团队开放。该模型定位于代码安全防护场景,在漏洞挖掘领域展现出较高的自主能力水平。据官方披露,在针对漏洞挖掘的行业权威基准测试CyberGym上,Gemini 3.8 Flash Cyber超越了前代3.5 Flash Cyber,同时性能表现优于多款参数规模更大的前沿模型。
谷歌在更全面的内部基准测试中对Gemini 3.8 Flash Cyber进行了评测。该测试要求模型在涵盖20种编程语言的复杂代码工程中挖掘各类安全漏洞。结果显示,该模型相较谷歌此前模型实现了显著性能跨越,漏洞挖掘成功率突破70%。谷歌表示,研发该模型的核心目标是为安全防御方赋予专业级能力,使其在面对攻击方时占据主导优势,因此在研发初期即将重点投入漏洞修复领域,并将该项能力置于漏洞利用等攻击性手段之上。
在CWE-Bench测试中,Gemini 3.8 Flash Cyber的首选正确率(Pass@1)达到47.2%,接近顶尖前沿模型的47.8%,同时调用成本显著更低,在性能与成本之间实现了平衡。谷歌指出,Gemini 3.8 Flash内置了完善的安全防护机制,在支持合规良性用例的同时,防范模型在化学、生物、放射性与核武器(CBRN)及网络攻击领域的滥用风险。而Gemini 3.8 Flash Cyber适度放宽了网络安全领域的策略拦截限制,因此仅面向需要更完备网络攻防能力的合规安全团队开放。
目前谷歌内部已全面部署Gemini 3.8 Flash Cyber用于代码安全防护。Chrome安全团队评估发现,针对Chrome浏览器中的安全漏洞,3.8 Flash Cyber生成有效修复补丁的数量达到顶尖商业模型的2.6倍,而这些商业模型的参数规模远大于前者。安全机构Wiz的评测显示,在其内部基准测试中,相较于其他前沿模型,Gemini 3.8 Flash Cyber的召回率提高了7.5%至9.7%,调用成本降低至原先的1/5.2到1/2.3。此外,谷歌云漏洞研究团队借助该模型耗时不到2小时便挖掘出一处严重的底层架构漏洞,而此类漏洞的调研与排查此前通常需要数月时间。
Gemini 3.8 Flash Cyber的发布反映了大模型在网络安全垂直领域的应用正从通用能力向专业化分工演进。通过针对漏洞修复场景的定向优化和成本控制,该模型为安全团队提供了新的自动化工具选择。随着更多企业将AI能力引入安全防护流程,漏洞挖掘与修复的效率瓶颈有望进一步被打破。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。