近日,谷歌正式发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两款大模型。前者重点强化软件工程与智能体知识工作流能力,后者则专注于网络安全漏洞挖掘。
1、Gemini 3.8 Flash 基础能力与定位
Gemini 3.8 Flash 在 3.7 Flash 基础上迭代升级,重点强化软件工程与智能体知识工作流相关能力。该模型最高支持 100 万 Token 上下文窗口,文本输出可达 64K Token,面向普通用户、开发者与企业客户,适合低成本大规模部署生产级智能体,可应用于软件工程开发、AI 智能体任务、复杂知识处理等场景。
2、基础模型的局限与不足
作为基础大模型,Gemini 3.8 Flash 同样存在幻觉问题,谷歌也在持续优化其抗越狱攻击能力并升级前沿安全防护策略。不过在高推理强度场景下,模型会消耗更多 Token,还偶发响应缓慢、请求超时等现象。
3、Gemini 3.8 Flash Cyber 安全专项能力
Gemini 3.8 Flash Cyber 通过 Fairwind 计划,仅对首批经过信任审核的安全防护团队开放。在漏洞挖掘权威基准 CyberGym 测试中,该模型展现出顶尖的自主挖洞能力,表现优于前代 3.5 Flash Cyber,同时超过不少参数量更大的主流前沿模型;谷歌内部开展的覆盖 20 种编程语言的复杂代码漏洞挖掘评测中,其漏洞挖掘成功率突破 70%,相比过往模型实现明显提升。
该模型研发目标是赋能安全防御人员、强化防御侧能力,开发优先级偏向漏洞修复而非攻击性漏洞利用;在 CWE-Bench 测试中,其处于帕累托最优前沿,Pass@1 首选正确率 47.2%,十分接近头部模型 47.8% 的水平,同时调用成本更低,实现了性能与成本的均衡。
4、安全管控与定向开放策略
谷歌表示,Gemini 3.8 Flash 搭载完整安全管控,在支持合规业务的前提下,防范化学、生物、核辐射、核武器(CBRN)以及网络攻击方向的滥用。而 Flash Cyber 适度放开了网络安全方向的拦截限制,因此只向合规安全团队定向开放,谷歌内部也已将该模型投入代码安全防护工作。
