SOTA Sync
全部文章
质量与安全2026-09-03

Gemini 3.8 Flash:低价快模型开始正面攻入网络安全

Google DeepMind 同时发布 Gemini 3.8 Flash 与面向防御场景的 Cyber 版本:价格维持不变,软件工程、知识推理与真实漏洞发现能力继续上升,并用分层访问和监控约束双用途风险。

Gemini 3.8 Flash 的信号很明确:“快而便宜”与“能做复杂工程”正在从取舍变成同一条产品曲线。 新模型沿用 3.7 Flash 的定价——每百万输入 Token 0.75 美元、输出 Token 3.75 美元,却把软件工程、数学、科学和知识推理能力继续向上推。

#同一价格,能力边界继续外扩

在 DeepSWE v1.1 等软件工程评测上,3.8 Flash 已经进入前沿模型区间;HLE-Verified 得分达到 54.9。这里更值得注意的不是某一张榜单,而是这些能力落在 Flash 档位:当一次调用足够便宜,系统就能把预算用在多候选生成、测试、回滚和交叉审查上。

Gemini 3.8 Flash 与其他模型的综合能力对比Gemini 3.8 Flash 与其他模型的综合能力对比

#Cyber 版本把模型放进真实防御闭环

Gemini 3.8 Flash Cyber 不是简单加一个安全提示词,而是针对漏洞发现、利用验证、补丁生成与攻击面分析优化。在覆盖 20 种编程语言的内部真实世界评测中,成功率超过 70%;在 CWE-Bench 上达到 47.2%,与领先结果 47.8% 接近,但成本显著更低。

Gemini 3.8 Flash Cyber 在 CyberGym 上的通过率Gemini 3.8 Flash Cyber 在 CyberGym 上的通过率

团队还报告,它生成正确 Chrome 补丁的数量是最佳大型商业模型的 2.6 倍;在 Wiz 的环境中,召回率提高 7.5–9.7 个百分点,成本降低 2.3–5.2 倍。一次合作测试里,系统在不到两小时内发现了关键漏洞。这些数据共同指向一个工程变化:安全 Agent 可以从“偶尔调用的专家”变成持续运行的后台系统。

静态分析任务中的通过率与单次运行成本静态分析任务中的通过率与单次运行成本

#能力提升必须与访问控制同时交付

网络安全能力天然是双用途能力。DeepMind 为 Cyber 版本设置了受控访问、滥用监测与合作伙伴验证,而不是把所有能力无差别开放。Gray Swan 的间接提示注入评测也被纳入发布材料,说明“能不能完成任务”之外,模型是否会被外部内容接管已经成为发布门槛。

Gemini 3.8 Flash Cyber 的间接提示注入评测Gemini 3.8 Flash Cyber 的间接提示注入评测

这次发布最重要的不是又一个型号,而是一个成本结构:当高能力模型足够便宜,防御系统可以反复扫描、验证、修补,再由不同实例复核。安全能力由此不再只取决于模型峰值,而取决于整个 Agent 闭环的吞吐、约束与可审计性。