Gemini 3.8 Flash 的信号很明确:“快而便宜”与“能做复杂工程”正在从取舍变成同一条产品曲线。 新模型沿用 3.7 Flash 的定价——每百万输入 Token 0.75 美元、输出 Token 3.75 美元,却把软件工程、数学、科学和知识推理能力继续向上推。
#同一价格,能力边界继续外扩
在 DeepSWE v1.1 等软件工程评测上,3.8 Flash 已经进入前沿模型区间;HLE-Verified 得分达到 54.9。这里更值得注意的不是某一张榜单,而是这些能力落在 Flash 档位:当一次调用足够便宜,系统就能把预算用在多候选生成、测试、回滚和交叉审查上。
#Cyber 版本把模型放进真实防御闭环
Gemini 3.8 Flash Cyber 不是简单加一个安全提示词,而是针对漏洞发现、利用验证、补丁生成与攻击面分析优化。在覆盖 20 种编程语言的内部真实世界评测中,成功率超过 70%;在 CWE-Bench 上达到 47.2%,与领先结果 47.8% 接近,但成本显著更低。
Gemini 3.8 Flash Cyber 在 CyberGym 上的通过率
团队还报告,它生成正确 Chrome 补丁的数量是最佳大型商业模型的 2.6 倍;在 Wiz 的环境中,召回率提高 7.5–9.7 个百分点,成本降低 2.3–5.2 倍。一次合作测试里,系统在不到两小时内发现了关键漏洞。这些数据共同指向一个工程变化:安全 Agent 可以从“偶尔调用的专家”变成持续运行的后台系统。
#能力提升必须与访问控制同时交付
网络安全能力天然是双用途能力。DeepMind 为 Cyber 版本设置了受控访问、滥用监测与合作伙伴验证,而不是把所有能力无差别开放。Gray Swan 的间接提示注入评测也被纳入发布材料,说明“能不能完成任务”之外,模型是否会被外部内容接管已经成为发布门槛。
Gemini 3.8 Flash Cyber 的间接提示注入评测
这次发布最重要的不是又一个型号,而是一个成本结构:当高能力模型足够便宜,防御系统可以反复扫描、验证、修补,再由不同实例复核。安全能力由此不再只取决于模型峰值,而取决于整个 Agent 闭环的吞吐、约束与可审计性。

