SOTA Sync
全部文章
质量与安全2026-09-03

Astra 越过网络安全能力红线后,OpenAI 为什么推迟发布

OpenAI 首次把 Astra 判定为达到网络安全 Critical capability:它在 ExploitBench 达到 100%,能串联浏览器与操作系统漏洞,同时迫使发布流程加入延迟、受限访问、分层监测与更强拒答。

OpenAI 在 Astra 发布前遇到的不是普通的红队问题,而是一次能力分级变化:这是其首个被指定达到 Critical 网络安全能力 的模型。结果不是给模型加几条拒答规则,而是推迟发布,直到新的访问与监测措施就绪。

#从解题能力变成完整利用链

Astra 在 ExploitBench 上达到 100%。在一组包含 20 个近期高严重性 V8 漏洞的内部评测里,它不仅复现已知漏洞,还找到并利用了两个零日问题,并把浏览器漏洞与操作系统层面的缺陷串成完整攻击链。

这类能力与传统代码问答不同。系统必须阅读大型代码库、定位内存安全问题、构造触发条件、调试失败尝试,再把多个步骤组合起来。也就是说,风险来自长程 Agent 执行,而不是某一次文本回答。

#拒答率提高,但拒答不是全部

针对网络安全越狱测试,Astra 的拒绝率达到 91.5%,而 GPT-5.6 Sol 为 59%。这是明显进步,却不能单独构成安全边界:有害请求可以伪装成合法研究,外部工具和代码仓库还会不断改变上下文。

因此,OpenAI 把控制放在多层系统里,包括模型对齐、身份与访问限制、实时行为监测、用量控制和事件响应。高风险能力只向经过审核的研究者和防御团队逐步开放,运行痕迹也要能够被审计。

#发布延迟本身是一项产品能力

前沿模型公司通常承受强烈的抢跑压力。Astra 案例的重要之处,是把“能力触线后延迟发布”变成一项可见的工程动作。能力评测不再只是报告的一页,而会真正改变上线时间、产品形态和用户范围。

这为 Agent 产品提供了更普遍的原则:能力升级必须触发控制面升级。 当系统获得更强工具、更长运行时间和更高自主性,权限、隔离、监测与回滚也要同步增强。否则,模型分数变高只会放大未被约束的行动半径。