OpenAI 在 Astra 发布前遇到的不是普通的红队问题,而是一次能力分级变化:这是其首个被指定达到 Critical 网络安全能力 的模型。结果不是给模型加几条拒答规则,而是推迟发布,直到新的访问与监测措施就绪。
#从解题能力变成完整利用链
Astra 在 ExploitBench 上达到 100%。在一组包含 20 个近期高严重性 V8 漏洞的内部评测里,它不仅复现已知漏洞,还找到并利用了两个零日问题,并把浏览器漏洞与操作系统层面的缺陷串成完整攻击链。
这类能力与传统代码问答不同。系统必须阅读大型代码库、定位内存安全问题、构造触发条件、调试失败尝试,再把多个步骤组合起来。也就是说,风险来自长程 Agent 执行,而不是某一次文本回答。
#拒答率提高,但拒答不是全部
针对网络安全越狱测试,Astra 的拒绝率达到 91.5%,而 GPT-5.6 Sol 为 59%。这是明显进步,却不能单独构成安全边界:有害请求可以伪装成合法研究,外部工具和代码仓库还会不断改变上下文。
因此,OpenAI 把控制放在多层系统里,包括模型对齐、身份与访问限制、实时行为监测、用量控制和事件响应。高风险能力只向经过审核的研究者和防御团队逐步开放,运行痕迹也要能够被审计。
#发布延迟本身是一项产品能力
前沿模型公司通常承受强烈的抢跑压力。Astra 案例的重要之处,是把“能力触线后延迟发布”变成一项可见的工程动作。能力评测不再只是报告的一页,而会真正改变上线时间、产品形态和用户范围。
这为 Agent 产品提供了更普遍的原则:能力升级必须触发控制面升级。 当系统获得更强工具、更长运行时间和更高自主性,权限、隔离、监测与回滚也要同步增强。否则,模型分数变高只会放大未被约束的行动半径。