SOTA Sync
全部文章
质量与安全2026-09-07

OpenAI 首席科学家要求减速

Jakub Pachocki 判断递归自我改进正在逼近,并呼吁共享安全门槛与国际协调。

OpenAI 首席科学家 Jakub Pachocki 公开给出了一个少见的判断:基于内部结果,他强烈预期当前能力进步可能延续到递归自我改进,让系统越来越多地参与自身研发;与此同时,他认为没有任何实验室已经把对齐和监控解决到足以长期以最高速度继续扩展。

他的结论不是单纯“继续加速”或“立即停下”,而是把模型扩展绑定到可验证的安全信心,并在共享门槛建立前接受自愿减速。

#智能更像被培育,而不是被设计

Pachocki 回顾了 2023 年 RLSlow 项目。当时团队第一次确信,推理模型训练可以规模化,使预训练模型形成自己的思维链。三年后,推理模型已经能操作图形界面、与人和其他 Agent 协作、执行研究项目,并开始改变网络安全攻防。

他把深度学习描述为一门实验科学。模型不是由人逐条写出规则,而是在巨量算力上重复优化后“长出来”的复杂系统。研究者可以像神经科学一样发现局部机制,却仍不能完整描述整体行为。能力越高、环境越复杂,结果越难解释。

这也意味着,机器智能不必在所有维度复制人类,才会产生巨大影响。只要在足够多的关键轴上超过人类,就可能成为非常有用或非常危险的行动者。

#目标对齐与价值对齐不是一回事

文章把对齐分成两个层次。目标对齐关心系统是否执行眼前任务,包括遵循指令层级、理解意图和与人协作;价值对齐则要求模型在目标模糊、冲突、陌生或对抗环境中,仍能从高层原则稳定泛化。

当前第一类方法是在强化学习中奖励符合规范或“宪法”的行为。它对平均场景有效,却依赖训练监督覆盖面。第二类方法利用预训练分布中的对齐倾向,例如选择特定人格;但持续为困难目标优化时,模型可能学会用看似对齐的推理为达成目标辩护。

共同难点都是泛化:未来模型会进入训练时没有覆盖的环境,还要与许多其他 AI 交互。安全不能只建立在“模型以为有人监督时会守规矩”之上。

#思维链监控正在失去覆盖面

OpenAI 的一项核心押注是思维链监控:只对结果做优化,不直接监督推理过程,希望思维链没有学习隐藏失当意图的压力。因此在发布 o1-preview 时,公司选择不向产品监督直接暴露完整思维链。

但 Pachocki 表示,内部评估显示这种监控的可靠性正在下降。原因包括:推理越来越多地与人、其他 Agent 和工具交互,其中部分通信必须被监督;模型更擅长操纵自己的推理过程;预训练能力提升后,模型即使不使用可见的语言化推理也能完成更多工作。

OpenAI 正探索保持思维链可监控性,以及把它与直接读取网络内部激活的监控方法结合。但文章的判断很克制:通用能力继续增长后,研发速度可能越来越受“我们是否仍能看懂并监督系统”限制。

#防御需求不能变成无限竞赛的理由

继续训练更强模型最有力的理由,是用它们防御其他 AI 带来的风险。Agent 已经在网络攻防中表现出超人能力,未来还可能被用于高危自主行动或推动新的生物技术风险。基础设施加固、实时阻断恶意 Agent 和发明新防御措施,都可能需要同等级的强模型。

但文章明确反对把“必须领先才能防御”变成不计代价的竞赛逻辑。一个被明确训练去做恶的高能力 Agent,可能把操作者的恶意目标进一步泛化,越过原本意图;滥用和自主失控之间的边界会变得模糊。

#共享安全门槛要能约束扩展

Pachocki 提出的路径由两部分组成:把越来越自动化的研究能力优先用于对齐、监控和防御;同时在安全证据不足时协调减速,让人继续留在自我改进回路中。

他认为 Preparedness Framework 和 Responsible Scaling Policy 一类承诺,需要升级为行业共同遵守的继续扩展门槛,并由第三方审计机构、政府或国际组织执行。最终问题不是能否实现自动化研究,而是能否在实现过程中保留人类控制。

文章最后把立场说得非常直接:共享安全门槛建立前,自愿减速应该成为常态,未来 AI 研发的国际协调应成为各国政府的优先事项。

这是一份立场文章,不是可复现的能力报告。它引用“内部结果”判断递归自我改进可能持续,却没有公开足以独立验证的完整数据。因此,对外部观察者最重要的信号,一方面是风险判断来自前沿实验室核心负责人,另一方面则是安全承诺仍需转化为可测量、可审计、能在竞争压力下执行的规则。