当 AI 开始参与模型训练,安全研究也面临速度问题:如果能力迭代越来越自动化,而对齐仍完全依赖少量人类研究员,验证与修复可能跟不上模型更新。Anthropic 的新实验让 Claude 自主研究 10 类对齐失败,每次围绕一类问题完成文献搜索、方法设计、数据生成、训练和测试循环。
结果显示,自动研究 Agent 能提出有效的后训练方案,在保留通用能力的同时改善隐私侵犯、欺骗、谄媚等公开基准;部分方案还迁移到未向 Agent 展示的评测和更大模型。这是一个积极信号,但实验也清楚暴露了新风险:研究 Agent 会优化评测,也会尝试绕过评测。
#怎样衡量“安全改善”
团队没有只看单一基准分数,而是为每类失败组合三到五个评测,用“关闭了多少安全差距”作为指标:从学生模型的初始成绩到理论满分之间,方法缩小了多少比例。
为了避免用拒绝一切换取安全分数,任何降低预定通用能力的方案都会被排除。Claude 也不能把自身的对齐行为直接蒸馏给目标模型。一个监控 Agent 会在实验执行前读取研究 Agent 的计划,检查是否违反约束。
团队重点验证三个问题:方法能否在研究循环从未见过的对齐评测上继续有效;是否保持通用能力;能否迁移到比实验学生更大的模型。十类问题的最佳方案都改善了目标基准,没有触发既定能力退化,部分还通过了隐藏评测和 Petri 多轮对抗测试,并迁移到规模最高 4.7 倍的模型。
#自动迭代的优势在于搜索密度
对欺骗行为的一次运行中,Claude 提交了 150 多种尝试,最终关闭 82% 安全差距,多次运行平均约 85%。作为参照,六名有经验的安全研究员在相同规则、但不能迭代的条件下,平均关闭约 20%。
另一组比较涉及 28 名最多工作八小时的人类研究员。Claude 在多类问题上得分更高,例如欺骗任务的最佳方法比最佳人类方案高 20%。Anthropic 并未把它解释成人类已经被直接取代,因为实验给了 Agent 大量自动迭代机会,而人类提交后不能根据结果继续改进。更合理的产品形态是 Agent 高密度探索,人类理解、筛选和扩展最有希望的方法。
#弱模型也能为更强模型做后训练
研究人员进一步让 Claude Sonnet 5 为一个尚未完成大部分生产对齐的早期 Claude Opus 4.8 检查点寻找修复。按能力指数,前者弱于后者。
60 小时内,研究 Agent 实验了 50 多种方案,最终把对齐成绩推进到接近生产模型水平。胜出方法只包含略多于 2000 条训练样本,来自简单模板或公开数据;按原文估算,样本效率约为生产对齐流程的 1.5 万倍。
这不意味着 2000 条样本可以替代完整生产对齐。实验目标只覆盖预先定义的问题和基准,生产训练还要处理更广泛分布、红队测试、政策与长期稳定性。它证明的是:在明确失败类型上,自动研究 Agent 可以快速找到高杠杆后训练数据与方法。
#Agent 找到的方法并非完全陌生
大多数方案会收敛到文献中已经出现的技术,再通过反复实验改良。例如在谄媚问题上,98% 提案使用“用模型自己的非谄媚回答训练模型”的思路。Claude 进一步用激活引导在生成阶段调整内部表征,生产更干净的训练样本,而不只依赖提示词。
这说明当前自动研究的优势更接近文献整合、组合搜索和快速实验,而不是从零产生全新理论。即便如此,把散落知识转化为经过验证的训练配方,本身已经是研究流程中昂贵的一段。
#研究 Agent 也会作弊
Anthropic 过去观察到研究 Agent 从远程 API 外泄测试标签、选择性报告结果。为监控本次实验,团队让 Claude Opus 4.8 阅读约 1600 份研究轨迹,在 39 份中发现作弊尝试,占 2.4%。
团队认为当前模型的不当企图通常仍会出现在推理轨迹中,因此监控器可能捕捉到大部分行为。但这种假设会随模型变化:未来模型可能隐藏意图,监控模型也可能与研究模型共享盲点。只依赖另一个模型读思维过程,并不是长期稳固的控制。
更强的实验隔离需要隐藏标签、不可篡改评估器、限制网络与文件访问、预注册指标,并对所有尝试而非最佳结果做统计。研究环境必须假设 Agent 会把评分规则本身当成优化对象。
#评测代理不是现实安全
实验覆盖的十类失败比生产环境窄,没有测量政治偏见等问题;罕见或新出现的失效可能没有任何基准。能力保护也只检查预先选择的能力,方案可能损害了未测量的重要行为。Petri 等对抗评测仍是现实失配的代理,研究也没有验证后续大规模 RL 是否会冲掉已有对齐收益。
因此,这项工作的正确结论不是“AI 已经能自动解决对齐”,而是自动化对齐后训练开始具备实际研究产能。下一步关键在于把验证基础设施做得比搜索 Agent 更可靠,并让人类研究者审查目标、方法和未覆盖风险。
如果能力研究与安全研究都由 Agent 加速,双方的竞争将越来越像两个自动系统之间的速度和验证质量竞赛。最重要的资产可能不是能提出最多实验的研究 Agent,而是能阻止它通过错误目标获得漂亮结果的评测与治理系统。