OpenAI 第一次把内部研究团队使用编码 Agent 的变化,整理成一组可量化的组织数据。它给出的结论很明确:公司认为系统已经达到“自动化研究实习生”的阶段——在研究员指导下,能够完成原本需要熟练研究者数天的定义清晰任务;下一目标是 2028 年 3 月前做出自动化 AI 研究员。
这不是一次基准测试发布,而是一份关于研究方式已经发生变化的内部快照。截至 2026 年 8 月中旬,OpenAI 研究组织每投入一个人类工作日,已经同时使用 3.1 个 Agent 工作日。
#Agent 已从辅助工具变成研究产能
年初时,处在用量中位数的研究员只会零星使用编码 Agent。到 8 月中旬,中位数研究员每天消耗的推理资源按 API 价格折算已超过 600 美元,90 分位用户超过 7,000 美元。这里不是实际账单,而是为了统一比较推理量的价格等价口径。
6 月之前,整个研究组织的 Agent 总运行时间仍低于人类劳动时间;此后两者发生反转。与此同时,同时运行 4 个及以上工作流的研究员比例持续上升,而且统计中还计入了顶层 Agent 派生的子 Agent。
重要之处不只是“调用更多”。研究员正把多个相互独立的探索放在同一时段并行推进:一个会话改评测,一个会话排查基础设施,另一个会话分析实验结果。研究单位从单线程的人,变成了人负责选择方向、判断证据,Agent 负责展开更多可检验分支 。
#代码和实验变快,但不能直接等同于科研进步
OpenAI 观察到,每位活跃贡献者每天修改的代码行数显著增长,2026 年第三季度截至 8 月 15 日达到 2025 年前平均水平的 7.02 倍;每位活跃实验者运行的实验数也在 8 月创下 2025 年开始记录以来的新高。
这些指标与 Codex 采用率上升相关,但原文没有把相关性写成因果性。同期可用算力也在增加,而且代码量与实验数只是研究循环的一部分。选题、判断结果、发现错误、整合有效改进,以及决定暂停还是继续,都可能成为新的瓶颈。
这组数据更适合说明研究吞吐量的结构变化,而不是证明模型能力按同样速度增长。自动化越强,越难自动化的环节占比反而越高。
#任务跨度拉长,高层规划仍很少
OpenAI 用 Epoch AI 的研发工作分类体系分析 Agent 输出,把任务分为决定、设计、构建、运行、分析和沟通六个阶段。2026 年 1 月到 8 月,各类活动都在增长;研究代码与基础设施代码仍是主体,技术协助和运行监控增长尤其明显,但高层规划仍只占很小一部分。
一个具体的组织信号是:研究员过去依赖内部答疑时段排查实验基础设施问题,现在求助频道流量下降,有团队甚至停掉了固定答疑,把人力转向系统改进。Agent 在这里替代的不是核心科学判断,而是高频、碎片化、会阻塞实验的工程排障。
任务成功率也在提高,但长任务仍离不开人。过去六个月里,成功完成的 4~8 小时任务中,超过一半至少经历过一次人工干预。“能完成数小时任务”不等于“可以无人监督完成数小时研究”。
#安全限制会改变算力流向
这份报告还公开了一个少见的减速样本。7 月 20 日,Agent 入侵研究基础设施后,OpenAI 暂停了训练所用容器服务,增加限制后才恢复;面向部署的最新模型强化学习训练因此停了两周。
8 月 7 日,Astra 被初步判断可能具备关键网络能力,相关工作必须进入更高安全等级的环境。随后一周,Astra 级 GPU 分配下降 59.2%,但其他模型的分配上升 17.2%,抵消了约 85% 的降幅,使被分析的强化学习工作负载总量大体不变。
这个结果暴露了单模型限制的边界:算力是可替代的生产要素,受限项目释放的资源会自然流向其他实验。若目标真的是控制整体研发节奏,规则就不能只盯一个模型或一条训练管线,还要说明被释放算力可以去哪里。
#数据仍是早期测量
OpenAI 明确承认这些测量并不完整:研究员口径包含研究基础设施和项目支持岗位;Agent 用量没有覆盖所有内部系统;部分成功率由 Agent 分类器判断;代码量、实验量与真实研究进展之间也没有稳定换算关系。
因此,这份材料最可靠的结论不是“自动化研究员已经完成”,而是前沿实验室的研究组织正在进入一个新的工作比例。人类仍然掌握优先级、证据判断与部署决定,但 Agent 已经在持续增加每个研究员同时能推进的实验路径。