SOTA Sync
全部文章
Agent 设计2026-09-11

Agents API:云端底座

Agents API 把 Codex 的上下文管理、工具调用和多 Agent 协调能力托管化,开发者只需选择任务、模型、工具与运行环境。

长时间运行的 Agent,难点从来不只是选一个更强的模型。它要管理上下文、寻找和调用工具、协调子 Agent,还要在几小时甚至几天里稳定处理文件、运行代码、保存中间结果并从异常中恢复。

OpenAI 推出的 Agents API 公测版,试图把这些基础能力直接托管化:开发者通过一次 API 调用指定任务、模型、工具和环境,背后使用与 Codex 相同的 Harness 和基础设施。

#一次调用,四个关键选择

Agents API 把一个云端 Agent 的创建拆成四个核心配置:它要完成什么任务、使用哪个模型、可以调用哪些工具、在哪个环境里执行。

OpenAI 负责维护 Harness,开发者则可以把注意力集中到真正独特的部分:领域工具、知识、数据上下文和业务工作流。这样做的意义不在于少写几行初始化代码,而在于把长任务运行中最容易被低估的一整层工程复杂度交给统一基础设施。

Agents API 的应用、Codex Harness 与沙箱架构Agents API 的应用、Codex Harness 与沙箱架构

上图所表达的边界很清楚:应用发送任务并接收事件和结果,托管的 Codex Harness 负责协调模型与工具,工具调用则进入开发者选择的沙箱。应用可以使用自建计算资源,也可以把执行交给托管环境。

#Harness 和沙箱可以分开选

不同工作负载需要不同的 CPU、GPU、内存、冷启动速度、文件存储和密钥管理方式。因此 API 不把运行环境锁死在单一方案上,而是支持三种方向:OpenAI 管理的沙箱、自有基础设施,或生态伙伴提供的沙箱。

合作伙伴包括 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop 和 Vercel。它们覆盖全托管环境、VPC 内部署、特定的文件与密钥存储,以及不同的性能和成本组合。

Agents API 的沙箱合作伙伴Agents API 的沙箱合作伙伴

如果追求快速开始,OpenAI 托管沙箱会提供与 Codex 和 ChatGPT 相同的沙箱基础设施。开发者可以配置文件、软件包、Skills 和 Plugins,让 Agent 在一个安全且可产出文件与其他工件的环境里工作。

#把“长任务能力”做成默认配置

Agents API 的核心卖点,是 Harness 会和模型一起持续演进。开发者不必在每次模型升级时重写自己的上下文管理、工具选择和并发编排逻辑。

#自动压缩,让会话跨过上下文边界

当会话接近上下文上限时,API 会自动压缩早期上下文,保留 Agent 继续工作所需的信息。这样,跨越多个上下文窗口的工作流不再要求每个团队自己实现压缩与恢复策略。

这解决的是长任务的“记忆连续性”,不是无限记忆。哪些信息必须保留、如何避免总结丢失关键证据,仍然决定任务能否在更长时间里稳定运行。

#按需加载工具,减少上下文浪费

Tool search 会在需要时加载相关工具定义,而不是一开始把所有工具说明都塞进上下文,目标是降低 Token 使用量和成本,同时尽量保留缓存效果。

工具加载后,programmatic tool calling 允许 Agent 通过代码并行执行调用、串联相关操作、筛选和合并大量结果,只把真正相关的部分带回上下文。MCP、自定义函数和内置 Web search 都在支持范围内。

#用 Subagent 并行拆解复杂任务

多 Agent 支持让主 Agent 可以把复杂任务拆成相互独立的部分,交给各自拥有上下文的 Subagent 并行处理,再由主 Agent 汇总结果。研究、分析和编码类任务因此可以获得更高吞吐,而不必每个团队都重新搭建编排系统。

#公开 Harness,也托管 Harness

Agents API 建立在开源 Codex Harness 之上。开发者可以查看协调模型调用、工具和上下文的核心代码,理解系统为什么这样运行;与此同时,OpenAI 负责在模型发布时维护和升级这套 Harness,并通过版本化能力把改进带给 API 用户。

这是一种明显的分工:底层编排逻辑保持可见,上层运行服务由平台托管。它能缩短从原型到生产的距离,也会让开发者更依赖平台的版本节奏、工具协议和环境接口。

#客户案例说明了什么

公告中的客户反馈覆盖评测、客服审查、突发工作负载和物流等场景。Ciridae 表示评估得分从 0.71 提升到 0.85,子 Agent 支持让延迟降低四倍;SafetyKit 称迁移后单个案件成本和延迟下降;Dwelly 用异步方式把工作扇出到数百个 Agent;Hypha 则表示把 Harness 与沙箱分开后,失败响应减少了 86%。

这些数字是客户在产品公告中的自述,不等同于统一条件下的公开基准。但它们揭示了 API 想解决的共同问题:企业部署 Agent 时,最昂贵的部分往往不是第一次让模型回答,而是让它在真实工具、真实数据和长时间运行中可靠地完成工作。

Agents API 目前面向所有开发者开放公测。使用它没有额外平台费用,开发者仍按 Agent 实际消耗的 Token 和工具计费。接下来最值得观察的,不是“一次调用能否创建 Agent”,而是托管 Harness 在不同环境、不同权限和不同长任务上的可控性。