Anthropic 把三项长期处于测试阶段的能力推向正式可用:Computer Use、Skills API 和 Files API。与此同时,Computer Use 新增了 Browser Use 工具,让 Agent 不只依赖截图坐标,还能结合网页结构定位具体元素。
表面看,这是一次产品功能集中转正。更重要的变化在于,Claude Platform 开始提供一条完整的生产级 Agent 链路:Agent 可以读取文件、加载组织知识、操作没有 API 的软件,再把结果保存为可交付文件。
过去开发者需要自己拼接浏览器自动化、对象存储、提示词模板、代码沙箱和任务状态。现在 Anthropic 正在把这些常见基础设施收进统一平台。
#三个 API 分别解决三种生产问题
一个能在演示中完成任务的 Agent,距离生产环境还有很长距离。它至少需要回答三个问题:在哪里行动、依据什么规则行动,以及输入输出放在哪里。
这次正式可用的三组能力恰好对应这三个问题。
#Computer Use:让 Agent 进入没有 API 的系统
Computer Use 让 Claude 根据屏幕内容点击、输入和滚动,像用户一样操作桌面软件。它的价值不只在“会点鼠标”,而在于打开了大量传统自动化无法覆盖的界面。
企业里仍然存在大量老旧系统、内部后台、保险门户和专用桌面软件。它们可能没有公开 API,也没有稳定的集成方式,但员工每天都在界面里重复操作。Computer Use 给这些系统增加了一层通用执行接口。
正式版的一项重要改进是多动作回合。旧方式通常每次模型调用只执行一个动作,观察结果后再发起下一次调用;新版允许 Claude 在一个回合中连续执行多个动作。这会减少模型往返次数,也缩短长流程的执行时间。
Anthropic 还宣布 Computer Use 可在其商业伙伴协议覆盖下用于受 HIPAA 监管的工作负载。这不是对所有医疗场景的自动授权,实际使用仍取决于组织与 Anthropic 的合同、合规配置和具体数据流程,但它释放了一个明确方向:界面 Agent 正在进入高合规行业。
#Browser Use:从坐标点击升级为结构化网页操作
新的 Browser Use 工具属于 Computer Use 体系,但专门面向 Web 应用。它同时利用截图和页面结构,不再只根据像素猜测按钮位置,而是能够针对具体字段或控件采取行动。
这解决了纯视觉浏览器自动化的一个根本弱点:页面轻微改版、窗口尺寸变化或提示条出现,都可能让固定坐标失效。加入页面结构后,Agent 可以用元素语义定位目标;视觉信息则继续负责理解布局、图表和缺少良好标记的界面。
因此,它不是简单用 DOM 自动化替换 Computer Use,而是把视觉理解与结构化定位组合起来。前者覆盖人能看见的内容,后者提高常规表单与按钮操作的稳定性。
#Skills API:把组织方法变成可版本化资产
Skills API 解决的不是执行,而是知识和流程如何被复用。
一个 Skill 是包含指令、脚本和模板的文件夹。Claude 只在任务需要时加载相关内容,开发者可以通过 API 上传、管理版本,并把指定 Skill 附加到请求中。Skill 在 Claude 的代码执行沙箱中运行,团队不必单独托管执行环境。
这和把所有操作规范塞进系统提示词有本质区别:
- Skill 可以独立升级和回滚;
- 不同任务只加载需要的知识,减少无关上下文;
- 脚本、模板与文字规则可以放在同一个可部署单元里;
- 多个 Agent 可以复用同一套组织标准。
当信用分析方法、理赔流程或文档格式发生变化时,团队更新的是一项版本化能力,而不是逐一寻找散落在应用代码里的提示词。
#Files API:让文件成为 Agent 的持久输入输出
Files API 提供 Agent 读写文档所需的存储层。开发者可以上传一次 PDF 或电子表格,在后续请求中通过文件 ID 反复引用,也可以下载 Agent 生成的结果,不必每次重新传输完整文件。
正式版增加了自动过期机制,将速率限制提高到此前的 5 倍,并为每个组织提供 1 TB 存储空间。
文件在这里不只是附件,而是任务状态的一部分。它可能是输入材料、中间结果、生成文档,也可能是操作完成后的确认凭证。稳定的文件生命周期让跨步骤和跨请求工作流更容易审计与恢复。
#四种能力组合后,才是完整 Agent
Anthropic 用保险理赔 Agent 展示了这套组合方式:
- Agent 从 Files API 读取理赔材料;
- 加载包含团队申报流程的 Skill;
- 通过 Browser Use 在保险公司的网页门户完成提交;
- 把确认结果重新保存为文件。
代码执行和 Web Search 也可以加入同一循环。前者负责转换文件、运行校验或生成结构化结果,后者负责补充外部信息。
这条链路值得关注,因为它不再围绕一次问答设计。输入、规则、执行与输出都有明确归属,Agent 因此具备了成为业务流程节点的基本条件。
#性能提升来自运行方式,而不只是模型
官方文章引用了一项保险与医疗系统中的客户测试:最长的理赔流程从 32 分钟降到 13 分钟,单任务成本在测试工作流中下降约 30%,完成率达到 100%,且没有修改原有提示词。
这是一家客户在特定工作流中的结果,不能直接外推成所有 Computer Use 任务的通用基准。但它说明了一个重要机制:当执行器可以在每个模型回合完成多个动作时,即使模型和提示词不变,端到端性能也可能显著改善。
Agent 的速度与成本不仅取决于推理单价,还取决于完成一项任务需要多少轮观察、规划和执行。减少无意义的模型往返,是基础设施层可以提供的直接收益。
#Skills 把行业经验与通用 Agent 分离
另一个案例来自 Box Agent。银行可以把内部信用方法和批准的备忘录格式封装成 Skill,再让 Agent 对 Box 中已有的财务报表和交易文件应用这些规则,生成带有来源依据的信用备忘录,供分析师审阅。
这里最关键的架构变化是“能力与数据分离”:
- 文件仍留在既有内容系统中;
- Skill 描述组织如何处理这些文件;
- 通用模型负责理解、执行和生成;
- 人类保留最终审阅权。
团队不必为每一种行业工作流重新训练模型,也不必为每个应用复制一套提示词。真正的差异化资产变成了可维护、可版本化的 Skill。
#正式可用不等于生产风险自动消失
GA 代表 API 稳定性、支持和可用范围进入新阶段,却不意味着 Agent 可以不受约束地操作关键系统。部署这类工作流仍需要补上几层控制:
- 对高风险动作设置确认或审批节点;
- 限制 Agent 可以访问的网站、文件和账号权限;
- 保存关键步骤、工具调用与产物的审计记录;
- 为界面变化、超时和部分失败设计恢复路径;
- 用真实任务集持续评估完成率,而不是只测演示样例。
Computer Use 扩大了 Agent 的行动边界,Files API 扩大了它接触的数据范围,Skills API 则让组织流程可以被自动执行。能力越完整,权限设计和可观测性就越重要。
#平台竞争正在从模型转向完整运行栈
这次发布最值得记住的不是某个 API 名称,而是 Anthropic 对生产 Agent 的判断:模型需要一个完整运行栈。
这个栈至少包括六层:推理模型、工具执行、界面操作、组织知识、文件状态,以及安全与审计。任何一层缺失,都可能让 Agent 停留在一次性演示阶段。
目前 Computer Use、Browser Use、Skills API 和 Files API 已在 Claude Platform 提供。Skills API 与 Files API 也可通过 Microsoft Foundry 使用;新版 Computer Use 与 Browser Use 则计划进入 Google Cloud Vertex AI,现有测试版集成在迁移期间仍可继续工作。
当操作、知识和状态被统一之后,开发者真正需要设计的就不再是“怎样让模型点一下按钮”,而是“怎样让一项业务工作可靠地从输入走到可审计的结果”。这才是生产 Agent 的边界。