SOTA Sync
全部文章
工具与行动2026-08-29

Claude 把 Agent 生产栈补齐了:Computer Use、Skills API 与 Files API 正式可用

Anthropic 将 Computer Use、Browser Use、Skills API 和 Files API 推向正式可用,把软件操作、组织知识与文件状态连接成一条生产级 Agent 工作流。

Anthropic 把三项长期处于测试阶段的能力推向正式可用:Computer Use、Skills API 和 Files API。与此同时,Computer Use 新增了 Browser Use 工具,让 Agent 不只依赖截图坐标,还能结合网页结构定位具体元素。

表面看,这是一次产品功能集中转正。更重要的变化在于,Claude Platform 开始提供一条完整的生产级 Agent 链路:Agent 可以读取文件、加载组织知识、操作没有 API 的软件,再把结果保存为可交付文件。

过去开发者需要自己拼接浏览器自动化、对象存储、提示词模板、代码沙箱和任务状态。现在 Anthropic 正在把这些常见基础设施收进统一平台。

#三个 API 分别解决三种生产问题

一个能在演示中完成任务的 Agent,距离生产环境还有很长距离。它至少需要回答三个问题:在哪里行动、依据什么规则行动,以及输入输出放在哪里。

这次正式可用的三组能力恰好对应这三个问题。

#Computer Use:让 Agent 进入没有 API 的系统

Computer Use 让 Claude 根据屏幕内容点击、输入和滚动,像用户一样操作桌面软件。它的价值不只在“会点鼠标”,而在于打开了大量传统自动化无法覆盖的界面。

企业里仍然存在大量老旧系统、内部后台、保险门户和专用桌面软件。它们可能没有公开 API,也没有稳定的集成方式,但员工每天都在界面里重复操作。Computer Use 给这些系统增加了一层通用执行接口。

正式版的一项重要改进是多动作回合。旧方式通常每次模型调用只执行一个动作,观察结果后再发起下一次调用;新版允许 Claude 在一个回合中连续执行多个动作。这会减少模型往返次数,也缩短长流程的执行时间。

Anthropic 还宣布 Computer Use 可在其商业伙伴协议覆盖下用于受 HIPAA 监管的工作负载。这不是对所有医疗场景的自动授权,实际使用仍取决于组织与 Anthropic 的合同、合规配置和具体数据流程,但它释放了一个明确方向:界面 Agent 正在进入高合规行业。

#Browser Use:从坐标点击升级为结构化网页操作

新的 Browser Use 工具属于 Computer Use 体系,但专门面向 Web 应用。它同时利用截图和页面结构,不再只根据像素猜测按钮位置,而是能够针对具体字段或控件采取行动。

这解决了纯视觉浏览器自动化的一个根本弱点:页面轻微改版、窗口尺寸变化或提示条出现,都可能让固定坐标失效。加入页面结构后,Agent 可以用元素语义定位目标;视觉信息则继续负责理解布局、图表和缺少良好标记的界面。

因此,它不是简单用 DOM 自动化替换 Computer Use,而是把视觉理解与结构化定位组合起来。前者覆盖人能看见的内容,后者提高常规表单与按钮操作的稳定性。

#Skills API:把组织方法变成可版本化资产

Skills API 解决的不是执行,而是知识和流程如何被复用。

一个 Skill 是包含指令、脚本和模板的文件夹。Claude 只在任务需要时加载相关内容,开发者可以通过 API 上传、管理版本,并把指定 Skill 附加到请求中。Skill 在 Claude 的代码执行沙箱中运行,团队不必单独托管执行环境。

这和把所有操作规范塞进系统提示词有本质区别:

  • Skill 可以独立升级和回滚;
  • 不同任务只加载需要的知识,减少无关上下文;
  • 脚本、模板与文字规则可以放在同一个可部署单元里;
  • 多个 Agent 可以复用同一套组织标准。

当信用分析方法、理赔流程或文档格式发生变化时,团队更新的是一项版本化能力,而不是逐一寻找散落在应用代码里的提示词。

#Files API:让文件成为 Agent 的持久输入输出

Files API 提供 Agent 读写文档所需的存储层。开发者可以上传一次 PDF 或电子表格,在后续请求中通过文件 ID 反复引用,也可以下载 Agent 生成的结果,不必每次重新传输完整文件。

正式版增加了自动过期机制,将速率限制提高到此前的 5 倍,并为每个组织提供 1 TB 存储空间。

文件在这里不只是附件,而是任务状态的一部分。它可能是输入材料、中间结果、生成文档,也可能是操作完成后的确认凭证。稳定的文件生命周期让跨步骤和跨请求工作流更容易审计与恢复。

#四种能力组合后,才是完整 Agent

Anthropic 用保险理赔 Agent 展示了这套组合方式:

  1. Agent 从 Files API 读取理赔材料;
  2. 加载包含团队申报流程的 Skill;
  3. 通过 Browser Use 在保险公司的网页门户完成提交;
  4. 把确认结果重新保存为文件。

代码执行和 Web Search 也可以加入同一循环。前者负责转换文件、运行校验或生成结构化结果,后者负责补充外部信息。

这条链路值得关注,因为它不再围绕一次问答设计。输入、规则、执行与输出都有明确归属,Agent 因此具备了成为业务流程节点的基本条件。

#性能提升来自运行方式,而不只是模型

官方文章引用了一项保险与医疗系统中的客户测试:最长的理赔流程从 32 分钟降到 13 分钟,单任务成本在测试工作流中下降约 30%,完成率达到 100%,且没有修改原有提示词。

这是一家客户在特定工作流中的结果,不能直接外推成所有 Computer Use 任务的通用基准。但它说明了一个重要机制:当执行器可以在每个模型回合完成多个动作时,即使模型和提示词不变,端到端性能也可能显著改善。

Agent 的速度与成本不仅取决于推理单价,还取决于完成一项任务需要多少轮观察、规划和执行。减少无意义的模型往返,是基础设施层可以提供的直接收益。

#Skills 把行业经验与通用 Agent 分离

另一个案例来自 Box Agent。银行可以把内部信用方法和批准的备忘录格式封装成 Skill,再让 Agent 对 Box 中已有的财务报表和交易文件应用这些规则,生成带有来源依据的信用备忘录,供分析师审阅。

这里最关键的架构变化是“能力与数据分离”:

  • 文件仍留在既有内容系统中;
  • Skill 描述组织如何处理这些文件;
  • 通用模型负责理解、执行和生成;
  • 人类保留最终审阅权。

团队不必为每一种行业工作流重新训练模型,也不必为每个应用复制一套提示词。真正的差异化资产变成了可维护、可版本化的 Skill。

#正式可用不等于生产风险自动消失

GA 代表 API 稳定性、支持和可用范围进入新阶段,却不意味着 Agent 可以不受约束地操作关键系统。部署这类工作流仍需要补上几层控制:

  • 对高风险动作设置确认或审批节点;
  • 限制 Agent 可以访问的网站、文件和账号权限;
  • 保存关键步骤、工具调用与产物的审计记录;
  • 为界面变化、超时和部分失败设计恢复路径;
  • 用真实任务集持续评估完成率,而不是只测演示样例。

Computer Use 扩大了 Agent 的行动边界,Files API 扩大了它接触的数据范围,Skills API 则让组织流程可以被自动执行。能力越完整,权限设计和可观测性就越重要。

#平台竞争正在从模型转向完整运行栈

这次发布最值得记住的不是某个 API 名称,而是 Anthropic 对生产 Agent 的判断:模型需要一个完整运行栈。

这个栈至少包括六层:推理模型、工具执行、界面操作、组织知识、文件状态,以及安全与审计。任何一层缺失,都可能让 Agent 停留在一次性演示阶段。

目前 Computer Use、Browser Use、Skills API 和 Files API 已在 Claude Platform 提供。Skills API 与 Files API 也可通过 Microsoft Foundry 使用;新版 Computer Use 与 Browser Use 则计划进入 Google Cloud Vertex AI,现有测试版集成在迁移期间仍可继续工作。

当操作、知识和状态被统一之后,开发者真正需要设计的就不再是“怎样让模型点一下按钮”,而是“怎样让一项业务工作可靠地从输入走到可审计的结果”。这才是生产 Agent 的边界。