ChatGPT Work 很容易被理解成“更能干的聊天模式”,Simon Willison 的拆解却指向另一个定位:它是一套通用 Agent Runtime。模型只是其中一层,真正决定能力边界的是联网执行环境、浏览器、持久文件系统、子 Agent、自动化和发布工具如何组合。
Work 分成云端与本地两条路径。云端环境可以在网页、移动端和桌面端使用;本地环境则直接在用户机器上工作,更适合需要现有代码仓、工具链或本地文件的任务。两者共享 Agent 的交互方式,但信任边界完全不同。
#一台能联网、能装软件的临时电脑
云端 Work 不只是调用几个预设 API。它能运行代码、安装软件包、克隆 Git 仓库、请求外部服务,并使用无头 Chrome 打开网页、执行 JavaScript、填写表单和截取页面。遇到登录或敏感凭据时,还可以把浏览器控制权交给用户,再在认证完成后继续任务。
每个会话还有持久文件目录,可保存抓取结果、代码、文档和中间产物,并在后续会话中再次读取。这个设计让 Agent 能承接长任务,却也意味着“上传一个文件”不再是一次性的上下文输入,而是在运行环境里留下了可继续访问的数据。
ChatGPT Sites 进一步把生成结果变成可发布的网站。Simon 用鹈鹕观测数据做了一个交互页面:Agent 收集资料、生成代码、运行并检查页面,最后把成品发布出去。这里的输出不是一段回答,而是一个具备 URL 和交互行为的软件制品。
#Skills 是运行时的能力目录
Work 还能派出子 Agent 并行处理子任务,也能按计划自动执行提示词。Simon 检查当时的系统后,看到 223 个已注册工具和 44 份 Skill 定义。这个数量本身会继续变化,更重要的是加载方式:模型先看到紧凑的能力说明,只有在任务命中某项 Skill 时,才继续读取详细文档。
这种渐进式披露避免把全部工具手册一次塞进上下文,也让能力可以模块化增加。它与传统插件最大的区别在于,Skill 不只是把一个外部动作暴露给模型,还能规定完成某类工作所需的步骤、检查项和边界条件。
因此,判断一个 Agent 产品时,不能只比较底层模型。还要看它能访问什么数据、能调用哪些工具、运行环境是否持久、是否允许出网、子任务如何隔离,以及最终产物如何被用户检查和接管。
#能力越完整,安全问题越接近操作系统
这套 Runtime 同时具备“私有数据、外部不可信内容、向外发送信息”三个条件。Simon 把它们称为提示注入的致命三要素:如果 Agent 从网页读到恶意指令,又能访问会话文件并自由联网,攻击者就可能诱导它泄露信息。
浏览器接管可以避免模型直接看到密码,但不能单独解决后续页面注入、文件权限和数据外传。持久目录也需要清晰说明保存期限、跨会话可见性与清理方式;自动化任务则要提供运行记录、权限快照和可撤销机制。
把 Work 看成 Runtime,而不是聊天模式,会让产品评价标准更准确。模型质量依然重要,但真正决定它能否承担严肃工作的,是执行隔离、权限设计、来源追踪、审计记录和人类接管这些“系统层”能力。

