SOTA Sync
全部文章
Agent 设计2026-04-17

长程 Agent 工作流的变化:先抓 Web,再锚定本地文件

Han Xiao 认为长程 agent 任务正在从持续 Web 查询转向两阶段模式:先用 Web IO 做研究规划,再把知识沉淀成本地文件供 agent 循环使用。

Han Xiao 观察到一个很实用的工作流变化:2026 年的长程 agent 任务,不再像 2025 年的 deep research 那样每一轮都去 Web 上搜索、阅读、推理。

新的模式更像两阶段系统。

#第一阶段:Web IO 只负责研究和规划

第一阶段仍然需要 Web。agent 或人类操作者会搜索、阅读、推理,拿到足够多的外部信息。

但这一阶段的目标不是直接生成最终答案,而是把 Web 知识物化成本地文件。原文提到的形式包括 .md.json.csv。这些文件会成为后续任务的稳定输入。

这一步很关键。Web 是动态的,页面会更新,链接会失效,内容会被改写,甚至不同时间抓到的结果都不一样。如果长程任务每一轮都重新抓 Web,agent 实际上是在不断改变自己的依据。

#第二阶段:Agent 挂载文件再循环

第二阶段开始后,agent 只读取、运行、写入本地文件。它不再通过实时 Web 调用来做 grounding。

这听起来像限制能力,但对长程任务反而是增强。因为 agent 的每次判断都基于同一批材料,输出也能回写到同一个工作目录里。任务状态、证据、结论和中间表格都可以被复查。

#为什么切掉第二阶段的 Web grounding

原文给了四个理由。

第一是确定性。本地文件是不变快照,Web 内容会漂移、404、进入付费墙。

第二是速度。文件系统读取是毫秒级,Web 抓取通常是秒级。agent 循环越密集,这个差距越明显。

第三是一致性。交叉检查需要同一个知识库,而不是每次拿到不同版本的网页。

第四是成本。Web IO 会消耗大量 token 解析 HTML 噪声,而本地文件已经被清洗成更适合模型读取的材料。

#这对 agent 产品意味着什么

真正可靠的长程 agent,不应该把 Web 搜索当成每一步的默认动作。更好的做法是先做一次材料收集和整理,再进入本地化执行循环。

这也是为什么内容仓库、任务目录、结构化日志、CSV 和 Markdown 会重新变得重要。它们不是旧工具,而是 agent 长程推理的工作台。

#实施上的关键点

这个模式不能只理解成“先下载网页”。真正重要的是文件要变成 agent 能稳定消费的工作材料。

比如研究阶段可以把来源、摘要、关键事实、待验证问题和结构化数据分开存。Markdown 适合记录论点和证据,JSON 适合保留对象结构,CSV 适合后续排序、筛选和交叉检查。

进入执行阶段后,agent 应该明确哪些文件是只读证据,哪些文件是可以更新的工作产物。这样才能避免它一边引用材料,一边把原始证据改坏。

这类边界看起来很工程化,但它正是长程任务能不能持续跑下去的差别。没有文件边界,agent 只是不断重读互联网;有了文件边界,它才开始像在一个真正的工作区里推进任务。