SOTA Sync
全部文章
记忆与上下文2026-08-31

Agent 记忆不是越多越好:八个模型揭示三种最佳剂量

IBM Research 在八个模型上的实验表明,Agent 记忆需要按模型能力校准:强模型适合完整经验,较弱模型需要选择性检索,接近上限的模型则可能完全无收益。

给 Agent 增加记忆,最直觉的做法是把过去的成功经验和失败教训全部保存下来,再在下一次任务中重新放回上下文。经验越多,表现似乎就应该越好。

IBM Research 对八个不同能力层级的模型进行实验后发现,事实并非如此。记忆不是一个打开便会生效的功能,而是一种必须根据模型能力校准的“剂量”:有些模型需要完整经验,有些模型会被过量记忆拖累,还有些模型增加记忆后几乎没有变化。

这个结论把 Agent 记忆从“是否拥有长期记忆”的产品功能,推进成了一个更具体的工程问题:应该让哪个模型在什么任务中看到多少经验,又该为这些经验支付多少上下文成本?

#这里的记忆不是历史对话

实验使用的 ALTK-Evolve,并不把过去的完整轨迹原样塞回上下文。它从 Agent 的成功和失败轨迹中提炼出可复用的行为准则,例如有效策略、常见错误和容易忽略的边界条件,再把这些准则提供给之后的任务。

整个过程分为四步:

  1. Agent 执行任务并产生完整轨迹。
  2. 系统同时从成功与失败轨迹中提取行为准则。
  3. 重复、冲突或低价值的准则被合并成可复用的经验集合。
  4. 推理时,系统注入全部经验,或只检索与当前任务相关的一部分。

模型权重没有更新,也不需要人工标注。学习发生在模型周围:变化的是 Agent 每次行动前可以获得的指导,而不是基础模型本身。

因此,这项研究讨论的不是传统意义上的对话记忆,而是 Agent 能否把过去的执行轨迹编译成未来可用的操作经验。

#三种记忆配置如何比较

研究团队在 AppWorld 上评估了八个模型。该基准包含 9 个模拟应用和 585 个多步骤任务,覆盖日历、消息、支付等需要连续操作的场景。

实验比较三种配置:

  • 无记忆基线: 使用模型原本的 Agent 能力,不提供历史经验。
  • 完整经验集: 在每个 ReAct 步骤中注入模型自己提炼出的全部准则。
  • 选择性检索: 固定提供一组高置信度核心准则,再按当前任务检索少量相关经验。

两种记忆配置使用的是同一份经验集合,区别仅在于如何投放。经验只从训练集轨迹中产生,测试集信息不会进入记忆构建过程。

评估同时使用两项指标。TGC(Task Goal Completion)衡量单个任务是否完整完成;SGC(Scenario Goal Completion)更加严格,只有同一场景下的所有任务变体全部成功,整个场景才算通过。后者更接近生产环境关心的稳定性,而不只是平均成功率。

#第一种模式:强模型能够消化完整经验

对于能力较强、但仍有明显提升空间的模型,完整经验集效果最好。

DeepSeek-V3.2 的 TGC 从 79.8% 提升到 89.3%,增加 9.5 个百分点;更严格的 SGC 则从 64.3% 提升到 80.4%,增加 16.1 个百分点。Claude Opus 4.6 和 GPT-5.5 已经接近任务上限,但 SGC 仍分别提高 7.1 和 7.2 个百分点。

这类模型不仅能利用常见策略,也有能力识别罕见边界条件何时适用。删掉看起来不常用的准则,反而可能让它在少数困难任务上失去关键提示。

但完整经验并不免费。DeepSeek-V3.2 每个任务的平均 token 消耗从 148K 增加到 263K,增幅达到 78%。性能提升与上下文成本需要同时计算。

#第二种模式:较弱模型会被过量记忆淹没

较弱模型呈现了相反结果。它们并非不能从经验中受益,而是难以从庞大的准则集合中判断哪一条与当前任务真正相关。

gpt-oss-120b 使用“核心准则加任务检索”后,TGC 从 39.9% 提升到 56.0%,SGC 从 21.4% 提升到 37.5%,两项指标都增加了 16.1 个百分点。与此同时,每个任务的 token 消耗只从 110K 增加到 116K,开销约为 5%。

如果把全部经验注入同一个模型,token 消耗会上升约 51%,但准确率反而不如选择性检索。

这里出现了一个重要结果:更少的记忆可以同时带来更高准确率和更低成本。问题不在于经验是否存在,而在于系统能否把模型当下真正能用的部分交给它。

#第三种模式:接近饱和的模型可能没有收益

GLM-5 在实验中属于“饱和模式”。加入完整经验集后,它的 TGC 与 SGC 都没有可测量的变化。

研究团队没有把这种现象简单归因于模型规模。可能的解释包括:模型在这组任务上已经接近能力上限;提炼出的准则没有覆盖剩余错误;或者模型虽然看到了经验,却没有稳定地把它应用到行动中。

这一区分很重要。没有收益并不等于模型不需要任何形式的记忆,更不能证明某种架构普遍无效。它只说明,在当前任务分布和经验质量下,继续增加上下文没有产生边际回报。

决定模型属于哪一种模式的因素,可能同时包括任务余量、上下文窗口、模型架构、经验质量和任务分布,而不是参数量这一项。

#记忆的真正成本是输入膨胀

完整经验集会在每一个 ReAct 步骤中重复出现,因此主要成本不是 Agent 走了更多步骤,而是每一步都携带了更长的输入。

实验中,DeepSeek-V3.2 使用记忆前后平均都需要约 18 至 19 个步骤。推理循环并没有明显变长,增加的是每一步读取的上下文。

这也解释了为什么 Prompt Caching 对记忆系统格外重要。只要把稳定的经验集合放在固定前缀中,多轮执行就可以复用缓存,显著降低重复输入成本。相反,如果系统每一步都重新排序、改写或拼接经验,即使内容大致相同,也可能破坏缓存命中。

对于选择性检索,设计重点则不同:核心经验应保持稳定、便于缓存;任务相关经验保持小而精确,避免用大量相似内容挤占推理空间。

#生产系统需要先判断模型属于哪一种模式

这项实验给出了一个比“接入记忆数据库”更可操作的流程。

首先建立没有记忆的真实任务基线,而不是默认记忆一定有效。随后分别测试完整经验集和选择性检索,同时记录任务成功率、严格场景成功率、token 消耗和执行时长。

如果完整经验表现最好,说明模型仍有能力吸收长尾经验,下一步应优化缓存和经验去重。如果选择性检索更好,系统的核心资产会变成经验准入与检索器。如果两种方案都没有改善,就不应继续为记忆支付上下文成本,而应先定位剩余失败模式。

换句话说,记忆配置应当成为可评测、可路由的运行时策略,而不是写死在 Agent 架构里的常量。同一套经验库,面对不同模型甚至不同任务类型,可能需要完全不同的投放方式。

#研究仍有明确边界

这些结果来自 AppWorld。它是严格的多步骤工具调用基准,但仍然只是一个模拟环境,不能直接代表长期个人助理、软件工程或企业流程中的全部记忆需求。

当前选择器主要依赖余弦相似度,它只能判断文本是否相近,不能直接判断某条经验是否真的会改善任务结果。研究团队下一步希望利用执行结果训练选择器,让检索目标从“相关”转向“有用”。

此外,极弱模型可能无法从自己的轨迹中提炼出足够高质量的准则,需要由更强模型提供教师经验;上下文窗口与基础能力的影响也仍需通过控制实验拆分。

不过,研究已经证明了一个足够重要的方向:Agent 记忆的价值不取决于保存了多少过去,而取决于系统能否把正确数量的经验,在正确任务中交给有能力使用它的模型。