SOTA Sync
全部文章
记忆与上下文2026-09-01

Agent 记忆该如何获得奖励:用事后证据监督每一次写入与合并

Hindsight Memory-PRM 用检索、引用和受控删除产生可审计的事后信用,为记忆写入与合并提供比最终问答分数更细的训练信号。

长期 Agent 的记忆训练有一个延迟归因难题:某次写入、合并或跳过,可能几十轮之后才影响答案。若只把最终问答得分分给全部记忆操作,有用动作与垃圾写入会获得相同奖励;若逐条请人标注,又很难覆盖长轨迹。

Hindsight Memory-PRM 提出一种事后监督方法。它不要求人类判断每次写入,而是利用记忆系统天然留下的审计轨迹:某条记忆是否被检索、是否被回答器引用,以及删除它后答案是否从正确变为错误。

#把记忆价值变成可观察证据

系统管理三类操作:写入新条目、把新信息合并到已有条目的版本链,以及不做处理。读取由固定检索器完成。每个条目保留来源、时间、层级与历史版本,旧内容不会被破坏性覆盖。

训练时,系统先运行记忆管理与问答,记录检索和引用。随后构造与原始对话证据绑定的探针问题,并对被引用的条目做一次受控删除,再让固定回答器重新作答。

由此得到一组分层信号:从未进入任何读取路径的条目趋近于零贡献;被检索但未引用的条目有较弱证据;被正确答案引用的条目获得更高信用;删除后使答案由对转错的条目,被视为对当前回答器“不可缺少”。反过来,如果删除某条记忆让错误答案变正确,它会收到负信用。

这不是对真实因果贡献的完整证明。重复记忆可能让删除一条后答案仍正确,固定回答器也可能存在噪声。论文明确把分数定义为面向特定读取配置的操作性证据,而不是信息论意义上的贡献估计。

#为什么要专门生成探针问题

直接在真实问题上删除记忆,信号往往太弱。一段对话证据可能同时支持多个问题,近似重复内容也会在删除后补位。论文估计,在其设置中要从小效应中获得足够统计把握,可能需要数百次重复测量。

研究团队于是生成单一来源锚定的探针:答案不能靠常识得到,指定对话轮次确实支持答案,其他轮次不能独立支持。开发集复测中,删除锚点后答错的比例从真实问题上的弱信号提升到 98.7%。这样一次删除与重答就能提供更密集的信用信号。

检索和引用先把需要干预的范围压小。LoCoMo 中 74.6% 的条目从未进入任何已记录读取路径,批量删除它们只造成约 0.1 个百分点的波动;被引用条目只占 7.2%,删除后准确率下降 12.4 个百分点。系统因此不必为每次写入都完整重放未来轨迹。

#离线评论器与在线信用如何配合

离线阶段,系统用检索、引用、删除和反事实样本训练一个操作条件化的记忆效用评论器。它在做出记忆决策时,根据当时可见信息预测动作价值。

在线强化学习阶段,真正测得的检索、引用与删除结果仍是核心奖励;评论器只提供会逐步退火的塑形信号。系统还加入覆盖惩罚,避免为了省上下文而漏掉重要事实,并把条目信用沿版本链传播到具体写入或合并动作。

这种设计试图避免评论器成为可以被策略钻空子的最终目标。LoCoMo 的短训练冻结评论器;更长的 LongMemEval 训练每 200 步刷新一次,并通过锚定、审计和回滚控制偏移。

#结果:小模型超过自己的教师

在 LoCoMo 的 5 个保留对话、975 个问题上,Qwen3-8B 记忆管理策略达到 77.5% 准确率。相同读取器下,API 教师为 65.1%,预算匹配的 Mem0 为 69.7%;Mem0 官方的高上下文配置为 74.7%,但使用约 19,600 个上下文 token,论文方法使用 2,480 个,约为八分之一。

受控奖励阶梯更能说明机制。只用最终结果做 GRPO 得到 63.4%;加入观察性归因后为 70.2%;再加入受控删除产生的干预信用后升到 77.5%。去掉评论器会损失 6.5 个百分点。

在 LongMemEval 上,方法达到 79.0%。但论文也发现存储 schema 具有领域依赖,跨基准迁移并非自动成立;外部系统对比还是完整系统级比较,不能把差异全部归因于单个训练组件。

#多版本比覆盖旧事实更安全

训练后的策略逐渐形成多版本组织:稳定属性、时间事件和更新信息不被简单覆盖,而是沿版本链保留。这样既能回答“当前是什么”,也能处理“过去何时改变”。

论文刻意排除破坏性删除。不可逆删除会毁掉证据,也会伤害时间问题;受控删除只用于训练时测量,不等于允许生产策略随意抹去历史。这一区分对 Agent 记忆很关键:压缩可以改变索引和组织,但原始来源最好保留在可审计层。

这项工作的真正贡献不是一个更高的问答分数,而是把记忆训练从“最终答对就奖励所有动作”推进到“每条记忆都有可追踪的下游证据”。当记忆写入开始由策略自动决定,引用、来源、版本和可逆干预就不再是附加功能,而是训练信号与治理基础设施。