长任务中的 Agent 会不断积累工具输出:SQL 查询、网页搜索、日期解析、文件读取、计算结果。简单策略通常按时间截断、统一比例保留,或在超过阈值时做摘要。它们把所有工具结果视为同一种信息,却忽略了一个关键差异:有些输出随时可以重新获得,有些则承载后续步骤不可替代的数据。
TRACER 把压缩改写为逐工具的序列决策。每次触发压缩时,策略不再选择一个全局比例,而是根据当前查询、工具类型、输出属性与执行图,为每个工具结果分配不同保留率。
#同一个工具也不能固定分配预算
按工具类型设置规则已经比统一截断更合理。例如 SQL 结果往往包含不可丢失的数值,日期解析结果则容易重新生成。但同一种工具在不同任务中的后果也不同:参与多步 join 的 SQL 输出需要较高保留率,只用于回答一次简单查找时则可以更激进压缩。
因此,TRACER 的策略同时看工具与查询。动作是每个工具输出的保留比例,范围从 5% 到 100%;后端可以是截断、摘要、自信息筛选或组合式压缩器。策略学习的是“给谁多少预算”,而非绑定某一种压缩算法。
#奖励不能只看总 token
如果只奖励节省 token,策略会把上下文压到任务失败;如果只看最终成功,难以知道哪一次压缩伤害了结果。TRACER 使用两条信用通道。
第一条是任务级奖励,综合最终成功、token 节省与因上下文不足而重新调用工具的成本。第二条是工具级后果归因:结果模型估计某个工具输出若完全保留,与当前压缩比例相比,会怎样影响后续调用、token 与成功概率。低后果输出可以更激进地压缩,高后果输出获得保护。
论文没有把这种模型归因描述成严格因果保证。它通过消融实验和单工具干预验证其工程价值,但结果模型仍是近似。训练更新方向也包含塑形项,不是对任务目标梯度的无偏估计。
#29% 到 46% 的节省来自差异化保留
在生产查询实验中,TRACER 在四种压缩后端上维持任务成功率,同时节省 29% 到 46% token。摘要后端节省最多,为 46%;自信息筛选为 29%;截断为 31%;组合后端为 34%。重新调用工具的比例都不高于 2.5%,说明节省没有主要依赖“删掉以后再查一次”。
一个按工具类型固定比例的基线已经能节省 11% 到 28%。TRACER 在其基础上继续减少 15% 到 18%,差额来自对具体查询的适配。
归因模块也不只是让策略更省。与只用强化学习的版本相比,它让摘要后端成功率提高 4.8 个百分点,自信息后端提高 3.5 个百分点,截断提高 2.2 个百分点;同时进一步降低达到相同成功率所需的 token 比例。
最终学到的分配符合直觉但不是手写规则。摘要场景中,执行 SQL 的保留率收敛到约 0.65,日期范围解析约 0.48。截断后端可表达性更弱,各工具比例收窄到 0.52 至 0.60。
#策略能否迁移
研究在 Claude Sonnet 4.6 上训练策略,再冻结并迁移到 Qwen-3.7-Max 与 GPT-5.5。未重新训练时仍获得 18% 到 40% token 节省。GPT-5.5 保留了训练模型收益的 78% 至 87%,Qwen 保留 62% 至 76%。这是一项初步证据,不代表所有 Harness 与工具集合都能直接复用。
在工具与任务分布都不同的 LOCA-bench 上,研究重新训练策略,用 10 个环境训练、5 个保留环境评测,并覆盖 96K、128K、256K 三种长上下文设置。TRACER 比保留全部历史和启发式基线表现更好,整体节省 18% 到 25%。收益集中在数据分析和强顺序依赖任务,因为这两类任务最依赖少数不可替代结果。
#仍然存在复现边界
生产实验使用 120 个查询、五个随机种子,完整实验约消耗 400 计算小时和 2,800 美元 API 费用。论文估算,在每天超过 1,000 个会话时,训练成本可在三到六周内由 token 节省收回,但这是基于其流量和价格的场景计算,不能直接套到其他产品。
更重要的是,公开补充材料不包含专有生产 Agent、原始查询、工具轨迹、训练检查点和数据仓库,因此外部研究者无法端到端重放生产结果。现有证据支持方法方向,却需要在自己的任务、模型、压缩器和工具成本上重新验证。
TRACER 给上下文工程带来的核心启示是:上下文不是一个均匀字符串,而是一张带后果的执行图。真正的优化目标也不是让每轮 prompt 最短,而是在不破坏未来决策的前提下,把预算优先留给最难重新生成、最可能影响下游的节点。