长任务中的上下文通常按时间不断追加:用户消息、推理、搜索结果和工具输出全部留在工作区,直到达到窗口上限再统一截断或摘要。这个办法把上下文管理交给固定规则,模型既不知道自己丢掉了什么,也不能根据任务结构提前整理信息。
ContextPilot 让 Agent 主动管理工作上下文。它不只提供搜索、删除和摘要,还加入全局规划、长期记忆与“软卸载”工具,并为上下文编辑设计专门的强化学习方法。
#从删除历史到管理信息生命周期
基础上下文工具可以定位、查看和删除消息。ContextPilot 在此之上增加三组能力。
规划工具帮助模型先建立目标、子任务和进度,而不是被最新观察牵着走。长期记忆工具把实体、时间和事件组织成结构化条目,并允许读取关联节点。软卸载工具可以摘要、压缩或折叠历史;被折叠的信息不再占据完整工作区,但仍能通过关键词搜索恢复。
这里的“软”很重要。直接删除一段内容只节省 token,却切断未来取回路径;软卸载更像把冷数据移出工作集,同时保留索引。Agent 因而能把当前推理所需信息与可能稍后使用的历史分开。
#普通轨迹奖励不适合上下文编辑
上下文编辑动作会重写之后每一步可见的历史。一次错误删除可能影响整条轨迹,一次高质量折叠也可能因为后续推理错误而得到负奖励。若把最终答对或答错平均分配给所有编辑动作,信用非常粗糙。
ContextPilot 先把轨迹按上下文编辑动作切成快照。训练时,它根据编辑前后的上下文变化和模型输出熵变化,估计哪次决策对后续最敏感,把更多分支采样预算放到这些点,而不是均匀重跑每个动作。
对于某个中间快照,奖励来自所有经过该快照的后续分支。这样可以比较“从这次编辑出发,后续通常会怎样”,而不只用偶然的一条最终轨迹给动作定性。无效工具调用、违反前置条件和上下文超限还会收到额外惩罚。
#训练不仅教会调用,还教会何时调用
监督微调数据由强模型在带脚手架的环境中生成。系统会动态隐藏不满足前置条件的工具,例如还没写入记忆时不提供 readMemory;参数错误时允许定向重试,但失败尝试不会进入最终示范。
从 3,196 个问题出发,流程在结果、过程质量和 32K 峰值上下文限制后保留 3,068 条轨迹,再按编辑点切成 51,469 个训练快照。强化学习阶段在长问答使用 488 个问题,在深度搜索使用 1,000 个问题。
训练过程中,模型最初近一半工具调用用于信息检索。随着强化学习推进,检索占比下降,规划、感知、长期记忆和上下文卸载逐渐增加。早期经常出错的记忆与卸载工具,调用失败率也随训练下降。这说明仅给模型工具定义不够,它需要从下游结果中学到使用时机和前置条件。
#更小工作区,得到更高结果
在长上下文问答上,ContextPilot-8B-RL 的四项平均成绩为 69.40,未经过 RL 的版本为 65.78,平均提高 3.62 分;它比 StateLM-8B-RL 平均高 3.55 分。14B 与 Gemma 系列也出现一致提升。
32K 的 ContextPilot 还能超过直接使用 128K 窗口的基础模型。对 BrowseComp+ 这类平均输入达到 552K token 的任务,RL 带来 5.34 分提升,高于较简单数据上的增益。
深度搜索中,ContextPilot 在 WebSailor-7B 和 WebExplorer-8B 两个骨干上,平均比 SUPO 高 1.51 分。以 WebSailor 为例,四个基准平均为 38.32,SUPO 为 36.31,普通 ReAct 为 25.47。
token 轨迹也出现结构变化。WebExplorer-8B 的每轮输入随任务推进近似线性增长,接近 30K;ContextPilot-8B 稳定在约 8K 到 10K。它不是等到溢出才压缩,而是持续维持较小工作集。
#工具越多,不代表自动更强
大型教师模型的累积消融显示,逐步加入规划、软卸载和长期记忆后成绩上升;在 BrowseComp+ 上从基础工具的 63.49% 提升到完整工具集的 80.96%。但小模型在监督微调后仍频繁误用复杂工具,直到 RL 才改善。
这揭示了一个产品陷阱:上下文管理工具越丰富,动作空间和前置条件也越复杂。没有过程数据、环境错误反馈和信用分配,新增工具可能只是把固定压缩的错误换成模型主动误删。
论文的实验主要集中在长文档问答和深度搜索,还没有覆盖 Coding Agent、GUI Agent 与具有不可逆外部动作的任务。部分训练超参数没有大规模搜索,外部摘要基线也因官方模型不可得而使用替代实现。结果证明的是方法在所测环境中的一致收益,不是通用上下文管理已经解决。
ContextPilot 指向的长期方向很清楚:上下文窗口不应只是被动容器,而应成为 Agent 可以规划和维护的工作内存。产品需要同时提供可恢复的卸载机制、结构化长期记忆、工具前置条件和能追踪编辑后果的训练信号,才能让“主动管理”比简单截断更可靠。