SOTA Sync
全部文章
记忆与上下文2026-09-03

Agent Skills 越积越多后,真正的问题是如何合并经验

SkillGLoW 不再把每次成功轨迹保存成孤立技巧,而是按过程家族聚合、局部再生成并通过提交门筛选,在数学、终端、软件修复和具身任务上实现 12/12 组合提升,同时把技能库压缩 3.6 倍。

从成功轨迹中提炼 Agent Skills 已经很常见,但逐条保存会制造另一个问题:同一类任务积累大量近似技巧,检索时互相竞争,失败经验也难以修正已有规则。SkillGLoW 把技能学习从“追加笔记”改成 过程家族的持续合并

#先找到同一家族,再决定怎么改

系统按解决过程而不是任务表面措辞对经验聚类。新轨迹到来后,只更新最相关的局部技能家族;模型可以合并共同步骤、保留条件分支、修订错误规则,也可以拒绝没有增量的信息。

SkillGLoW 从轨迹到过程家族再到技能库的整体流程SkillGLoW 从轨迹到过程家族再到技能库的整体流程

关键环节是 commit gate:候选技能不会因为写得通顺就进入库,而要通过效用、一致性和覆盖检查。这样,技能更新更像代码合并,而不是无限增长的个人笔记。

候选技能通过提交门进入稳定技能库候选技能通过提交门进入稳定技能库

#四类任务、三个模型全部正增益

评测覆盖数学、终端操作、软件修复和具身环境,三个模型形成 12 个模型—任务组合,全部取得提升。困难子集相对无技能基线平均提高 17.2 个百分点;局部再生成带来 18.0 点提升,技能库同时缩小 3.6 倍。ALFWorld 上的成功率从 73.9% 提升到 83.9%。

#Skills 需要生命周期,而不是文件夹

这项工作提供了一套可落地的技能库控制面:捕获经验、识别家族、生成候选、门控提交、压缩冗余、保留回滚。它把 Skills 从静态提示文件提升成可测试、可演化的程序资产。

真正值得带走的结论是,技能数量不是能力指标。一个更小、边界清晰、知道何时适用并经过回归测试的技能库,通常比几千条互相重叠的经验更可靠。