Agent Skill 很容易通过静态检查:有说明、有示例、目录正确、脚本能运行。但这些条件只能证明它“像一个合格的 Skill”,不能证明 Agent 安装它之后真的更准确、更高效,也不能证明它不会在无关任务中抢占上下文。
NVIDIA 的 SkillEvaluator 把问题改写成一个可实验的命题:在其他条件相同时,安装这个 Skill 能让 Agent 的表现提升多少? 这个差值被称为 Skill Lift。
NVIDIA 公布的首轮结果覆盖 30 多个产品、300 多个已验证 Skill,并分别在 Codex 与 Claude Code 两套 harness 中运行。它不是只检查最终回答,而是把 Skill 的安全性、差异性、调用行为、任务结果和资源消耗拆成多层评价。
#三层评测回答三个不同问题
SkillEvaluator 的流程分成三层,每层都可以独立运行。
Tier 1:安全与结构。 检查 schema、frontmatter、脚本质量和许可证,同时扫描提示注入、数据外传、秘密信息与个人信息泄漏等风险。这一层回答“能不能安全地进入候选池”。
Tier 2:差异性。 通过向量相似度寻找 Skill 内部重复指导,以及整个目录中覆盖范围高度重叠的 Skill。它回答“这个 Skill 是否提供了独立价值”,避免目录不断堆积同义说明。
Tier 3:在线任务评测。 Agent 在隔离环境中完成真实任务,一次安装 Skill,一次不安装 Skill,然后比较两组结果。这一层回答“它到底有没有改善 Agent 行为”。
三层不能互相替代。静态安全扫描无法证明任务收益;一次高分任务也不能证明 Skill 没有注入、秘密泄漏或供应链问题。
#对照实验如何隔离 Skill 的贡献
Tier 3 使用开源评测框架 Harbor 管理任务与沙箱。对每个评测用例,同一套 harness 运行两次:提示、模型、任务输入和评分标准保持一致,每次都从独立、可重复的隔离环境开始,唯一实验变量是 Skill 是否安装。
评测数据集不仅包含直接要求调用 Skill 的显式任务,还可以用 --full 生成隐式、上下文相关和负例。负例非常重要:好的 Skill 不仅要在需要时被发现,也必须在不相关时保持不加载,否则目录越大,错误激活和上下文噪声越严重。
Skill Lift 的计算很直接:
Skill Lift = 安装 Skill 后的得分 − 未安装 Skill 的得分
同一个 Skill 还会跨两套 harness 重复比较,以观察收益是否只依赖某个 Agent 产品的默认提示、上下文管理或工具调用实现。
#五个维度不能混成一个“成功率”
NVIDIA 将表现拆成五个维度:
| 维度 | 评测问题 | 未安装 Skill 的平均分 |
|---|---|---|
| 正确性 | 最终答案是否正确 | 46 |
| 可发现性 | 相关时加载、无关时不加载 | 42 |
| 有效性 | 是否完成目标并遵循预期工作流 | 39 |
| 效率 | 是否避免无效步骤与重复工具调用 | 43 |
| 安全性 | 是否避免危险操作、泄密和越权 | 97 |
安全性的基线已经很高,因此它更像一条不得回退的约束,而不是用于追求大幅增益的优化指标。正确性和有效性则直接衡量 Agent 在没有专门指导时能完成多少工作。
可发现性与效率需要更谨慎解释。它们的部分评分依赖 Skill 本身是否被正确加载和使用;在未安装条件下,这些动作本来就不可发生。因此这两个维度适合检查“装上之后有没有用对”,不应被误读为完全独立的无 Skill 能力比较。
#平均结果很强,但不是“成功概率翻倍”
汇总结果显示,安装已验证 Skill 后,五项平均分都上升:
| 维度 | 未安装 | 已安装 | Skill Lift |
|---|---|---|---|
| 正确性 | 46 | 87 | +41 |
| 可发现性 | 42 | 82 | +40 |
| 有效性 | 39 | 78 | +39 |
| 效率 | 43 | 78 | +35 |
| 安全性 | 97 | 98 | +1 |
其中最可信的核心信号是正确性从 46 升至 87、有效性从 39 升至 78。这里的单位是评分点,不是成功概率,也不是相对百分比。它说明这些专门任务上的平均表现明显改善,却不能推导出“所有任务成功率都提高 41%”。
跨 harness 比较同样值得注意。包括安全维度时,Claude Code 的平均 Skill Lift 为 +34,Codex 为 +29;排除安全维度后分别为 +42 和 +36。两者相差约 5—6 分,但不同产品的 Skill Lift 范围约为 +2 到 +46。换句话说,任务领域、Skill 内容和评测设计造成的差异,远大于选择哪套 harness。
#Token 并不会因为安装 Skill 自动下降
Skill 常被宣传为“让 Agent 少走弯路”,但实测并非总是如此。一个内存优化 Skill 将 token 使用从 617,306 降到 142,540,减少 76.9%,执行时间也从 474.9 秒降至 220 秒。另一个安装类 Skill 却让 token 从 25,227 增至 55,582,上升 120.3%,耗时也增加 20.8%。
这正是把资源消耗单独记录的价值。一个 Skill 可以提高正确性,同时变得更昂贵;也可以减少步骤,却降低最终质量。只有把结果、轨迹、耗时、token 和安全约束分开报告,团队才能决定这笔交换是否值得。
#这组结果还有三项限制
第一,85% 的已发布 Skill 每个任务只运行一次,另有 15% 运行两次。Agent 输出具有随机性,一次成功只能证明能力出现过,不能证明稳定可靠。
第二,文章没有报告置信区间。目录级平均值汇总了数千次试验,可以提供方向性证据,但无法直接判断单个 Skill 的增益是否显著。
第三,评测对象来自 NVIDIA 自己维护和筛选的 Skill 目录。它证明的是“经过筛选的专业 Skill 在相关专门任务上可以产生很大边际收益”,不能外推为任意 Skill 文件都会改善任意 Agent。
#一套可复用的 Skill 上线门槛
这套方法最值得复用的不是某个平均分,而是发布顺序:
- 先用静态规则排除结构、安全、秘密信息和许可证问题;
- 再检查目录内重复与跨 Skill 能力重叠;
- 为 Skill 建立显式、隐式、上下文和负例任务;
- 在相同模型、提示、环境和评分标准下运行有无 Skill 对照;
- 分开报告正确性、约束、调用轨迹、成本和耗时;
- 对关键任务重复多次,并报告分布而不是只报一次分数;
- 只有当收益稳定、无安全回退且成本可接受时,才把 Skill 标记为可发布。
Skill 的真正质量不在于说明写得多完整,而在于它是否能在受控实验中证明:Agent 因为它做得更好,并且这种提升足够稳定、足够安全,也值得额外成本。