选 coding agent 其实是在同时选两样东西:模型和 harness——后者是管理工具、上下文和任务执行的软件层。大家盯的都是模型,harness 的影响一直没被量过。
UC Berkeley 和 Arena 的研究团队(作者栏里有 Ion Stoica 和 Matei Zaharia)把这件事测了:7 个模型 × 3 个 harness = 21 种组合 ,在 SWE-bench Lite 和 Terminal-Bench 2.0 上各随机抽 30 个任务、每对组合跑 3 次,用各基准的官方评分器判分,成本按 2026-09-01 的 API 定价表统一折算,置信区间用 10000 次 bootstrap 估计。
参测模型:Claude Fable 5 / Opus 4.8 / Sonnet 4.6 / Haiku 4.5、GPT-5.6 Sol / Luna、Kimi K3。harness 三家:Claude Code、Codex CLI、Pi。
#发现一:harness 影响成本远大于影响正确率
同一模型在不同 harness 里成功率几乎不变,成本可以差出量级:
- Claude Fable 5 在三个 harness 里的成功率是 97.8% / 96.7% / 96.7%——但 Claude Code 每次尝试花 0.67,贵一倍换 1.1% 的成功率
- 整体看(几何均值):Claude Code 在 SWE-bench Lite 上约为 Pi 的 2.0 倍 、Codex 的 1.6 倍;Terminal-Bench 2.0 上约为 Pi 的 1.5 倍
- 而 harness 对成功率的平均影响:SWE-bench Lite 上 ±2% 以内,Terminal-Bench 2.0 上约 ±5%
不比较就接受默认 harness,你付的可能就是这种隐形 harness tax 。作者的建议:模型评测应该同时报告同一模型在常见 harness 下的成本和成功率。
#发现二:简单 harness 可以很有竞争力
Pi 只靠四个工具——read、write、edit、bash——就在两个基准上都站上了帕累托前沿。
钱花在哪?看首轮调用的 context:Claude Code 的平均初始 context 是 Pi 的 10 倍以上 ——更长的指令、更大的工具 schema。harness 税从模型开口第一句话就开始计了。同样的 turn 数(Fable 5 上 Pi 15.4 轮 vs Claude Code 15.3 轮),成本差一倍,说明贵在每轮的固定开销。
Pi 和 Codex 的有效性对开源 harness 研究是个好消息:不需要原厂权限、不需要和模型联合训练,就能做出 SOTA 级的 harness。更丰富的 harness 特性可能在其他模型、其他负载上有价值——harness 复杂度应该被当成一个经验性的取舍,而不是默认堆料。
#发现三:模型在原厂 harness 外可能表现更好
直觉上原厂应该最配——OpenAI 就说 GPT-5-Codex 是为 Codex 环境优化的。但实测:在 6 个 Anthropic/OpenAI 模型 × 2 个基准的 12 组对比里,9 组的最高成功率来自非原厂 harness 。
- Sonnet 4.6:Codex 里 68.9% vs Claude Code 里 66.7%,成本相近
- GPT-5.6 Sol:Terminal-Bench 2.0 上 Pi 里 83.3% vs Codex 里 78.9%,且成本几乎减半(0.76)
结论:模型的能力是可迁移的,同厂不保证最优配。真正的问题变成"哪个 harness 给你的模型和负载提供最好的成本-成功率平衡"。
#局限与更大的图景
作者自己标注的边界:只测了两个开源基准,模型训练时可能见过;换个负载结论可能不同。
结尾的判断值得单独记:日常任务里 coding agent 本质是模型智能的接口 ——管上下文、接工具、跑任务。模型越强,需要的脚手架越少,通用 agent 应该优先做成本效率和可靠性,很多任务根本不需要花哨的附加功能。但在模型能力边界的硬问题上(比如科学发现),agent 仍可能受益于提供结构化引导的 harness——帮模型探索想法、评估候选、从反馈里学。harness 研究可以理解为一种帮模型推知识边界的脚手架,但配置不该甩给用户——理想的 harness 应该随任务展开自适应调整。
顺带一提:他们承诺公开全部 profiling trace,论文引用和实验细节都在项目页。