软件工程基准通常提供一份结构完整的问题说明:当前行为、期望行为、复现步骤、环境信息、动机与验收标准。真实用户却常常只说“搜索坏了”“加个导出按钮”,然后期待 Agent 自己检查仓库、运行程序并补齐上下文。
RealSWE 研究的不是模型能否解决更难的代码,而是同一个任务在更真实的请求方式下会发生什么。结果很直接:七个现代模型的平均解决率下降 6.4 个百分点,计算成本反而上升,排行榜顺序也不再稳定。
#Benchmark 与真实请求的信息密度相反
研究先分析 718 条真实 Coding Agent 请求,再与 SWE-bench Verified 和 SWE-bench Pro 的 1,229 道题比较。
真实请求中,88% 只包含问题描述,或问题描述加一个期望动作;64.2% 只有问题本身。每条真实请求平均包含 1.4 类信息。基准题只有 7% 如此稀疏,平均包含 2.9 类信息。
语言风格也不同。真实请求大多口语化、第一人称、带有不确定性;基准问题更正式、确定、像整理后的工程文档。Agent 在公开分数里获得的输入,往往已经替它完成了问题澄清和证据组织。
#RealSWE 怎样控制变量
为了避免把提示变化与任务变化混在一起,研究从原有题库中选择信息字段完整的任务,形成 381 个任务家族,其中 192 个 bug 修复、189 个功能请求。
每个家族保留同一仓库、同一代码状态、同一测试和同一正确补丁,只改变输入包含哪些信息,以及表达方式是否接近真实用户。研究者可以组合问题、期望行为、复现步骤、环境、动机和验收标准,单独测量信息缺失带来的影响。
质量控制先从 403 个候选中移除 22 个关键分解失败,最终保留 381 个。任务类型分类、字段分解和语言改写都做了人工抽样验证。尽管大量步骤使用模型辅助,这套流程至少把“改写是否改变原意”作为独立风险处理。
#七个模型全部退步
实验测试 DeepSeek V4 Pro、DeepSeek V4 Flash、MiMo V2.5 Pro、MiMo V2.5、Claude Haiku 4.5、Qwen3.7 Plus 和 MiniMax M3。
在真实稀疏请求下,七个模型解决率平均下降 6.4 个百分点,相对原分数下降 13.6%。降幅从 MiniMax M3 的 4.0 个百分点,到 DeepSeek V4 Pro 的 8.0 个百分点。后者从 53.9% 降至 45.9%。
六个模型平均成本增加 6.2%,步骤数增加 1.8%。这说明 Agent 确实尝试通过更多仓库探索补齐信息,但额外行动仍不足以恢复原有成功率。真实请求不只是更难,也可能更贵。
#排名会被输入方式改写
MiMo V2.5 Pro 在原始问题上排名第四,在 RealSWE 输入下升到第二,超过 Qwen3.7 Plus 和 DeepSeek V4 Flash。它每题成本约 6.5 美分,Qwen3.7 Plus 约 16.1 美分;原始排行榜可能把用户引向更贵、但在真实请求下没有显著优势的模型。
这意味着 benchmark 不只会高估绝对能力,还可能给出错误的采购顺序。一个擅长利用完整规格的模型,不一定最擅长从仓库和执行环境主动恢复缺失信息。
#缺少什么信息最伤性能
受控实验表明,明确期望行为对 bug 修复尤其重要。只有“出了什么问题”时,Agent 容易修到症状;加入“正确行为应该是什么”,多个模型都有明显提升。功能请求则更依赖动机和验收标准,因为同一个表面需求可能对应不同产品约束。
语言风格本身也会影响结果,但总体小于信息组成。真正的问题不是用户说得不够正式,而是系统没有把澄清、环境检查和目标确认设计成 Agent 工作流的一部分。
#产品不能要求用户先学会写 benchmark
提升真实表现有两条路径。第一,让 Agent 在写代码前主动恢复问题结构:检查相关文件与测试,复现当前行为,提出少量高价值澄清问题,并把假设显式记录。第二,把产品入口做成渐进式信息采集,而不是一开始要求用户填写完整模板。
评测也应该同时保留两套输入。完整规格可以测纯实现能力;稀疏真实请求则测问题发现、仓库探索与澄清能力。只用前者,会把上游问题定义劳动免费赠送给模型。
RealSWE 仍是从现有基准筛选出的 381 个任务,覆盖 21 个仓库,不是对所有真实开发工作的随机抽样。入选任务也比被排除任务更复杂、原始解决率更低。语言与信息改写由流程构造,而非原始用户真的在这些仓库中提出的同一请求。
即便如此,控制同一代码任务只改变请求形式,已经足以证明一个常被忽略的事实:Coding Agent 的能力不是模型与仓库的二元函数,输入信息结构本身就是决定性变量。真实产品要优化的,不只是写补丁的模型,还有把一句模糊请求变成可验证工程目标的整条前置链路。