SOTA Sync
全部文章
模型进展2026-09-02

深度研究 Agent 最危险的错误:证据还没齐,就过早选定方向

HypoSearch 在搜索分叉点先生成多个轻量假设,再用有界分支收集并比较证据,避免深度研究 Agent 被第一条看似合理的路径锁死。

深度研究 Agent 往往看起来很勤奋:不断搜索、打开页面、补充证据,最后给出一份结构完整的答案。但这篇研究指出,许多失败其实在很早以前就已经发生——当搜索状态同时存在几个合理方向时,Agent 太快选中其中一个,后续工具调用只会围绕这条路径继续积累“支持证据”。

问题不是搜得不够多,而是搜索被早期判断锁死了。

#单轨搜索为什么会越搜越偏

研究团队把轨迹中的状态分成两类。直接状态只有一个明显的下一步,例如找到某家公司后继续查它的成立时间;分歧状态则存在多个候选、解释或证据方向,需要先比较再决定。

搜索轨迹中的直接状态与分歧状态搜索轨迹中的直接状态与分歧状态

普通单轨 Agent 无论遇到哪一种状态,都必须立刻决定下一步。一旦它在分歧状态中押错方向,后续检索会继承此前上下文,查询越来越具体,表面上证据越来越丰富,实际上只是把错误假设做得更完整。

对 BrowseComp、FRAMES、GAIA 等基准的失败轨迹分析显示,不同任务的失败位置并不相同。BrowseComp 的主要问题集中在早期探索,另一些基准则更多失败在工具调用或最终综合。这意味着“统一增加搜索深度”并不是通用解法:预算应该投向真正发生分叉的时刻。

#先提出假设,再决定走哪条路

HypoSearch 的做法不是同时运行多条完整研究轨迹,而是在检测到分歧状态后生成若干轻量假设。每个假设只是一条非约束性的搜索提示,由独立分支在有限预算内收集证据;聚合器随后横向比较各分支,证据充分就回答,不充分则生成下一轮更具体的假设。

HypoSearch 在承诺前进行有界分支探索HypoSearch 在承诺前进行有界分支探索

这个设计把并行计算放在“选方向”之前,而不是在五条完整轨迹结束后再投票。它同时保留两种能力:宏观上仍可根据新证据继续迭代,局部遇到分叉时又能暂缓承诺。

研究还总结了成功轨迹的两个行为信号。候选聚焦率衡量搜索是否从模糊主题落到可验证对象,方向切换率衡量当前路径证据不足时是否会主动换方向。二者缺一不可:只有候选而不换方向,会形成过早锁定;频繁换方向却没有具体候选,则容易漫游。

#更准,而且没有付出完整并行的成本

HypoSearch 在四个深度研究基准和三个模型骨干上都优于单轨搜索、多数投票和 best-of-N。Qwen3.5-122B 在 BC-small 上从 46.7 提升到 60.0;DeepSeek-V3.2 在 FutureX 上从 44.7 提升到 53.9。

三种模型上的平均工具调用次数三种模型上的平均工具调用次数

收益也不是简单用更多调用换来的。以 Kimi-K25 为例,五轨多数投票平均需要约 205 次工具调用,HypoSearch 为 132.5 次,减少 35.4%;Qwen3.5-122B 上也减少约 29.1%。结构化分支比“多跑几遍再投票”更有效率。

一项小规模监督微调实验还显示,只用候选聚焦率与方向切换率筛出的 1 万条轨迹,就能在 BC-small 上达到或略超 8 万条完整数据的效果,同时更好保留数学推理能力。这提醒我们:研究 Agent 的训练数据不应只按最终成败筛选,还应检查它在关键分叉点怎样处理不确定性。

真正值得产品化的不是让 Agent 永远多想几步,而是让它知道什么时候不该急着下结论。