SOTA Sync
全部文章
Agent 设计2026-09-04

多 Agent 研究越早共享答案,越容易一起跑偏

ArcticSwarm 将证据收集与结论整合分离,用受控隔离、共享证据板和三道承诺门避免多 Agent 过早收敛。在完整 BrowseComp-Plus 上,Qwen 3.5-27B 从对齐的 MiroFlow 基线 70.6% 提升到 82.6%。

多 Agent 系统通常默认沟通越充分越好:子 Agent 一发现线索,其他成员立刻读取并继续推进。但在没有可靠验证器的开放研究任务中,这会制造一种集体偏见——最先出现的候选答案迅速变成团队共同前提,平行搜索退化成对同一假设的重复确认。

ArcticSwarm 的核心不是增加 Agent 数量,而是控制 信息在什么时候可以传播

#把证据共享与观点共享分开

系统让调查 Agent 把来源、摘录和检索结果发布到共享 bulletin board,同时允许部分搜索任务保持 gated isolation:它们可以访问任务与公共证据,但不会立即读到其他 Agent 的候选答案和解释。这样既避免重复抓取,也保留了独立形成假设的空间。

ArcticSwarm 通过共享证据板、隔离调查与审查门组织长程研究ArcticSwarm 通过共享证据板、隔离调查与审查门组织长程研究

结论要跨过三道承诺边界:候选提交前自检、共享板审计,以及最终答案前的替代假设检查。只有证据足够的候选才被传播;领先答案仍缺关键支持时,系统会重新打开搜索,而不是让多数意见充当事实。

#提升来自信息结构,不只是更多算力

在完整 830 题 BrowseComp-Plus 上,使用同一 Qwen 3.5-27B、检索器、工具、超时和裁判时,ArcticSwarm 达到 82.6%±0.5%,对齐后的 MiroFlow 为 70.6%。关闭 gated isolation 后降到 78.8%;再移除结构化审查后降到 74.5%。

隔离与不同通信结构对任务覆盖和正确率的影响隔离与不同通信结构对任务覆盖和正确率的影响

在实时网页 BrowseComp 上,GPT-5 版本达到 73.6%,高于论文引用的模型提供方系统 54.9% 和同骨干 MiroFlow 63.4%。论文还比较了并行单 Agent 的多数投票:即使把 Token 预算拉到接近 ArcticSwarm,多数票仍约为 63.2%,因为正确答案在难题上经常只是少数候选。

#预先拆答案,反而加深锚定

研究还记录了一个失败设计:搜索前先让模型生成多个实体解释。它只在 120 个问题中的 17 个触发,在这些本应受益的模糊问题上,准确率却从 41.2% 降至 29.4%;未触发的问题仍多消耗约 44% Token。先猜候选集合,只是把“过早共识”提前了一步。

更稳妥的拆分对象是约束:先决定哪些线索需要独立验证,而不是先决定答案可能是谁。对产品系统而言,这意味着共享层应优先存放可引用证据、任务状态和未决约束,候选结论需要显式的传播门槛。

ArcticSwarm 给出的不是“多开几个 Agent”公式,而是一条组织原则:并行搜索需要差异性,协作系统必须主动保护这种差异性。