不是全局静态分解,而是动态递归委托!快手与人大提出 WebSwarm 复杂搜索新框架
WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search

基于大语言模型(LLM)的智能体正在彻底改变网络信息检索的形态。我们早已不再满足于用它来回答简单的单一事实问题(例如“某电影的主演是谁”),而是开始向它下达更为复杂的“研究型”指令——比如“对比过去三年里所有开源多模态模型的核心架构差异与参数规模”。这类任务天然具备极强的复杂性,它们不仅需要深度(Deep)(即跨越多跳逻辑、理清层层依赖关系),同时还需要广度(Wide)(即覆盖海量候选实体与分散的信息源)。
ArXiv URL:https://arxiv.org/abs/2607.08662v1
面对如此庞大的信息处理需求,依赖单一长轨迹的经典单智能体(如基于 ReAct 模式的 Agent)往往会陷入困境。随着搜索链条的拉长,单智能体极易在海量的中间信息中迷失,并迅速遭遇上下文窗口的物理限制。为了突破这一天花板,近期的研究开始转向多智能体(Multi-Agent)系统,试图通过并行搜索和结果汇总来扩大信息覆盖面。然而,现有的多智能体架构在应对嵌套且复杂的搜索需求时,依然表现出协作模式僵化、递归分解能力羸弱等明显短板。
为了从根本上解决复杂网络搜索在深度与广度上的协同难题,快手联合中国人民大学的研究团队提出了一种全新的渐进式递归多智能体框架——WebSwarm。该框架彻底摒弃了在任务初期进行一次性全局静态分解的做法,转而在推理执行过程中,动态地将任务分解、智能体协作与网页证据收集融为一体。在多个极具挑战性的网络搜索基准测试中,WebSwarm 展现出了远超现有单智能体与多智能体基准的强大性能,尤其在长尾且极高难度的搜索任务上,实现了突破性的能力跃升。
现有搜索 Agent 为什么搞不定“深与广”?
要理解 WebSwarm 的核心创新,我们需要先剖析现有的多智能体搜索系统到底卡在了哪里。真实世界的高阶搜索任务往往不会按照完美的树状结构在最开始就暴露所有子问题,而是随着初步线索的浮现,逐步暴露出更深层的约束和更广泛的目标。
这就对调度系统提出了极高的要求。然而,现有主流的智能体调度范式在面对这种动态演化的深广任务时,暴露出三个致命的局限性。

从上图可以直观地看出不同多智能体范式的差异。现有系统主要面临以下困境:
一方面是递归深度过于浅薄。许多复杂的搜索任务需要多级下钻,比如一条逻辑链条可能是“锁定年份 $\rightarrow$ 筛选品牌 $\rightarrow$ 确定具体型号 $\rightarrow$ 提取关键属性”。然而,大多数现有多智能体系统仅仅停留在根节点(Root level)进行一次浅层分解。当遇到需要更深层次展开的子任务时,系统往往只能把这个大包袱直接甩给下属的一个子智能体,迫使它重新退化成一条冗长的 ReAct 搜索轨迹,这本质上又回到了单智能体挣扎的老路。
另一方面是协作适应性极度受限。在同一个复杂的宏观任务中,不同环节所需的解题策略截然不同:有些局部目标是事实核查,需要极高的精准度和查证效率;有些目标是开放式的实体收集,需要在未知边界的情况下平衡召回率与精确率;还有些目标是需要反复论证的深层逻辑推理。但现有的系统通常只会硬套一种全局协作范式——要么全体搞流水线串联,要么全体搞 MapReduce 式的并行分发。这种用一把尺子量天下的做法,根本无法灵活应对局部搜索节点千变万化的需求。
最后,也是最为隐蔽的一点,是任务扩展严重脱离了真实的网页组织结构。在现有的设计中,智能体往往仅凭用户查询的“表面语义”就拍脑袋决定如何拆解任务。如果所需的信息本来就高度集中在一两篇深度汇总的网页中,智能体却依然按照实体维度将其拆分给十几个子智能体去并行搜索,就会导致极其严重的检索冗余;反之,如果信息本就散落在按时间或事件分布的各个孤岛网页中,智能体却找错了拆解维度,就会导致搜索覆盖不全以及后期结果聚合困难。
动态构建的递归委托树:WebSwarm 机制解析
针对上述痛点,WebSwarm 放弃了提前铺设静态协作图的执念,转而提出了一种“渐进式递归委托”的核心机制。在这种机制下,复杂任务的分解不再是一个一次性的动作,而是伴随整个搜索过程持续发生的动态衍化。

如上图的运行示例所示,WebSwarm 将整个搜索过程具象化为一棵动态生长的节点树。当系统接收到初始的复杂查询 $q_{0}$ 时,根节点便被激活。接下来,任何一个需要进一步展开的节点,都会根据当前的进度和获取的中间证据,动态派生出一组新的子委托(Child Delegations):
\[C_{v}=\{(q_{i},m_{i})\}_{i=1}^{n_{v}}\]这里最关键的设计在于,WebSwarm 派生出的不仅仅是细化后的局部查询内容 $q_{i}$,它还强行将每一个子任务与一种具体的“搜索模式(Search Mode)” $m_{i}$ 耦合在一起。
搜索模式决定了该节点在接下来的执行中,究竟是选择单干,还是继续拉起一支具备特定协作结构的子团队。为了应对各类局部挑战,WebSwarm 定义了四种核心搜索模式:
-
$\textit{atom}$(原子模式):这是树的叶子节点,主要负责直接调用浏览器工具完成确定性的单一动作,不涉及复杂的发散。
-
$\textit{deep}$(深度模式):用于处理需要多步逻辑推理的局部任务,允许节点通过多次迭代逐步逼近真相。
-
$\textit{wide}$(广度模式):负责将一个大目标横向拆解成多个相互独立的小目标,并以并行或分散的方式委派给下一级。
-
$\textit{entity_collect}$(实体收集模式):专门处理开放域下的实体枚举与属性填表,它会在局部构建特殊的并发收集逻辑。
这种“目标+模式”的强绑定,使得每一次局部下发都能获得最适配的求解策略。当这些节点完成自身的使命后,它们并不会单纯抛出一个终态答案,而是会将获取的关键证据与结构化结果自下而上地逐层返回(Aggregate)。父节点在接收到这些增量证据后,会重新评估当前局势,决定是继续派生新的分支去填补信息空白,还是修正之前的错误路线,抑或是认为证据已经充分,直接汇总结案。
这种自上而下派生与自下而上反馈交替进行的循环,让 WebSwarm 真正具备了“走一步看一步,根据路况随时换车”的智能调度能力。
拒绝盲目发散:网页探针与经验复用双引擎
纯粹的递归往往隐藏着巨大风险,那就是如果不加以约束,极易引发无限下钻或指数级的节点爆炸,导致计算资源的迅速枯竭。为了确保递归委托过程既克制又高效,WebSwarm 巧妙地引入了两套极为有效的导航机制。
第一套导航是基于网页真实结构的探针引导(Web-Structure-Guided Expansion)。
正如前文所言,盲目基于语义拆解任务往往会吃大亏。WebSwarm 引入了一个轻量级的探测模块,在决定向广度扩展之前,系统会先对相关的局部网络环境进行一次快速的“网页探针(WebProbing)”测试。
如果探测结果表明,解答当前问题所需的所有核心数据已经被某个现成的百科列表或者权威报告集中收录了,系统就会立刻叫停大规模的实体级别节点派生,转而只生成少量的提取型节点去定向攻克这几个核心网页。相反,如果探测发现目标信息极度碎片化,探针就会返回一种最合理的“切分维度”(比如按照时间轴、地域或机构)。随后,父节点便会严格沿着探针建议的维度来生成子节点。这种将任务分解与物理网页信息组织形式深度对齐的设计,极大削减了系统的无效空转。
第二套导航则是同构节点间的经验复用(Experience-Guided Node Solving)。
在极度依赖广度搜索的任务中,系统往往会瞬间派生出大量结构高度相似的“兄弟节点”。例如,任务要求搜集 20 个不同初创公司的融资轮次和核心产品。这 20 个节点面临的问题模式其实是一模一样的。
如果让这 20 个节点各自为战,它们大概率会重复踩同一个坑(比如去一个已经被证明拦截爬虫的网站里死磕)。WebSwarm 通过设立“侦察兵”彻底扭转了这种内耗。系统会先随机挑出 2 个节点作为先遣队(Scout nodes)进行探索。当这两个节点完成搜索后,系统会从它们的执行轨迹中提取出宝贵的过程级经验——例如“维基百科上的融资信息经常滞后,优先检索 Crunchbase”或是“查询词加上特定后缀效果更好”。
随后,这些沉淀下来的实战经验 $k_{v}$ 会作为额外的提示,一次性灌输给剩下所有的同构兄弟节点,指导它们避开陷阱、直奔主题。这种“一处蹚雷,全局避坑”的机制,显著提升了同构任务的整体求解质量与一致性。
实验结论剖析:突破长尾任务的性能天花板
为了验证框架的实际效能,研究团队在四个被公认为当前最具挑战性的网络搜索基准测试上进行了全面评估:测试深度事实检索的 BrowseComp-Plus、测试结构化广度收集的 WideSearch、嵌套考验深广协同的 DeepWideSearch,以及考察综合信息搜寻能力的 GISA。
在以 GLM-4.5 为主干模型的对比实验中,WebSwarm 展现出了压倒性的优势,各项核心指标一致优于单智能体 ReAct 以及包括 Kimi-Swarm 变体在内的多种前沿多智能体基准。更值得关注的是模型在消融实验和任务难度分层测试中暴露出的深层机理。

观察上方依据任务难度进行分层后的表现折线图,可以发现一个极为关键的技术现象。
在那些相对简单的查询(Easy)中,传统的单智能体或简单的多智能体系统依然能够应付,WebSwarm 的领先幅度尚未拉开量级差距。然而,随着任务复杂度向“困难(Hard)”区间攀升,ReAct 智能体的成功率在 BrowseComp-Plus 数据集上直接遭遇断崖式暴跌,直至触底归零(0.0);而 WebSwarm 依然能够在绝境中稳健执行,硬生生将成绩维持在 35.7。同样,在 WideSearch-EN 的高难样本上,WebSwarm 也是以超过 30 个百分点的巨大优势碾压基线。
与性能飙升相对应的是资源消耗的智能适配。从工具调用次数的统计来看,WebSwarm 并未陷入无脑堆砌算力的陷阱。在简单任务上,它的网页调用量保持克制;只有当判定任务真正错综复杂时,它才会通过递归委托释放更大的搜索与阅读预算。消融实验进一步证实,如果强行剥离“网页探针”机制,系统在保证同等性能的前提下,工具调用次数将急剧飙升接近一倍。这充分说明,探针机制在降低无意义探索成本方面发挥了决定性作用;而“经验复用”机制的剥离,则会导致在涉及大规模表单收集的数据集上产生明显的质量滑坡。
值得一提的是,研究者还将底层模型替换为了不同参数规模的 Qwen 系列(如 Qwen3-32B 和 Qwen3.5-35B)。结果表明,WebSwarm 框架带来的增益并非高度绑定于某一个特定能力区间的模型。对于基础能力稍弱的模型,动态递归为其提供了急需的长程结构支撑;而对于原本原生搜索能力就很强的模型,精准的搜索模式分配与经验复用依然能榨取更多的深度与广度红利。
技术启示
WebSwarm 框架的提出,对目前正处于爆发期的 Agent 架构设计给出了一记清醒的提醒:真实的物理世界(哪怕只是它的数字映射——万维网)从来不是规则平滑的。企图依赖大语言模型在起跑线上就规划好一幅完美的全局任务分解图,是不切实际的。
放弃静态统筹,拥抱基于证据的渐进式动态推演;摒弃单一的协作套路,赋予每个局部节点定制化的执行模式与经验指导。这种深刻理解了“搜索是一个随着信息展开而不断自迭代过程”的设计哲学,不仅为攻克下一代深广交叉型网络搜寻任务指明了道路,也为未来在更为广阔的长周期复合任务(如代码开发、深度调研、科学探索)中设计鲁棒的智能体协同框架,提供了极具价值的参考样本。