Web Agent动态路由陷阱:5种策略实测告负,越需要路由反而越学不会
Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

在构建基于大语言模型的自主网页智能体(Web Agent)时,一个长期困扰开发者的底层设计决策是:到底应该给模型看什么?主流做法通常将浏览器环境表征划分为三类:纯文本的无障碍树或 DOM、纯像素的页面截图,以及在截图上标注数字标签的 Set-of-Marks(SoM)混合模式。现有的评测基准,如 VisualWebArena 与 WebArena,几乎无一例外在构建系统之初就替所有任务固定了单一表征通道。
ArXiv URL:https://arxiv.org/abs/2608.06171v1
很自然的直觉是:既然不同网页的结构千差万别,有些极度依赖视觉渲染,有些则用纯文本就能精准定位,为什么不设计一个自适应路由器(Router),根据任务指令动态挑选最适合的观察表征?在许多人的设想中,这种表征层面的动态路由理应带来性能的大幅跃升。来自 Holistic AI 与伦敦大学学院(UCL)的研究团队针对这一假设展开了极其严谨的度量研究,却得出了一个极具颠覆性且让人清醒的结论:现阶段为 Web Agent 做表征动态路由,几乎是一场徒劳。
研究测试了 5 种不同范式的路由策略,结果无一例外:没有任何一种路由策略能够稳健地击败简单固定一个经过良好挑选的单一模式。更残酷的是,表面上看似高达几十个百分点的路由提升理论上限(Oracle),在剥除实验重跑噪声后几乎完全蒸发。作者不仅在工程层面指出了当前智能体评测中严重的重跑反转现象,更在理论层面揭示了一个致命死结——路由机制最能创造价值的地方,恰恰是它在统计上最不可学习的地方。

表象的繁荣:互补的表征与虚高的理论上限
构建动态路由的前提,是候选通道之间必须存在真正的互补性。如果纯文本模式能解决的问题完全覆盖了纯视觉模式,那么路由就失去了选择的意义。为了严格控制变量,研究团队锁定了统一的执行脚手架:每一步调用一次模型,输出包含思考过程、置信度和动作参数的 JSON,历史记录仅保留前 8 步的客观动作与页面反馈,彻底剥离外挂规划器、长期记忆或重试机制的干扰。在 8 种“任务网站 $\times$ 基础模型”的组合(Cell)中,研究者系统对比了 6 种观察模式。
数据表明,表征通道之间的互补性在表象上极为显著。在全部 48 组“模式-基准组合”中,有 44 组都成功解决过其他模式完全无法解决的任务,没有任何一种模式处于绝对支配地位。当两种通道在某个任务上出现“一胜一败”时,失败的一方往往表现出截然不同的结构性缺陷。例如纯视觉模式通过屏幕绝对坐标进行交互,其有效点击率显著低于基于元素 ID 的文本派发机制;而在某些需要频繁滚动且依赖视觉布局的论坛场景下,纯视觉模式的滚动频率能够达到 SoM 模式的 8 倍。
更为关键的是,哪种表征最优并不是通用的系统属性,而是强依赖于部署环境。在分类广告网站上,图文结合的 SoM 混合模式凭借 8.04 到 9.82 个百分点的优势领跑;但换到 WebArena 的通用场景下,不带任何图像的纯文本 DOM 模式反而反超了 4.81 个百分点。
如果基于这些互补数据构建一个完美的“先知路由器”(Outcome Oracle)——即对每一个具体任务都精准选择能够跑通的那种模式,账面上的理论最高成功率可以从单一最佳模式的 2.2%–35.6% 骤增至 7.1%–51.9%。从数字上看,动态路由的潜在收益大得令人兴奋。
戳破幻觉:重跑噪声吞噬了所谓的表征红利
然而,这种高达数十个百分点的 Oracle 增益存在严重的度量漏洞。上述理论上限的本质是“多臂联合”(Multi-arm Union):只要 6 种模式中任意一次运行成功,该任务就被计为解决,而作为对比基准的单一模式却只给了一次机会。
为了检验这种增益到底来自表征的多样性,还是仅仅来自于随机试验的次数累加,研究团队执行了最为严酷的对照实验:在完全相同的参数配置、固定的随机种子以及贪婪解码(Temperature=0)条件下,让完全相同的模式在同一批任务上重新跑一遍(Rerun)。
实验测出了令人震惊的评测不稳定性:
-
仅仅重跑一次相同的实验条件,就有高达 12.1% 到 14.3% 的任务执行结果发生了反转。
-
在三次重复运行中,有 22% 的任务在至少一次运行中改变了胜负结果。
-
这种结果的不确定性并不是均匀分布的,而是高度集中在那些“至少有两种模式可以解决”的任务上,这些任务的重跑反转率高达 48%–52%,而在其余任务上仅为 2.9%。
这意味着,让同一个模式多跑一次所带来的成功集合扩张,与额外引入一种全新的视觉表征所带来的收益几乎完全一致。那些看似因为“视觉表征弥补了文本缺陷”而解出来的任务,很大一部分不过是智能体在不可复现的环境扰动中偶然撞大运成功的产物。
造成这种重跑差异的根源并非模型生成的随机采样,而是系统运行时的固有漂移。其一是底层元素标识符的抖动(Element-id Churn):无障碍树依赖于浏览器动态赋予的节点 ID,在页面结构极其微妙的重绘下,这些 ID 的变动会导致基础模型在 12.5% 到 20.0% 的单步决策中改变交互选择。其二是商用闭源模型服务端的动态路由与批处理差异,以及长链路任务中环境状态累积的微小网络延迟漂移。
在统计学上,如果两个独立运行之间的反转任务数为 $d$,在可交换性假设下的标准差为 $\sqrt{d}/n$。经过严格测算,该评测体系的最小分辨阈值(Resolution Threshold)落在了 3.8 到 4.2 个百分点之间。任何宣称低于 4 个百分点的提升,本质上都没有冲破评测工具本身的噪声底噪。在剥离掉这层随机重跑带来的虚假增益后,原本耀眼的表征多样性红利所剩无几。
真正存活的理论上限:成本边界而非成功率
既然追求更高的成功率被证明大部分是噪声幻觉,那么在考虑运行噪声的前提下,对表征进行动态分流是否还有保留价值?研究给出了一道唯一的、在统计检验下存活下来的上限:成本边界(Cost Bound)。
在实际生产环境中,不同表征通道的调用开销差异悬殊。纯文本 DOM 模式消耗的上下文 Token 相对较少,更不涉及多模态图像编码的高昂开销;而高分辨率的 SoM 或纯截图模式不仅每一步都要消耗高密度的视觉 Token,还会显著拉长模型的推理耗时。
由于智能体整体能力有限,大量极具挑战性的网页任务实际上是当前模型在任何表征模式下都无法跑通的。如果存在一个能够预判“无论如何都无法成功”的分类器,在任务刚开始时,直接将这些死局任务分流给开销最低的纯文本通道,就可以在完全不牺牲总体成功率的前提下大幅缩减开销。
实验表明,这种将死局任务路由至最廉价通道的策略,在全部 8 个实验组合中无一例外地实现了稳健的成本优化,整体账面开销下降了 9.5% 至 30.6%。这才是动态路由在当前技术条件下真正具有工程确定性的价值天花板:它不是用来拔高智能体能力上限的放大器,而是用来做无效探索阻断的节流阀。
5 种路由策略全盘告负:死于机制而非算法
为了探索这个成本边界能否在实际工程中变现,研究团队构建了覆盖当前主流设计思路的 5 种路由策略,并在全部基准上进行了端到端的策略对比:
-
模式挑选路由(Mode Selector):直接根据任务初始文本,训练分类器预测该任务在哪个通道下最可能成功。
-
成本分流策略(Learned Triage):先评估任务难度,决定是否值得为该任务调用昂贵的多模态高阶表征。
-
零 Token 规则匹配(Zero-token Rule):无需模型推理,直接利用规则检测任务文本中是否显式包含视觉先验词汇(例如颜色、相对方位、无障碍树未涵盖的图标样式等)。
-
置信度级联(Confidence Cascade):优先使用廉价模式尝试,根据模型单步输出的自我置信度评分,一旦低于阈值则动态切换升级到昂贵模式。
-
合并成本分层策略(Pooled Cost Tiers):跨任务池的大规模离线收益配比。
残酷的实验结果显示:没有一种策略能够稳定地优于“无脑固定在最便宜模式”或“固定在综合表现最好的单一模式”。哪怕在极少数配置下某项策略在数值上微弱跑赢固定基线,经过多重假设检验校正以及噪声带宽比对后,也均落入了不可信的偶然区间。
这 5 种策略的集体溃败并非源于单一原因,而是遭遇了各自致命的结构性阻碍:
首先,直接挑选模式的分类器死于监督信号匮乏。由于智能体整体成功率较低,能够同时标注“通道 A 成功且通道 B 失败”的黄金样本极其稀缺,路由分类器在极度不平衡且伴随高噪声的数据分布上根本无法拟合出有效的泛化边界。
其次,基于置信度的级联机制死于模型校准失效。大模型在网页操作中的自我置信度评分极其虚高,即便在步骤完全走偏、页面疯狂报错的情况下,模型汇报的置信分数依然保持在危险的高位,导致降级与重试机制几乎从未在正确的时机被触发。
最具有讽刺意味的是基于规则的“零 Token 匹配”。研究人员虽然通过文本匹配捕捉到了近乎完美的视觉信号指示(例如当指令要求点击“红色的按钮”时),但这一策略依然输给了固定模式。原因在于,即便把包含视觉词汇的任务派发给昂贵的多模态视觉通道,视觉通道本身的执行准确率依然不够高;与此同时,昂贵通道在不需要视觉信息的常规任务上也具备极好的通用兼容性,强行基于关键词分流反而打乱了原本全局最优通道的执行节奏。
核心死结:越需要路由的地方,越缺乏监督信号
这项研究提炼出的最核心洞察,超越了具体的代码实现,直指多模态智能体路由体系的深层统计悖论。
在传统的大语言模型模型级路由(Model Routing)中,路由器是在一个明确的“能力梯度”上做决策——即大参数模型在通用能力上确实全方位碾压小模型,任务的内在难度通常能有效预测何时需要升级模型。然而在 Web Agent 的表征路由中,底层模型是同一套,并不存在天然的能力梯度;不同表征的成功与否,完全取决于智能体动作序列与特定网页交互环境之间复杂的动力学演化。
这就引发了一个根本性的恶性循环:路由器的监督信号是严格以智能体自身的任务成功率为产出速率的。
智能体在某个领域的能力越孱弱、成功率越低,外部能够采集到的“成功执行”的正向监督标签就越贫瘠;但在统计学意义上,只有在智能体极易失败的低成功率区间,动态路由纠偏与分流的潜在边际价值才最高。
数据展现了极具说服力的线性关联:各个子环境中的有效路由学习标签供给量,与该环境下动态路由所能发挥的潜在收益之间,呈现出高达 0.95 的极端正相关。在最需要路由器力挽狂澜的困难战场,路由器根本没有足够的高质量样本用来学习;而在路由器拥有海量成功样本可以学得非常精准的简单领域,智能体随便用哪个模式都能跑通,路由本身又失去了存在的经济价值。
重新审视 Web Agent 的评测范式
这项工作为当下火热的 Web Agent 研究敲响了一记警钟。过去大量论文习惯于将 1 到 2 个百分点的微弱提升归功于精心设计的提示词工程、动作记忆模块或局部动态机制,但在 3.8 到 4.2 个百分点的系统重跑噪声面前,这些所谓的“突破”很可能只是测试集微小扰动下的假象。
此外,当前主流基准(如 WebArena 系列)所采用的纯二元打分机制(全对算 1,任何中间失误都判 0)也极大地加剧了这种恶性循环。缺乏细粒度的连续奖励和状态级监督,使得任何复杂的路由策略在冷启动阶段都像是在黑盒中盲人摸象。
研究团队并不否定动态路由的长期潜力,但他们明确指出:这个死结是属于当下弱智能体时代的产物,而非路由机制本身的数学终局。想要打破这一困局,唯一的出路不在于在现有的低成功率基准上继续空转精细的路由算法,而在于基础模型自身执行能力的质变。只有当底层 Agent 的通用执行成功率跨越及格线,能够稳定、充沛地自我生成各通道的有效对齐轨迹时,表征路由这把手术刀才能真正获得它所依赖的养分。在那一天到来之前,老老实实选定一个经过环境适配的固定表征,把算力留给更底层的推理与规划,或许才是工业界和学术界更为务实的技术选择。