CAP:跨108个网站实测!顶尖浏览器Agent最高成功率仅8.0%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在过去一年里,AI Agent 最受瞩目的落地场景无疑是网络浏览器。无论是各大模型厂商推出的通用操作助理,还是各类主打全自动操作的浏览器 Agent,都在演示视频中展现出了惊人的自主性:订机票、比价购物、搜集研报似乎都只需一句话。然而,一旦用户在真实生活场景中交出鼠标控制权,就会发现这些智能体频繁卡死在复杂的网页交互中,或者对图表、动态渲染的浮窗视而不见。

ArXiv URL:https://arxiv.org/abs/2608.08392v1

现有的 Agent 评测基准很大程度上掩盖了这一现实脱节。多数基准测试要么停留在单网站、点点链接和输入纯文本的低阶交互,要么仅依赖最终生成的文本答案进行粗粒度打分,根本无法精确定位 Agent 究竟是在哪一步操作翻车。来自清华大学、爱丁堡大学、澳门科技大学、东南大学等机构的研究团队联合提出了全新基准 CAP(Cross-site, complex Actions, and Perception),针对跨网站工作流、复杂 UI 操作以及动态视觉感知三大核心瓶颈展开全面评测。在涵盖 108 个真实网站的 420 个高难度任务评测中,包括前沿商业级产品在内的顶尖浏览器 Agent 遭遇了集体滑铁卢:即便表现最好的系统,任务完全成功率也仅有可怜的 8.0%。这项研究不仅揭开了当前浏览器 Agent 的能力底裤,也为社区提供了一套可规模化、可细粒度归因的评测范式。

CAP 框架总览与评测挑战

为什么现有基准测不出真实的浏览器交互?

评估浏览器 Agent 的核心难点在于,真实的人类上网行为绝非单次检索或孤立点击。以“挑选一款笔记本电脑”这一日常需求为例,用户通常需要在 BestBuy 上通过多级筛选器锁定配置与预算,在 Amazon 与 Target 之间横向对比实时库存与价格,细致阅读带星级的用户评价与差评折线,甚至还需要点开 YouTube 查看开箱视频中的接口细节与发热测试。

这种高度拟真的人类工作流存在两个长期被学术界忽视的交互维度。首先是动作复杂度(Execution Complexity)。现代网页布满了动态 UI 组件,例如拖拽地图选区、滑动日期与价格区间滑块、展开多层嵌套菜单、控制视频进度条等。这些操作远超基础的“点击元素”或“文本输入”,需要 Agent 对连续空间、拖拽手势和瞬态 UI 有精准的操纵能力。其次是视觉感知复杂度(Perception Complexity)。大量关键决策信息并不直接暴露在静态 DOM 树中,而是以数据图表、趋势折线、图像、重叠弹窗或动态 Canvas 的形式渲染在屏幕上。如果 Agent 缺乏细粒度的多模态视觉理解,就无法从动态渲染的内容中提取出结构化结论。

以往的 Web 评测基准普遍采取了折衷方案:要么将环境简化为静态快照沙箱,要么将任务局限在单一网站内。即便少数涉及多网站跳转的基准,其评测逻辑也往往停留在“黑盒模式”,只看最终输出的文本是否包含某些关键词,无法判断 Agent 究竟是真正执行了复杂的链条,还是仅仅碰巧从搜索引擎的摘要碎片中拼凑出了答案。这种评估方式不仅无法指导模型迭代,还常常给业界带来 Agent 已经高度成熟的虚假繁荣。CAP 的核心初衷,就是将评估镜头拉近到真实网页的每一次操作和每一处感知细节。

自动化任务合成:“分解-重构”管道

为了在真实互联网环境中构建具有代表性、高难度且规模可控的评测集,研究团队彻底摒弃了效率低下且容易引入主观偏差的人工手写任务模式,提出了一套自循环的分解与重构管线(Decomposition-and-Recomposition Pipeline)。

CAP 任务合成与数据构建管线

管线的第一步是网站卡片标注(Site Card Annotation)。团队首先梳理了日常网络浏览中最高频的 24 个功能领域,涵盖电商购物、旅游出行、学术检索、房产交易、代码托管、流媒体播放、医疗健康等。在每个领域中,依据 SimilarWeb 流量榜单挑选出头部网站,在剔除掉需要强制登录验证或严格封禁自动化访问的站点后,最终保留了 108 个代表性网站。随后,研究团队利用自动化浏览器探索工具对每个网站进行功能逆向解析,提取出面向用户的功能点 $\mathcal{F}$、复杂交互操作项 $\mathcal{A}$(如地图拖拽、滑块微调)以及感知挑战项 $\mathcal{P}$(如解析对比表格、识别图片细节),从而为每个网站沉淀出一张标准化的结构化网站卡片。这 108 张卡片共涵盖 1,167 项具体功能,几乎覆盖了常见 UI 交互与视觉感知类型的 90% 以上。

得到标准原子能力后,第二步是解决跨站任务的合理性难题,即功能亲和度聚类采样(Cluster Sampling)。如果随意拼接两个网站,生成的任务往往极其荒谬,例如在求职网站找工作后去流媒体网站找房源。为了模拟人类自然的信息流向,团队在领域集群之间计算功能亲和度矩阵 $\mathbf{M}$。例如,“学术检索”与“代码托管”具有极高亲和度,因为研究者通常是在查阅 arXiv 论文后去 GitHub 寻找开源复现;而“房产中介”与“代码托管”的亲和度则被压至极低。在生成任务时,算法会维护一个各领域被调用频率的历史统计值,优先选取被使用最少的领域作为锚点(Anchor),再依据亲和度矩阵为其动态匹配 3 至 6 个关联领域,从而在确保逻辑通顺的前提下极大拓展了任务组合的多样性。

在第三步的任务提炼与实例化(Task Proposal & Instantiation)阶段,大模型依据抽样出的领域卡片组合提出具体工作流假说。所有候选任务必须满足两个硬性标准:一是用户意图必须对应真实的现实诉求,绝非为了凑功能的生硬堆砌;二是跨站之间的信息依赖必须具有动态性,后续站点的输入必须依赖前序站点的实时操作产出,杜绝通过一次全网搜索直接“作弊”通关。经过严格的人工审核与清洗,团队最终构建出了包含 420 个高难度任务的基准集(公开发布 192 个,保留 228 个私有集用于防污染评测)。平均而言,每个任务横跨 3 个真实网站,且包含 7 个复杂交互动作与 4 处高难度视觉感知挑战点。

可验证评分树:终结 Agent 评测的“黑盒玄学”

面对跨站长程任务,传统的自动化评测机制面临两难困境:纯规则代码评测虽然客观,但为数百个复杂多变的开放任务手工编写验证脚本的成本呈爆炸式增长;而直接采用主流的 LLM-as-a-Judge 对最终文本打分,模型面对复杂的推导过程极易产生幻觉,甚至给出虚假的肯定。

为了破解这一难题,CAP 提出了一种可验证的 Agent-as-a-Judge 评估机制。这套机制的关键在于,不仅把大模型当作裁判,而且在评测前就将任务中的每一个复杂操作点和感知点映射成一棵严格的分层评分树(Hierarchical Rubric Tree)。

可验证的 Agent-as-a-Judge 评测机制与评分树

这套流程的运作原理严密而透明。在评测脚本生成阶段,代码生成模型会根据任务定义与预设的交互检查点,在受约束的安全 API 白名单与规范模板下,自动为每一个任务编写一段独立的 Python 评测脚本。脚本生成的评分树结构中,叶子节点被严格分为三类:动作节点($V_{\text{act}}$)用于核验 Agent 是否切实执行了特定的复杂 UI 操作;感知节点($V_{\text{perc}}$)用于检验 Agent 是否准确提取了以图像或图表形式展现的关键信息;格式节点($V_{\text{other}}$)则负责核验结构化输出格式。

尤为关键的是,评分树中的节点被赋予了逻辑依赖属性,分为关键节点(Critical)与非关键节点(Non-critical)。如果一个关键的前置操作(例如在过滤栏中选择正确的日期范围)未能通过验证,那么建立在其之上的所有下游子节点分数将直接被“一票否决”归零,只有非关键节点才允许部分得分。这种门控加权平均机制(Gate-then-Average)从底层杜绝了 Agent 靠瞎猜最终数字混取部分分数的可能。

在执行评分时,裁判 Agent 并不仅是在文本层面比对字符串,而是采用双重核验模式。对于提取类判定,裁判会解析结构化数据并运行范围判定、正则匹配等确定性逻辑;对于涉及具体网页内容的判定,裁判 Agent 会直接调取 Agent 在交互轨迹中引用的真实 URL 与网页截屏,展开跨模态与动态网页内容的比对,核实证据链是否成立。任何绕过实际网页交互、仅靠搜索片段臆造出的结论,都会在评分树的原子级核验中被精准揪出。

实验结果与诊断:全线溃败背后的真正短板

研究团队选取了当前最具代表性的 8 款浏览器 Agent 系统进行严苛测试,既包括 Manus、Genspark、Fellou 等面向大众商业落地的热门产品,也包括基于开源框架 Browser-Use 挂载顶尖基础模型的自主组合。

评测结果给整个行业敲响了警钟。在衡量端到端任务彻底闭环的“完全成功率”(Success Rate)指标上,所有被测系统的得分均呈现断崖式低迷。即便在测试中拔得头筹的最强商业系统,其成功率也仅有 8.0%;绝大多数成熟系统在该指标下的表现甚至跌落在 5% 以下,开源框架搭配顶级模型的组合在多步复杂交互面前更是频频失控。即使将考核标准放宽到反映任务推进程度的“部分完成度”(Partial Completion),顶尖系统的平均得分也仅在 30% 上下徘徊。

通过拆解评分树中动作叶子节点与感知叶子节点的得分表现,研究人员清晰绘制出了当前大模型 Agent 的能力断层线:

对未来 Agent 研究的启示

CAP 的诞生填补了浏览器 Agent 评测领域长期存在的颗粒度缺失。过去,由于缺乏能够细分到具体动作与感知环节的评估工具,模型开发者往往只能通过提高基础大模型的通用推理能力来被动期盼 Agent 性能的提升。而 CAP 的实验数据确凿地证明,单纯依靠语言逻辑能力的通用扩展,根本无法自动弥合复杂网页交互与动态屏幕感知的巨大鸿沟。

从架构设计的角度来看,未来的自主浏览器智能体至少需要在两个维度上完成进化。一方面,多模态地平线必须从静态图片理解真正跨越到底层 UI 画面的动态交互理解,模型需要学会像人类一样在瞬态变化的视觉视口中持续跟踪视觉锚点;另一方面,Agent 的规划层与执行层亟待解耦,上层的语义推理应当与底层的连续动作空间模拟(如精细的拖拽、滚动与时间延迟控制)形成更鲁棒的协同反馈循环。

CAP 构建的这套由 108 个网站卡片、动态重构管道以及可验证评分树组成的评估生态,为智能体走向真正的全自动网络助手树立了一把严苛却极具指导价值的标尺。8.0% 的成功率虽然残酷,但正是这种撕开滤镜的真实诊断,才指明了下一代大模型 Agent 攻坚克难的必经之路。