SynWeaver:港科大打破任务轨迹割裂,仅822条合成数据登顶WebArena
SynWeaver: Website-Prior Task and Trajectory Co-Synthesis for Web Agents

在端到端网页智能体(Web Agent)的开发中,高质量的“任务-操作轨迹”训练数据一直是最大的瓶颈。纯人工标注耗时费力且难以规模化,而完全依靠大模型在网页中盲目探索合成数据,又常常陷入两难境地:大模型在不了解特定网站功能全貌的情况下,极易凭空捏造出现实中根本无法闭环的“幻觉任务”;而在后续轨迹探索受阻时,现存方案往往简单粗暴地根据执行痕迹反向篡改任务,把原本自然的用户需求改造成了充满流水账意味的操作步骤清单。
ArXiv URL:https://arxiv.org/abs/2608.12429v1
香港科技大学(HKUST)的研究团队在最新论文中提出了 SynWeaver 框架。这项研究的核心洞见在于:高质量的 Web Agent 训练数据不能由离散的任务和孤立的轨迹拼凑而成,而必须将“目标网站的拓扑先验”与“任务-轨迹的协同演化”结合起来。
该研究通过结构化建图捕获网站的功能状态,先让模型学习网站特定的 UI 先验,再在轨迹收集过程中双向动态修正任务意图与执行序列。实验表明,SynWeaver 仅用 822 条高质量合成数据,就在 WebArena 基准上全面超越了以往使用 1000 条轨迹训练的代表性基准方案,并在跨网站测试集 WebVoyager 上取得了显著的泛化优势。

从盲目漫步到网站拓扑制图
当前合成网页智能体交互数据的方案主要分为两类。一类是直接解析网络教程或帮助文档,虽然可行,但覆盖面严格受限于公开文档的质量和时效;另一类则是直接让智能体在目标网站上通过随机游走(Random Walk)或基于大模型的自由探索来挖掘数据。后者最大的硬伤是探索极其低效:智能体经常在相似的表层页面元素中打转,难以触及具备实质功能的深度交互状态。
为了让数据合成真正扎根于网站的实际交互能力,SynWeaver 的第一步是给目标网站绘制一张功能拓扑图 $\mathcal{G}=(\mathcal{S}, \mathcal{T})$。这里的节点 $s \in \mathcal{S}$ 代表页面在功能层面上彼此独立的离散状态,每个节点都完整保存了当前的截图以及底层的无障碍树(Accessibility Tree);而边 $\tau \in \mathcal{T}$ 则记录了使页面发生状态迁移的具体可执行操作。
为了避免智能体将动态轮播图、无关浮窗等视觉干扰误判为全新状态,研究团队设计了一套结合“渐进式状态比对”与“重复触发检测”的状态处理器。爬虫以深度优先搜索(DFS)的方式从网站首页展开探测,只有当页面产生实质功能变化时才递归建立新分支;当某个分支的交互探索完毕后,爬虫会恢复上一层上下文,继续遍历尚未执行的候选操作。这种建图方式在物理层面剔除了大量冗余轨迹,把目标网站压缩成一个包含真实可执行链路的紧凑拓扑空间。在 WebArena 的 5 个目标站点中,SynWeaver 最终提炼出了 559 个核心功能状态与 794 个有效转换边。
注入网站先验,终结“凭空造任务”
传统方法让大模型提出任务时,模型通常只能观察当前单张网页的截图,或是依赖极短的历史操作前缀。这种局部视角的局限性非常明显:模型经常基于页面上的某个字眼提出宏大任务,但执行下去才发现该功能在当前网站根本不可用或缺乏后置链路,从而产生大量无法完成的死任务。
SynWeaver 的解决之道是将建图阶段捕获的拓扑数据转化为多维度的监督信号,先训练一个具备网站特定先验的 UI 认知模型 $M_{ui}$。研究团队设计了页面级与交互转换级共计 5 类细粒度的监督格式:
-
页面整体理解维度:包含“页面宏观描述”,要求模型全面总结页面的内容骨架、排布与风格;以及“页面问答(Page QA)”,引导模型从密集的网页信息中做精准定向检索。
-
交互动作认知维度:利用 Set-of-Mark(SoM)对关键元素进行标记,让模型完成“元素功能描述”(预测标记元素的作用与可交互方式)、“正向状态转移描述”(给定当前动作,预测页面将如何变化)以及“逆向状态推理”(给定页面发生的前后对比,反推导致该变化的最可能操作)。
这些由较强教师模型标注的局部知识被汇聚成统一的先验数据集 $\mathcal{D}_{ui}$,通过 LoRA 对基座模型进行微调。经过这一阶段适应后,模型不再是一个对目标网站一无所知的通用聊天机器人,而是深刻理解了该网站到底包含哪些模块、点击哪个按钮会跳出什么弹窗的“站内专家”。在此基础上做逆向任务生成(从真实的转移三元组反推高层意图)时,模型生成的初始任务 $x_0$ 能够精确扎根于网站能力边界之内,从源头上遏制了幻觉任务的产生。
协同合成:拒绝让任务沦为操作流水账
在生成了初始任务 $x_0$ 后,接下来需要驱动教师模型在线执行并采集完整的操作轨迹。真实网络环境极其复杂,即使初始任务合理,模型也经常遭遇意料之外的阻碍:例如搜索特定的关键词返回空结果、目标评论已被删除、或者在复杂的表单提交前陷入死循环。
以往类似 SynthAgent 的方案通常采用解耦的修正策略:要么在执行中断时强行根据已经走过的步骤重写任务,要么在整条轨迹跑完后机械地修剪冗余步骤。这种割裂的修正往往会带来严重的不协调:任务为了迎合错误的执行轨迹,被层层追加琐碎的限制,最终变成类似“先点击右上方第三个按钮,再滑动到底部点击确定”的操作说明书,完全失去了人类自然指令的高维表达形态;更严重的是,当操作完全走入死胡同,单向修正任务根本无法让轨迹自愈。

如上图所示的案例,当初始任务要求寻找特定评论,但实际页面中并不存在该条目时,SynWeaver 触发了“协同精炼(Collaborative Refinement)”机制。系统并不孤立地修改任务或放弃轨迹,而是由更高阶的教师模型同时对当前任务意图 $x_t$ 与执行前缀 $h_t$ 进行联合优化:
-
任务调整:调用 $\operatorname{Update}(x_t)$ 将目标泛化为当前页面真实存在的内容(例如调整为查看并评价既有可见评论),确保任务具备在随后 2 至 3 步内闭环的可行性。
-
轨迹剪枝与重组:若保留全部历史操作会引入无效噪声,协同模型将执行 $\operatorname{Delete}(i)$ 剔除失效尝试的步骤,或通过 $\operatorname{Reorder}(i, j)$ 调整操作逻辑,并关键性地调用 $\operatorname{Update}(r_t)$ 重新覆写受影响步骤的思考链路(Reasoning),保证整段思维链的因果严密。
在完成在线协同生成后,所有样本还会进入一套严密的后验验证闭环:首先通过规则化启发式检测,强制要求必须有明确的终止动作、在预算步长内达成,并剔除死循环模式;未通过的样本则交给高级模型进行结构化重建,唯有反复验证合规的样本才会被收录入最终数据集。
数据效率碾压:822 条高质量轨迹的实战表现
为了验证合成数据的质量,研究团队在基准测试环境 WebArena(域内评测)和真实互联网评测集 WebVoyager(跨域评测)上进行了严格的对齐实验。
在 WebArena 评测中,基准方法(如 NNetNav、OS-Genesis、SynthAgent)均使用了 1000 条合成轨迹进行微调。为了排除模型初始化带来的偏差,所有对比方法统一建立在经过 SynWeaver 网站先验初始化的模型基础之上。最终,SynWeaver 仅保留了通过严苛验证的 822 条任务-轨迹对(累计 4500 步操作)。
| 评测基准 | 测试模型基座 | 原始基座(Vanilla) | 最强基线(SynthAgent) | SynWeaver(本文方案) | 相对最强基线增益 |
|---|---|---|---|---|---|
| WebArena (域内) | Qwen3-VL-8B-Instruct | 11.95% | 16.81% | 19.91% | +3.10% |
| WebArena (域内) | InternVL3-8B | 8.85% | 12.83% | 14.16% | +1.33% |
| WebVoyager (跨域) | Qwen3-VL-8B-Instruct | 13.40% | 22.42% | 27.06% | +4.64% |
实验数据清晰地表明,SynWeaver 在数据总量缩减近 18% 的前提下,不仅在 WebArena 上刷新了同量级开源模型的成功率上限,更在两款不同的开源多模态基座上保持了稳定提升。在 Shopping、Reddit、GitLab 等长流程、高交互度的复杂子站中,SynWeaver 的领先幅度尤为明显。
更值得关注的是其泛化性能。在包含了 Amazon、Apple、ArXiv 等 9 个全新真实互联网站点的 WebVoyager 盲测中,SynWeaver 训练出的模型成功率达到了 27.06%,一举甩开最强基线 4.64 个百分点。在 9 个子网站中,SynWeaver 在多达 7 个网站上夺得第一。这证明经过高质量协同数据训练的智能体,学到的是真正具备泛化价值的通用网络探索与推理能力,而非单纯对特定站点的机械过拟合。
关键机制的消融与任务质量探究
完整的消融实验进一步厘清了 SynWeaver 内部各模块的贡献度:
-
移除拓扑地图($-$Map):将 DFS 建图退化为传统的随机游走,整体成功率直接下滑 4.42 个百分点。缺乏全局状态拓扑,导致模型捕捉到的交互深度和覆盖面大幅缩水。
-
移除协同精炼($-$CR):退回传统的解耦单向修正,成功率剧烈暴跌 4.87 个百分点,在逻辑链路极强的 Reddit 和 GitLab 上跌幅更是分别高达 7.70 和 7.14。这证实了保持任务语义与轨迹行为一致性的绝对必要性。
-
移除后置验证与修复($-$PV):带来了全流程中最大的性能断崖,跌幅达 5.31 个百分点。这意味着未经严格筛查的噪声轨迹极易对智能体造成策略污染。

那么,微调得到的“网站先验”对任务提出的根本影响究竟在哪?研究团队对比了具备网站先验的模型与未经验证的通用大模型 Gemini-3.1-Pro 在同一批转移三元组上的提词表现。
从上方对比图可以看出,具备网站先验的 UI 认知模型所提出的任务,在 WebArena 各个站点上不仅最终能够跑通的成功率全面占优,而且在执行过程中所需要的任务调整次数明显更少。消融实验中若将先验模型替换回通用模型($-$WP),下游成功率也会从 19.91% 掉落至 17.70%。这印证了论文的核心判断:了解网站能力的模型提出来的任务才是扎实的,这直接决定了下游轨迹合成的效率与最终监督信号的纯度。
在多样性指标(NovelSum)评测中,由于摆脱了单点视野,基于网站地图生成的任务集合在所有邻域和密度权重设定下均显著领先于基线方法,彻底破除了以往依靠启发式扩充带来的语义重复问题。
总结与启示
SynWeaver 的成功不仅在于刷新了 WebArena 和 WebVoyager 的基准分数,更在于它指明了一条高效合成 Agent 数据的新路径。它向技术社区证明:在解决智能体与复杂数字环境的交互难题时,与其投入海量算力让通用大模型进行毫无先验的盲目试错,不如通过轻量级的拓扑探索先让系统理解环境边界,再辅以双向动态协同的轨迹生成与修复机制。
这种“用环境地图注入先验、用动态协同保障一致”的方法论,跳出了以往单向修补数据的窠臼,极大降低了对合成数据绝对规模的依赖。对于未来需要面向特定复杂工业软件、企业内网系统或私有化 Web 平台快速冷启动专用智能体的开发者而言,SynWeaver 所展示的高数据效率与结构化合成范式,提供了极具参考价值的工程落地蓝本。