Wuying-Browser-Agent:结合课程微调与在线RL,长序列网页控制WebVoyager达80.6%!
Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

在短上下文和干净的演示数据上,现有的大语言模型网页智能体(Browser Agent)已经展现出令人惊艳的性能。然而,当这些智能体真正被部署到现实世界的动态网页中时,它们的表现往往会遭遇滑铁卢。真实的网页任务要求智能体在不断变化的页面上持续做出数十次决策,处理复杂的交互控件,并在偏离目标时具备自我纠错与恢复的能力。
ArXiv URL:https://arxiv.org/abs/2608.17319v1
针对这一现实部署与实验室基准之间的巨大鸿沟,研究者明确指出:单纯依靠模型参数规模的扩大,无法弥补真实场景中长序列控制的缺陷。要真正解决这一问题,必须在执行环境、监督信号、优化算法和评估基准四个层面上进行全链路的重新对齐。为此,研究团队推出了 Wuying-Browser-Agent 统一框架。
该框架不仅确立了全新的开源最优水平(SOTA)——其 27B 版本在 WebVoyager 上达到了 80.6% 的成功率,在全新的复杂长序列基准 BrowserBench 上也实现了 65.1% 的突破,还通过引入 RUIC-SFT(反射与UI专用课程微调)和 DAO-GRPO(散度感知在线强化学习)两大核心机制,从根本上重构了智能体在错误恢复和长线信用分配上的学习范式。
真实网页部署面临的三大结构性挑战
在深入解析 Wuying-Browser-Agent 的核心机制之前,我们必须先理解当前网页智能体在长序列(Long-Horizon)任务中究竟卡在了哪里。通过对大量失败轨迹的分析,研究者揭示了三个紧密咬合的结构性挑战。

第一个挑战在于训练数据的分布盲区。当前网页智能体的训练数据绝大多数来源于成功的演示轨迹。然而,在真实的长序列网页任务中,遇到意外的重定向、页面瞬态变化或是复杂的 UI 控件(如日期选择器、级联菜单)几乎是不可避免的。当模型不可避免地犯错并偏离既定路线时,基于“纯成功数据”训练出的模型完全不知道如何纠正错误。研究发现,基础的监督微调模型只能从 8.5% 的错误步骤中恢复。这说明问题的本质不是“数据不够多”,而是严重缺乏关于“如何从错误中恢复”以及“如何应对低频复杂 UI”的结构性监督信号。
第二个挑战是长序列优化中的信用分配(Credit Assignment)难题。一旦智能体犯错且未能及时恢复,整个交互轨迹就会被无限拉长。在几十步的网页操作中,许多失败的轨迹和成功的轨迹在极长的前缀序列上是完全一致的,成败往往取决于少数几个关键的分支决策节点。如果采用统一的轨迹级优化方式,监督信号就会被稀释在冗长的共享步骤中,难以精准聚焦于那些真正决定成败的关键动作。更棘手的是,网页状态本身具有非追加性(Not append-only):一次跳转就会使之前的 DOM 树失效,如果强迫策略网络在一个不断膨胀的全局历史文本上进行推理,不仅会让模型在最长轨迹处消耗极高的 Token 成本,还会引入大量过时的干扰状态。
第三个挑战则直接指向了现有的评估体系。当前的在线基准测试绝大多数是以英语为中心,且偏向于步骤较短的任务。这使得一些看似在当前榜单上表现优异的智能体,在面对部署环境中主导的、更具组合性的长工作流时,依然会显得脆弱不堪。为了能够在大规模部署环境中可靠地衡量智能体的能力,缺乏一个针对长序列、双语以及真实复杂网页的评估套件,成为了阻碍该领域发展的重要瓶颈。
统一执行基座:结构化网页控制环境
为了应对上述挑战,Wuying-Browser-Agent 的底层并没有直接让大模型与原始网页代码“裸奔”交互,而是精心设计了一个结构化的网页控制环境层(Browser Harness Layer)。这个执行基座在监督微调、在线强化学习以及最终评估中保持完全一致。
在这一层中,研究者定义了一个包含 24 种原子操作的结构化工具空间,涵盖了导航、交互、内容提取、文件操作以及流程控制等五大类别。在每一个交互步骤 $t$,环境会提供一个结构化的观测值 $o_{t}$。这个观测值主要由当前页面的结构化 DOM 构成(保留可见的交互元素,剔除无关内容);当单纯的文本 DOM 无法满足视觉对齐需求时(例如需要理解视觉布局或图像线索),环境还会额外提供视口截图 $V_{t}$。
更为关键的是其面向决策的上下文管理机制。决策上下文 $c_{t}$ 并不是简单地将所有历史 DOM 拼接在一起,而是通过特定的重建算子提取当前指令、当前有效观测、历史关键动作以及环境反馈。如果模型生成了不符合预设工具模式的无效调用,环境不会默默崩溃,而是会拒绝执行并返回强类型的错误反馈信息 $e_{t}$。这使得模型能够在下一次生成时,根据环境报错进行自我修正。这种紧耦合的感知-决策-执行循环,构成了后续所有高级训练策略的物理基础。
RUIC-SFT:重构监督初始化的鲁棒性
传统的监督微调(SFT)仅仅告诉模型“走正确的路”,而 Wuying-Browser-Agent 引入的 RUIC-SFT(Reflection and UI-specialized Curriculum SFT)旨在赋予模型“在充满泥泞的真实网页中纠错生存”的能力。
单纯增加通用网页轨迹的规模,并不能解决模型遇到复杂控件就“卡壳”、遇到报错就“崩溃”的问题。因为在自然收集的数据中,复杂的 UI 控件(如多级联动的下拉菜单、富文本编辑器)出现的频率过低,且交互模式与普通的文本框截然不同。为此,研究者在通用数据之外,针对性地构建了两类特殊监督数据:
一类是反射数据集(Reflection Dataset)。这类数据专门围绕错误节点展开。数据中不仅记录了导致错误的动作和系统返回的报错观测,还包含了一段自然语言的“反射”(解释为什么当前动作在当前页面状态下是不合理的),以及一套能够让智能体重新回到正确执行路径的“纠错策略”。通过在沙盒中对这些纠错策略进行验证,模型在训练时不再只是被动模仿,而是学会了如何将意外观测视为偏离路径的信号,并生成有理有据的恢复动作。
另一类是专用 UI 组件数据集。该数据集通过系统性的收集,密集地向模型展示那些长尾但又极其关键的复杂控件交互模式。这极大地降低了模型在面对罕见前端框架或复杂层级菜单时的动作不确定性。

为了让模型平稳地吸收这些“硬核”知识,研究者设计了一个精巧的三阶段课程微调策略(Curriculum Schedule)。在第一阶段,训练数据以通用网页操作为主,旨在稳固基础的浏览执行先验;随着训练推进到第二阶段,系统逐步增加专用 UI 数据的比例,以此强化模型处理复杂交互的能力;到了最后的第三阶段,反射数据集才被大规模引入。这种分段线性的数据混合策略,既培养了模型强大的自我纠错能力,又避免了过早引入错误状态导致基础执行逻辑的“灾难性遗忘”。
DAO-GRPO:专为长序列设计的在线强化学习
在获得稳健的初始化模型后,接下来要解决的就是如何在真实的交互环境中进一步压榨策略的上限。近年来,基于结果的强化学习在推理任务上大放异彩,但在网页控制领域,奖励极其稀疏(往往只有在最后一步才知道任务是否完成),长序列信用分配难如登天。
为了攻克这一难题,研究者提出了 DAO-GRPO(Divergence-Aware Online GRPO),这是一种专为网页长序列控制定制的在线强化学习框架。

DAO-GRPO 引入了两个极其重要的机制来改造传统强化学习。首先,它采用了基于势能的奖励塑形(Potential-based Reward Shaping)。由于终端奖励过于稀疏,智能体在漫长的探索中极易迷失。通过引入密集的进度监督信号,智能体在每向目标推进一步时都能获得即时的正向反馈,这在不改变最优策略数学特性的前提下,极大缓解了长序列探索的盲目性。
其次,为了解决长序列中大量冗余前缀稀释学习信号的问题,DAO-GRPO 引入了散度感知的步骤加权(Divergence-Aware Step Weighting)。该机制利用基于大语言模型的散度检测器,精准定位出轨迹中那些真正导致不同结局的“分叉点”(Branch-defining decisions)。在更新策略时,算法会赋予这些具有高行为信息量的关键节点更大的权重,而降低那些在所有轨迹中都相同的常规操作的权重。
这样一来,强化学习的优化资源被好钢用在刀刃上,模型不仅学得快,还能真正搞懂到底是在哪一个不起眼的步骤导致了最终任务的失败。并且,其响应级别的目标函数完全适配于网页上下文中 DOM 树动态重建的特性,确保了决策时的信息流与真实部署完全一致。
BrowserBench 与突破性的实验结果
在评估体系上,论文明确表明,仅依靠短序列基准无法暴露出长序列失效模式。因此,研究团队推出了 BrowserBench。这是一个包含 350 个真实双语(中英)网页任务的长序列评估基准,平均任务长度高达 37.9 步,横跨 254 个真实网站。相比于之前的测试集,BrowserBench 以目标为导向,任务设定更贴近复杂的现实工作流。
实验结果强有力地证明了整个框架的有效性。在参数规模达到 27B 时,Wuying-Browser-Agent 在多项权威指标上实现了断层式的领先。

从整体性能对比来看,Wuying-Browser-Agent-27B 在 WebVoyager 在线基准上达到了 80.6% 的高分,在动态环境更苛刻的 Online-Mind2Web 上取得了 66.7% 的成绩,而在自身构建的极限长序列基准 BrowserBench 上也实现了 65.1% 的成功率。这些关键数据标志着,在真实场景导向的网页控制领域,该工作确立了新的开源最优状态。
更令人瞩目的是,得益于底层结构化控制层(Harness Layer)带来的通用工具操作规范约束,这种网页专用训练并没有损害模型的泛化能力。相反,模型将基于底层规范和错误反馈的交互习惯,成功迁移到了网页之外的更广泛的通用智能体基准中。在包含 Tau2-Bench、Claw-Eval 和 BFCL-v4 等综合通用能力的评估中,该模型取得了平均 73.8 分的傲人成绩,远超多个专用的计算机控制(Computer-use)基准模型。
通过详尽的消融实验与定性分析,研究者发现,RUIC-SFT 在涉及恢复相关以及复杂 UI 任务上的增益尤为显著;而 DAO-GRPO 的引入,则使得模型在面对高难度、超长轨迹任务时的能力得到了进一步的爆发式增长。这完美印证了框架设计的初衷:随着任务链条变长,模型不再是僵化地走到黑,而是学会了从环境反馈中敏锐地察觉偏航,自主修正页面假设,并在单一回合内完成逆转恢复。
总而言之,Wuying-Browser-Agent 并非只是对大模型进行了一次常规的微调,它深入解析了阻碍网页智能体真正落地的结构性症结,并从执行环境、监督范式、强化学习优化到基准评估提供了一整套严密的解法。对于未来希望让 AI 智能体代替人类完成复杂网上办事流程、自动化跨网页工作流的研究与工业落地而言,这项研究无疑指明了一条高度务实且极具潜力的技术路径。