SeekJudge:解耦定位与提取,首个在强化学习中超越规则奖励的智能体裁判

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

SeekJudge:解耦定位与提取,首个在强化学习中超越规则奖励的智能体裁判 论文图示

在图形用户界面(GUI)中执行长流程任务的计算机操作智能体(Computer-Use Agents, CUA),正在成为大模型走向通用落地的关键路径。然而,在这个充满未知动作与动态界面的领域中,强化学习(RL)长期受困于一个底层瓶颈:系统如何客观判定智能体的一长串操作到底有没有真正完成人类的意图?

ArXiv URL:https://arxiv.org/abs/2607.23263v1

长期以来,整个领域不得不依赖硬编码的规则验证器(Rule-based evaluation)。这种基于环境内部状态或 DOM/API 的规则校验存在天然缺陷:它无法枚举用户多元且合理的解决路径,往往与真实意图脱节;应用程序一旦前端改版或接口更新,规则就会直接报废;在线动态内容的更新,更会让预设的标准答案迅速失效。为了打破规则的枷锁,研究界近年来尝试转向基于大模型的裁判(Model-based judges),但此前的方案始终存在一道难以逾越的鸿沟——在严谨的在线强化学习训练中,模型裁判驱动的智能体在泛化性能上从未真正战胜过原生规则奖励,且推理成本和延迟极为高昂。

由罗切斯特大学与浙江大学联合提出的 SeekJudge 框架首次打破了这一僵局。该研究跳出把数十上百张历史截图一次性塞进视觉语言模型(VLM)的传统直觉,揭示出“轨迹内相似图像竞争带来的信息干扰”才是模型判断失效的元凶。SeekJudge 将轨迹判定系统性解耦为粗粒度的“定位”与细粒度的“提取”,并由单一 9B 参数的开源模型分饰四个职能角色,配合创新的异步预取奖励服务架构,以极低成本实现了步级(step-level)的高保真奖励建模。实验表明,在最具说服力的下游环境泛化测试中,SeekJudge 成为首个在在线强化学习闭环中追平乃至超越原生规则监督的实用化模型裁判。

规则奖励的局限与多图输入的“注意力诅咒”

要理解 SeekJudge 的切入点,必须先审视计算机操作任务评估的特殊复杂性。与传统单轮视觉问答或代码生成不同,操作智能体与桌面的交互通常包含漫长的轨迹。在 OSWorld 等真实桌面基准中,一个工作流往往动辄耗费数十步甚至上百步交互。为了训练智能体,研究人员必须为环境配备判定逻辑。

基于规则的检查器虽然看似客观,却存在三大难以调和的结构性矛盾:第一是意图错配。现实中满足人类目标的解法往往不止一种,例如在幻灯片中绘制图形或排版文档,合格的呈现方式是开放且无界的,有限的硬编码规则根本无法穷举。第二是环境脆弱性。规则通常需要挂钩特定的底层 API、辅助功能树(Accessibility Tree)或内部数据结构,这意味着每接入一个新软件或软件更新一个版本,就必须重写解析器。第三是真值漂移。一旦任务涉及在线服务,网页结构或搜索结果的变化就会让原先写死的基准答案彻底过时。

然而,现存的模型裁判之所以未能取而代之,是因为它们陷入了另一种工程陷阱:简单粗暴地将整条轨迹的多张截图一股脑拼接到同一个上下文窗口中。直觉上,模型看到完整轨迹似乎能获得全局视野,但论文通过极其严格的受控实验揭示了一个被广泛忽视的现象——多图信息噪声(Multi-Image Information Noise)

在控制关键判定截图始终存在的前提下,研究者向上下文逐步填充同轨迹的其他历史截图,模型的判定 F1 分数随着图片数量的增加急剧下滑。令人深思的是,如果向上下文中填充等量 Token 消耗的无信息噪声图像,模型的准确率反而几乎不受影响。这一对比决定性地证明:性能衰退的根源绝非单纯的上下文长度扩展,而是来自同一交互界面在不同时间步上的高度相似性。这些相互竞争的视觉线索稀释了决定性证据的注意力分配,诱发了模型对关键细粒度差异的幻觉,最终导致裁判失准。

角色解耦:Seek-Analyze 循环与单一骨干网络

针对这一根源,SeekJudge 的核心洞察是:长轨迹评判本质上是由两个性质完全不同的子任务复合而成的——负责锁定哪一步截图包含决定性证据的定位(Localization),以及负责从该截图高保真读取细节的提取(Extraction)

将定位与提取拆解后,SeekJudge 构建了四个角色分工明确的智能体协作体系,令人瞩目地是,这四个角色并不需要维护四个不同的大模型,而是全部由同一个经过专门蒸馏的 9B 稠密视觉模型作为共享骨干驱动:

  1. Condense Agent(压缩智能体):按时间顺序滑动观察动作前后的成对截图,用数行紧凑的自然语言描述该步交互引起的界面状态跃迁,生成时间线中的状态转移记录 $T$。

  2. Ground Agent(对齐智能体):观察动作发生后的屏幕截图与智能体发出的原始底层指令(如点击坐标 click 128, 453),在截图中精确定位这一物理操作实际触达的 UI 控件,生成时间线中的操作对齐记录 $A$。

  3. Seek Agent(搜索控制器):它是整个裁判框架中唯一维护跨轮状态的中枢大脑。它首先阅读由 $T$ 和 $A$ 交叉构成的轻量级文本时间线。当时间线信息足以定性时,它直接输出最终裁决;当关键事实存疑时,它会精确指定某一具体步骤和图像 ID,向分析智能体抛出一个高度聚焦的定向问题,并将返回的信息增量追加到自身上下文中,进入下一轮迭代。

  4. Analyze Agent(分析智能体):扮演无状态的高保真信息提取工具。它每一次被调用都只接收 Seek Agent 提出的那一个具体问题以及对应的那单张高清截图,完全屏蔽整条轨迹其他数百张图片的视觉干扰,在极小的纯净上下文中精确读取界面细微状态并以文本作答。

这种架构设计带来了双重突破。在准确度层面,关键证据的读取始终在单图环境中完成,彻底规避了同轨迹图像竞争带来的幻觉;在扩展性层面,庞大且动辄吞噬数万 Token 的底层辅助功能树(Accessibility Tree)或百步长图序列,被浓缩为轻量的文本摘要,单次模型调用的上下文长度相比以往端到端模型裁判缩减了 4 到 6 倍。这意味着计算量不再与轨迹长度发生二次爆炸,面对数百步的长程工作流依然能够从容应对,并且能够根据任务难度自适应决定交互轮数——简单任务几轮定案,复杂任务深度追查。

种子校准蒸馏:如何用 9B 模型超越闭源大模型

让一个小体积的 9B 模型同时胜任四种能力迥异的角色,并在推理中给出具备可解释性的步级反馈,离不开高质量的监督数据构造。论文为此设计了种子校准蒸馏管线(Seed-Calibrated Distillation)

在评分标签的设计上,研究团队摒弃了传统非黑即白的二元胜负标签。粗糙的二分类不仅丢失了完成进度的丰富阶梯信号,更无法区分完全失败与由于微小失误导致的失败。SeekJudge 将轨迹裁决细化为 7 个维度的打分(每个维度均为 0-100 分),同时在步骤级别引入了 9 种精细分类,区分建设性进展、冗余探索、致命误触等多种状态。

在数据生成阶段,整个管线分为种子校准与大规模蒸馏两步走。在“种子阶段”,团队首先由专业人类对极小规模轨迹进行高质量穷尽标注,随后借助基于 Claude Code 的自动化 Prompt 迭代搜索,优化用于生成 7 维度评分与步级类别的标准提示词(criteria prompt),迫使大参数模型输出的人类打分对齐程度达到极高阈值。接着,针对 Seek Agent 的决策逻辑,利用具备代码与逻辑推理能力的顶尖模型构建进展描述基准,迭代优化控制器的搜索与停止策略。在“训练阶段”,固定打磨成熟的提示词体系,使用 DeepSeek V3.2 负责语言逻辑调度、Gemini 3.0 Flash 负责视觉抽取,运行完整的协同流程,并将所有角色在各节点的输入输出完整沉淀为多角色蒸馏数据集。

在最终输出标量奖励时,框架使用一个在人类锚定数据集上轻量拟合的梯度提升回归器,将 7 个维度的得分投影为一个综合标量分;对于强化学习过程,则通过预设的人类先验矩阵将 9 种步骤类别转化为步级奖励,实现了对智能体交互轨迹细密、连贯的过程监督。

突破算力瓶颈:流式无状态的异步预取服务架构

在强化学习的工程落地中,模型裁判不仅要“判得准”,更要“判得快”且“跑得起”。如果环境交互采样 1 秒,而模型裁判为了评判一条 50 步的轨迹需要停机思考 20 秒,整个强化学习的吞吐量将陷入停滞。

为此,SeekJudge 在奖励服务器架构上做出了一项极具普适性的工程革新:与 Rollout 重叠的异步预取机制(Rollout-Overlapped, Zero-Client-State Server)

在传统 RL 流程中,轨迹评判通常是一个完全串行的阻塞过程——智能体必须把整条交互跑完,将完整录像移交给奖励模型,训练进程随后陷入等待。但 SeekJudge 团队敏锐地发现:Condense 和 Ground 两个角色的工作是纯局部的,第 $t$ 步执行完后,该步的状态变化和元素对齐就已经确定,完全不需要依赖后续的 $t+1$ 步。

研究团队因此重构了交互与裁判的时序关系。当智能体与 GUI 环境进行真实的物理动作执行、等待页面加载或网络响应时,GPU 往往处于短暂的闲置空窗期。SeekJudge 的架构将 Condense 和 Ground 的前置计算无缝打散、调度进这些碎片化的空闲窗口中,在智能体一边探索环境的同时,后台已经完成了该步状态转移的文本化与坐标对齐。

更为精妙的是客户端的零状态设计(Zero Client State)。在分布式训练集群中,保持 RL 客户端与奖励服务器之间的时序同步通常极其痛苦且极易死锁。SeekJudge 允许 RL 训练端完全不维护任何奖励相关的状态机,仅需以异步流式(streaming)的方式,在每步生成后无脑向服务器推送乱序的截屏与动作数据。服务器内部自行维护窗口重排与异步任务流。当智能体执行完最后一步发出终止信号时,整条轨迹的长文本时间线早已在后台编译就绪,关键路径上仅剩下 Seek Agent 几轮极为迅速的文本判定。这使得模型裁判给强化学习带来的额外等待延迟被压缩到极致,真正具备了在工业级 RL 流程中作为“即插即用(drop-in)”替代品的能力。

CUAStepBench:首个多平台密集步骤级评测基准

衡量一个裁判模型的能力,本身需要一面足够坚硬的镜子。现有的 CUA 评估基准存在平台单一、仅关注终局二元结果、缺乏密集步骤标签等严重缺陷。

本文构建并开源了 CUAStepBench。该基准跨越 Web、Ubuntu、Windows、macOS、Android 乃至 iOS 等 6 大运行环境,覆盖 177 个独立应用程序,共包含 278 项经过精心筛选的人类密集标注任务。与以往基准显著不同的是,CUAStepBench 在提供轨迹级人类黄金判定之外,对轨迹中的每一个单步动作均标注了密集的事后标签。为了测试极限长程能力,基准还进一步衍生出了 CUAStepBench-Long,专门收录平均长度高达 272 步的超长轨迹。

值得注意的是该基准独特的“硬样本挖掘机制”。评估中最具价值、最能拉开模型差距的,恰恰是“智能体表面操作看似合理,但在界面上实际发生暗度陈仓或操作失效”的临界案例(borderline cases)。研究团队利用大模型预筛出打分处于成败模糊边缘的困难样本,再交由人工逐帧精细校对。这种严谨的过滤策略不仅杜绝了数据标签污染,更让 CUAStepBench 成为当前最具区分度的智能体奖励评测基准之一。

核心实验发现:强化学习成功率的实质性逆转

在包含真实桌面与操作系统的多项强化学习实验中,SeekJudge 展现出了颠覆传统认知的效果。论文在多个主流任务环境以及 UI-TARS 1.5 7B、Qwen 等多个智能体骨干模型上进行了严格的在线强化学习对比。

首先是对原生规则奖励的超越。在强化学习训练集中,基于规则的奖励模型往往能跑出极高的训练奖励,但这绝大多数源于过拟合——智能体仅仅学会了如何去“迎合”环境检查器写死的特定探测接口。然而,在保留的下游独立测试集(held-out RL test goals)上,由 SeekJudge 驱动训练的智能体展现出了极其强悍的泛化成功率,不仅完全抹平了与原生规则奖励之间的差距,更在多个评测域中实现了成功率的反超。这证明高质量、高保真的模型步级奖励能够引导智能体学到更鲁棒、更符合人类交互逻辑的泛化操作策略,而非钻规则漏洞的捷径解。

其次是对现有模型裁判的压制。对比 OS-Themis 以及强依赖闭源顶级模型的 CUAJudge(其内部依赖 GPT-5-mini),基于开源 9B 单模型的 SeekJudge 在离线轨迹判定 F1 指标和在线 RL 驱动效果上均全面领先。离线评测显示,在相同 Qwen3VL-8B 骨干下,SeekJudge 纯粹凭借架构解耦带来的优势就显著超越了竞品框架;而在经过种子蒸馏专门训练后,SeekJudge-9B 在 CUAStepBench 上的轨迹 F1 提升了 3.7 到 12.2 个绝对百分点,步骤级判定的 F1 更从 27.3 跃升至 38.1。

最后是惊人的效率与成本比。在完成一次标准规模(5,000 条轨迹)的完整强化学习训练中,调用闭源大模型裁判的账单通常需要数千美元,而纯本地部署的 SeekJudge-9B 将显存占用与推理开销压缩了数百倍。加上异步预取服务对训练阻塞时间的实质性消除,以往被视为昂贵玩具的“多模态步级强化学习”,在工程上终于具备了常态化持续运转的经济可行性。

智能体闭环进化的新基石

从更大的视角来看,计算机操作智能体的发展正在经历从“静态微调”向“大规模自博弈与环境探索”的范式转移。正如数学推理大模型依赖过程奖励模型(PRM)实现逻辑飞跃一样,长期制约 GUI 智能体实现自我进化的核心死结,恰恰是缺乏一个兼具空间感知、步级粒度、低延迟与高鲁棒性的“虚拟导师”。

SeekJudge 的价值不仅在于刷高了几个基准数据集的点数,更在于它用一套严密的实验证伪了“把截图一股脑喂给多模态模型”的粗放路线,指明了在复杂视觉轨迹中“定位与提取相解耦”的必要性。通过将工程并发调度、小参数专家蒸馏以及细粒度过程监督融于一体,这项工作实质上为智能体研究社区提供了一套可以真正即插即用的强化学习基础设施。当模型裁判不再是规则失效后的退而求其次,而是能在泛化性与鲁棒性上全面击败静态规则时,自主操作系统的智能体迈向超长程复杂工作流的大门,才算真正被推开。