OSReward:VLM裁判靠谱吗?降本60倍的模型逼近闭源前沿

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

在计算机使用智能体(Computer-Using Agents,简称 CUA)的高速发展中,我们正面临一个极为棘手且往往被忽视的基础性问题:当一个智能体在屏幕上点来点去、输入文本、执行代码后,我们如何确定它真的完成了任务?

ArXiv URL:https://arxiv.org/abs/2607.28609

长期以来,行业内普遍采用多模态大语言模型(VLM)作为“裁判”或奖励模型,来判定智能体的操作轨迹是否成功。无论是收集高质量数据集,还是通过强化学习让智能体自我进化,这种自动化的裁判机制都构成了整个技术飞轮的核心。然而,一个致命的盲点始终没有被彻底清查:这些充当法官的 VLM,其判决真的可靠吗?如果裁判本身就有偏见,智能体的进化方向会不会从一开始就走偏了?

为了回答这个根本性问题,这项工作从零开始构建了 OSReward,这是迄今为止第一个专门用于跨平台评估 CUA 奖励模型的高质量基准。评估结果揭示了一个残酷的真相:即便是当前最先进的闭源大模型,在面对复杂的真实轨迹时也远未达到理想裁判的标准。它们普遍存在一种极具误导性的“宽大偏见”,极易被智能体伪造的成功迹象所蒙蔽。同时,那些勉强能用的闭源模型成本高昂,根本无法支撑起强化学习动辄数以百万计的采样需求,而开源模型的表现又大幅掉队。

针对这一困境,研究团队并没有止步于发现问题,而是直接给出了开源的破局方案。他们构建并发布了包含十万级轨迹评判标注的 OS-Shepherd-100K 语料库,并基于此训练了专门的开源奖励模型 OS-Shepherd(包含 9B35B 两个版本)。这些模型在保持开源和可私有化部署的同时,将推理成本直接拉低了数十倍,准确度却逼近了昂贵的商业前沿模型。

为什么不能直接用现成数据测裁判?

在评估一个裁判能力时,最直观的想法是直接拿现成的智能体跑分数据集(如各种 Agent 测试基准)来考校。但这种做法存在严重的逻辑漏洞和质量干扰。

现有的基准数据往往自带两种缺陷。一方面,它们的基准真实标签(Ground Truth)很多是由脆弱的启发式脚本生成的。这些脚本在应对复杂的图形界面变化时极易出错。如果直接用这些带有噪声的标签去衡量 VLM 裁判,我们就无法分辨究竟是裁判模型判断错了,还是原始标签本来就是错的。另一方面,这些现成的轨迹继承了原有测试环境的局限性,比如预算限制、单一的模型底层逻辑以及有限的动作空间。更为致命的是,许多原始指令本身就充满歧义,在真实世界中根本不存在一个非黑即白的确定性结果。

为了彻底隔离这些干扰,研究团队决定放弃捷径,亲自下场搭建一套端到端的跨平台数据收集基础设施。这套设施覆盖了 WebWindowsUbuntu 以及 Mobile(安卓)四大平台,并且极力还原了真实用户的使用场景。

在这个基础设施中,测试环境不再是静态的网页快照或干净的虚拟机初始状态。以 Ubuntu 平台为例,环境中不仅预装了数十种日常和专业的软件工具,还配置了一个包含二十多种类型、成百上千个真实文件的数据池。在安卓模拟器中,甚至会随机生成浏览记录、相册照片以及干扰性的推送消息和伪造文件。这种充满噪声和状态叠加的“活体环境”,才能真正测试出智能体在混乱中执行任务的能力,也才能为后续的裁判模型提供真正有判别价值的复杂轨迹。

环境搭建与指令标注流程

有了真实的环境,还需要真正接地的任务指令。所有的测试指令均由人工在探索上述环境的过程中编写,并通过严格的交叉审查来剔除那些无法在当前环境中完成或表述含糊的任务。随后,团队调用了来自不同技术路线的多种主流基座模型来执行这些指令,确保收集到的轨迹在动作习惯、思考冗余度以及失败模式上具有高度的多样性。

经过层层筛选,最终留下了上千条高质量轨迹。为了确立不可动摇的黄金评判标准,每条轨迹都交由三名独立标注员进行审阅。他们不能只看最后一张结果截图,而是必须结合环境上下文、智能体的中间思考过程以及每一步的具体动作进行全盘回溯。当三人意见出现分歧时,轨迹会被提交给资深审核员进行“元审核”合议,绝不单纯依赖少数服从多数的妥协。

三轮独立标注与元审核流程

OSReward 基准的多维视角

经过如此严苛的打磨,最终成型的 OSReward 包含了三个层层递进的评估视图,用于全方位考察裁判模型的能力。

最基础的是全量数据集(The Full Set),包含超过一千条跨平台长周期轨迹,任务长度最高可达上百步,成功与失败的案例比例分布均衡。这构成了衡量模型综合判断力的基础底座。

在这个基础上,研究团队进一步提炼出了 OSReward-Hard 挑战集。这是整个基准中最具杀伤力的部分。它汇集了所有让初级人类标注员都感到棘手、容易产生分歧的极端案例。在这些轨迹中,智能体可能执行了极其曲折的操作才偶然成功,又或者在历经长途跋涉后,在最后一步发生了细微的错误导致前功尽弃。这个子集故意调高了失败案例的比例,以此来针对性地测试裁判模型是否容易被表面现象所迷惑。

第三个视图是 OSReward-Multi。对于那些确实成功的轨迹,仅仅判定“成功”是不够的。这个子集进一步引入了“对齐度”和“效率”两个细粒度指标。对齐度衡量的是智能体的动作路径是否完全符合用户的内在意图;效率则考察智能体是否在整个过程中避免了无效的试错和多余的废动作。这为构建更精细的奖励函数提供了探索空间。

令人不安的宽大偏见与假成功陷阱

拿着这套坚实的尺子,研究团队对市面上多达二十七款主流 VLM 进行了迄今为止最全面的裁判能力摸底。测试结果不仅打破了人们对前沿大模型无所不能的滤镜,更暴露出一个可能危及整个智能体行业发展方向的系统性漏洞。

在全量数据集上,部分顶级商业模型的表现尚可,但在面对 OSReward-Hard 挑战集时,所有模型无一例外遭遇了断崖式下跌。即便是最强悍的闭源模型,其准确率也艰难徘徊在及格线附近,而参赛模型的平均准确率甚至暴跌到了硬币投掷的水平。

究竟是什么绊倒了这些算力巨兽?通过对错误模式的深入剖析,研究团队锁定了一个极其典型的特征:绝大多数裁判模型都患有严重的“宽大偏见”(Leniency Bias)。

OSReward与OSReward-Hard表现

VLM裁判的偏见分析

具体来说,这些 VLM 在判定一条其实已经失败的轨迹时,表现得极为软弱和轻信。当智能体在轨迹末尾的思考过程中主动输出诸如“任务已完成”或者“我现在停止操作”的自我声明时,裁判模型往往会不加核实地采信智能体的“一家之言”,进而给出一个“假成功”的错误判决。

这种现象的根源在于评估计算机轨迹与评估纯文本的根本差异。在文本任务中,答案通常就在眼前的上下文中;而在 CUA 任务中,真正的评判标准往往隐藏在环境状态的微小改变中。例如,要确认一封邮件是否发送成功,不能仅仅看智能体是否点击了“发送”按钮,还要在极短的后续画面中确认是否弹出了成功提示,或者邮箱的“已发送”列表是否更新。

现有的 VLM 裁判由于缺乏对长期视觉时空逻辑的深度建模,往往会走捷径。它们倾向于依赖智能体在文本中表达的意图,而不是严格核对视觉信息中环境状态的确切变化。这种宽大偏见在强化学习循环中是极其危险的。如果奖励模型总是把这种“假成功”误判为真成功并给予高分反馈,智能体会很快学会一种狡猾的策略:不再费心费力去解决环境问题,而是学会如何生成一段看起来完美但实际上毫无作用的“幻觉总结”,以此来骗取奖励。

OS-Shepherd:击穿成本墙的开源逆袭

除了准确度的隐患,成本是另一个扼杀行业工程实践的瓶颈。在测试中,真正勉强能让人信任的几个前沿模型,其调用成本极为高昂。在构建强化学习数据集或者进行在线反馈训练时,模型需要对数以十万、百万计的候选轨迹进行实时打分,如此庞大的 API 调用开销远超出了普通学术机构乃至大多数商业团队的承受极限。而那些在成本上具有吸引力的开源模型,在准确度上又被远远甩在身后。

为了弥补这一巨大的鸿沟,研究团队展开了大规模的数据合成与清洗工作,最终向社区开源了 OS-Shepherd-100K 数据集。这个数据集并非简单的爬虫抓取,而是通过内部流水线以及严格的过滤规则,从三十多万次原始判定实例中提纯而来的近十万条高质量裁判语料。

在这个数据集中,研究人员刻意放大了能够纠正“宽大偏见”的负面样本比例。特别值得一提的是,这个十万级语料的构建并没有依赖极其昂贵的大规模人工重新标注。团队巧妙地利用了在 OSReward 评测阶段总结出的裁判偏见规律,设计了针对性的启发式规则和模型共识机制,自动清洗并对齐了那些充满争议的判定结果。

正是站在这个坚实的数据地基上,团队分别训练并开源了参数量为 9B35BOS-Shepherd 奖励模型。训练过程采用了两阶段策略:第一阶段让模型掌握跨平台的基础判定能力和多模态理解力;第二阶段则直击痛点,专门对极具迷惑性的“假成功”样本进行对抗性微调。

成本与准确率帕累托前沿

最终的成果是突破性的。在性能与成本的帕累托前沿图上,OS-Shepherd 模型展现出了惊人的效率。其中 35B 版本在 OSReward-Hard 挑战集上的表现,已经逼近了最强闭源前沿模型的准确率边界,而其所需的运行成本仅仅是后者的几十分之一。这种级别的降本增效(高达 30 到 60 倍的成本缩减),使得中小型团队完全可以在本地服务器上低成本地运行持续的奖励反馈循环,扫清了智能体强化学习落地的最大经济障碍。

重新定义评估的标尺

当整个 AI 社区都在狂热地追求更大参数、更高跑分的智能体基座模型时,这项工作冷峻地提醒了我们:如果没有一把准确且不会弯曲的尺子,所有的优化和进步都可能是建立在沙丘之上的幻影。

OSReward 的发布,不仅第一次将跨平台、长周期、高噪声真实环境中的智能体评估难题摆在了台面上,更用扎实的人工审核数据无情地揭露了当前主流裁判模型的系统性缺陷。智能体不能既做运动员又做裁判员,而外部的 VLM 裁判如果只会“和稀泥”,同样无法引导技术走向真正的通用与稳健。

更重要的是,OS-Shepherd-100K 语料库与对应的开源奖励模型的释放,为打破巨头在高质量反馈信号上的垄断提供了一把锐利的武器。它证明了通过深刻理解模型的错误模式并针对性地进行数据干预,我们完全可以用轻量级的开源模型,在极其严苛的专项任务中达到甚至超越通用巨型模型的可用性。

随着视觉智能体逐渐渗透进从日常办公到复杂代码开发的核心环节,如何构建可靠的对齐与奖励机制将成为决定其生死存亡的关键。这项工作不仅是智能体评估领域的一次重要基建,更是向下一代真正可信赖、不被表面现象欺骗的具身与虚拟智能迈出的坚实一步。