Qwen-CUA:纯视觉键鼠交互机制,OSWorld基准达到87.6分

Qwen-CUA: Native Computer Use for (almost) Everything

长期以来,人工智能在数字世界中的行动能力主要依赖于代码生成和应用程序接口(API)。现代大语言模型已经能够熟练地编写程序或调用各类软件工具,但在真实的人类工作环境中,大量的数字化工作远远超出了这些接口的覆盖范围。桌面应用程序、遗留系统、复杂的动态网页、专业级工程工具,以及高度个性化的工作流,通常只向用户提供视觉化的图形界面(GUI)。这意味着,如果人工智能无法像人类一样直接通过视觉和键鼠操作软件,它的通用性将受到严重制约。

ArXiv URL:https://arxiv.org/abs/2608.02352

为了跨越这一鸿沟,原生计算机使用(Native computer use)路线应运而生。它的核心理念极为简洁:让智能体只通过观察屏幕像素来感知世界,并直接输出键盘和鼠标事件来进行操作。这篇研究介绍了 Qwen-CUA,一个专门为原生计算机交互设计的端到端视觉智能体。基于 397B-A17B 的 Qwen 混合专家(MoE)骨架,Qwen-CUA 彻底抛弃了文档对象模型(DOM)树、无障碍元数据或任务专属 API,完全依托于纯截图和底层键鼠事件运行。

在多项权威基准测试中,Qwen-CUA 展现了极为强悍的性能。在 OSWorld-Verified 基准上,它达到了 86.2 分,大幅领先于 Qwen3.7,并与 GPT-5.5 和 Claude Opus 4.8 等顶级闭源系统并驾齐驱。当这一架构被扩展至超过万亿参数的 Qwen-CUA-Max 时,该分数进一步提升至 87.6。这不仅证明了原生视觉交互的可行性,更揭示了通过大规模环境并发、可验证强化学习以及长视野上下文管理,可以构建出高度泛用且性能卓越的计算机操作基础模型。

摒弃捷径:原生界面的核心挑战与极简设计

人类面对计算机时,依靠的是高度直觉化的视觉-运动反馈循环。但对智能体而言,这构成了一个极其复杂的局部可观测马尔可夫决策过程。GUI 状态在底层往往是机器不可读的,许多信息只以像素形式存在。同时,鼠标点击和键盘输入需要极为精准的像素级对齐,细微的坐标偏移就可能导致误操作;而在动辄几十步的长期工作流中,早期的微小失误会不断累加。

许多先前的研究为了规避这些难点,选择提取网页的 DOM 树或操作系统的无障碍(Accessibility)标签来辅助模型理解界面。然而,这种做法严重限制了智能体的泛化能力。许多桌面软件、专业的 CAD 工具或者基于 Canvas 渲染的动态网页根本不提供结构化的后台数据,依赖这些捷径的智能体一旦脱离特定的环境就会立刻瘫痪。

Qwen-CUA 的设计哲学是彻底的极简主义。在每一个决策步中,模型接收的输入仅仅是当前桌面的真实屏幕截图,其输出则是纯粹的键盘和鼠标动作空间指令。这种设计使得模型能够无缝地从浏览器环境跨越到任何桌面应用程序,因为所有软件最终都会渲染为像素,并通过操作系统底层的外设驱动接收指令。

但纯截图输入带来了另一个致命问题:视觉 token 的爆炸式增长。长周期的任务会产生庞大的视觉历史,如果保留所有历史截图,计算成本将迅速突破上下文窗口的极限;如果仅仅使用简单的滑动窗口丢弃旧截图,模型又会丧失对早期关键状态的记忆,从而难以解释当下的推理逻辑。

为了在长期追踪和计算效率之间取得平衡,Qwen-CUA 设计了一种轻量级的上下文管理机制。它的智能体脚手架最多维持 20 张激活状态的近期屏幕截图。对于更早的截图,系统会将其按照固定大小的块(例如 10 张一组)进行折叠处理。这种块状折叠策略不仅保留了最近的细粒度视觉证据,还使得提示词前缀保持相对固定。在自回归生成过程中,稳定的前缀能够最大化地提高 KV-Cache 的重用率,显著降低了长周期多模态交互的推理延迟和计算开销。

基础设施的暴力美学:十万级并发与可验证任务构造

训练一个能够驾驭各种软件的通用智能体,仅仅扩大模型参数是不够的,必须同步扩大环境的多样性、任务的规模以及监督信号的获取效率。真实的计算机环境是“有状态”的(stateful),每一次操作都需要软件进行真实的渲染和响应,这使得数据收集的耗时极长。

为解决这一工程瓶颈,研究团队依托阿里云的弹性计算服务(ECS),构建了一个极其庞大的云端执行舰队。该舰队能够调用近 100,000 个 vCPU,支持数万个并发的计算机使用环境。这种规模的并行计算架构使得环境的分配、重置、任务分发、智能体交互以及结果验证能够被彻底流水线化,为大规模强化学习提供了持续不断的轨迹活水。

在这些并发环境中,团队构建了约 40,000 个可验证任务。为了覆盖足够广的技能树,这些任务被分为三个核心层次:

首先是环境交互与用户交互任务。通过在沙盒桌面中安装超过两百种各类软件,并构建高度可控的模拟 Web 服务,模型可以在不受外部网络波动影响的情况下学习界面的操作规律。值得注意的是,真实世界中的任务往往是信息不全的,因此团队引入了模拟用户机制。当任务指令存在缺失或歧义时,模型需要学会在操作系统中暂停操作,并主动向用户提出针对性的问题。只有当提问补全了必要信息并最终完成环境状态变更,任务才算成功。这种设计强迫模型进行状态自省,而不是盲目地基于假设进行错误操作。

其次,对于长视野的复杂工作流,团队引入了“阶段状态链接”(Phase-state chaining)技术。由于一个跨越多个软件的复杂任务极难在终点进行一次性验证,研究者将长任务拆解成多个相互依赖的阶段。每个阶段都有一个可以被执行代码验证的完成状态。一旦前置阶段被验证成功,其环境状态会被序列化保存,并作为下一个阶段的初始环境。通过这种方式,复杂的长链条操作被分解为可审计、可逐步生成的训练单元,同时在端到端回放时依然能保持工作流的连贯性。

为了弥补纯探索难以发现专业软件深层逻辑的缺陷,Qwen-CUA 还融合了大规模的人类演示轨迹。这些轨迹涵盖了从日常办公到 Blender 等专业 CAD 软件的个性化工作流。更关键的是,团队利用大模型对这些纯动作记录进行了“推理增强”。基于前置状态、当前截图和标注动作,系统通过大模型逆向生成了步骤级的思维链(CoT)推理,经过一致性过滤后,为模型提供了高质量的动作解释,使其不仅知道“该点哪里”,还明白“为什么要点这里”。

解决稀疏奖励:可验证强化学习与迭代飞轮

对于基于 GUI 的智能体而言,强化学习面临着极其严重的奖励稀疏问题。由于缺乏每一步的完美专家动作参考,很多时候模型只能在长达几十步的操作结束后,得到一个简单的成功或失败反馈。

Qwen-CUA 采用了带可验证奖励的强化学习(RLVR)策略。基于环境状态的可执行评估器能够在任务终止时提供可靠的反馈。为了在长序列和多模态场景下稳定这种优化,模型采用了平滑自适应策略优化算法(Soft Adaptive Policy Optimization, SAPO)。

在 SAPO 的设定中,由于奖励只在终端状态给出,一条轨迹中的所有激活 token 共享同一个组相对优势值。但是,为了避免模型在长周期决策中因为部分偏离策略的 token 导致整个更新崩溃,SAPO 引入了一个平滑且带有不对称温度控制的门控机制。对于具有正优势(表现好)的轨迹,算法保留正常的策略更新;但对于具有负优势(表现差)且严重偏离当前策略的 token,其梯度下降的速度会被更快地衰减。这种不对称的设计,对于像 Qwen 这样基于混合专家(MoE)架构、同时又处理超长多模态序列的模型来说,是保持训练稳定性的关键。

此外,强化学习过程与前述的视觉上下文折叠机制实现了深度结合。由于采用了确定性的历史折叠表达,一个长周期奖励片段可以被切割成多个被上下文边界包裹的优化单元。这意味着即使没有人工设计的密集步级奖励,来自最终状态的梯度也能有效地传播到不同交互阶段的关键 token 上。

这种训练并不是一次性的,而是形成了一个迭代飞轮。每一轮训练产生的新模型,都会被用来诊断当前未能解决的指令和表现薄弱的应用领域。基于这些诊断,系统会更新教师模型重新生成演示、收集新的人类轨迹,从而刷新监督微调(SFT)的数据混合池。随后,新一版的 SFT 模型会对候选的强化学习任务进行校准,筛选出那些既非不可达也未完全饱和的边缘任务,使得下一轮优化的算力始终集中在最能提供信息增量的区域。

多维表现突破:从标准基准到现实部署

这种在环境规模、任务验证和长期强化学习上的系统性发力,使得 Qwen-CUA 在评估中展现了压倒性的优势。在涵盖不同维度设定的八项计算机使用基准测试中,Qwen-CUA 在核心指标上全面超越了之前的 Qwen3.7 版本。

Qwen-CUA 在八个基准上的主要结果

从上图可以看出,在注重真实跨应用工作流的 OSWorld-Verified 基准上,Qwen-CUA 将分数从 Qwen3.7 的 73.3 分提升至 86.2 分。相比之下,当前业界最强大的闭源模型 GPT-5.5 的得分为 78.7,Claude Opus 4.8 为 83.4。在注重长期端到端流程且包含二元和部分完成度评估的 OSWorld 2.0 中,Qwen-CUA 的二元/部分完成度分别达到了 18.5/48.4,相比之前版本的 2.5/22.5 实现了质的飞跃。

更为重要的是,这种能力的提升并没有以牺牲安全性为代价。在 RedTeamCUA 这一专门针对多应用环境下间接提示词注入(Indirect Prompt Injection)攻击的评估中,Qwen-CUA 的攻击成功率(ASR)从 36.6 降低到了 16.4,同时维持了正常的任务执行能力。这表明在大量复杂场景的强化学习后,模型不仅学会了如何操作,更学会了如何分辨指令的来源和合理性,有效抵御了隐藏在网页或文档中的恶意控制企图。

为了探究更高效的操作模式,研究者还在 MyPCBench 上进行了将原生交互与 Bash 命令行结合的混合实验。数据显示,当允许模型调用命令行工具时,交互步数显著减少(例如平均轮数从 63.6 缩短至 49.1)。虽然目前这种混合模式由于模型尚未完全掌握何时该用鼠标何时该写代码,导致任务成功率略有波动,但这指明了一个明确的发展方向:原生视觉交互能够提供兜底的通用性和视觉锚定,而专门的工具则负责精确和效率,两者的结合将是下一代通用智能体的标准形态。

Qwen for Chrome 部署示例

不仅停留于实验室跑分,Qwen-CUA 已在真实的业务环境中进行了初步部署。例如在一个内部 Chrome 插件的部署展示中,模型能够独立完成在云服务控制台购买和配置虚拟机的完整流程。更为难得的是,面对涉及费用消耗的实质性操作(如确认支付),它能够基于先前的模拟用户训练,主动挂起流程并等待人类的确认。这种与人类直觉高度契合的行为模式,证明了其在实际应用中的巨大潜力。

当研究团队将这一套验证有效的数据配方和强化学习流程应用到总参数量超过一万亿的 Qwen-CUA-Max 模型时,能力的边界进一步被拓宽。Qwen-CUA-Max 将 OSWorld-Verified 的成绩推高至 87.6,并在 OSWorld 2.0 的部分完成度上达到了 53.3。这一结果充分证实了原生计算机使用技术具备优异的扩展缩放定律(Scaling Law)。

Qwen-CUA 的出现,标志着纯视觉的底层键鼠交互已不再是一种低效的妥协,而是成为了智能体通往泛用性最宽广的道路。当模型能够顺畅地看懂屏幕并敲击键盘时,整个数字世界,无论是前沿的 Web3 平台还是古老的本地系统,都将毫无保留地向人工智能敞开大门。