OpenForgeRL:破解Agent端到端强化学习难题,GUI基准达72.3

OpenForgeRL: Train Harness-native Agents in Any Environment

在当今的人工智能前沿,顶尖的 AI Agent(智能体)极少只是一个“裸”的大语言模型或视觉语言模型。为了在复杂的真实环境中执行诸如软件开发、网页浏览和日常工具调度等任务,这些模型通常会被包裹在一个极其复杂的推理框架(Inference Harness)中。

ArXiv URL:https://arxiv.org/abs/2607.21557

比如我们熟知的 Claude Code、Codex 或是开源的 OpenClaw,这类框架负责管理多轮交互、嵌套的工具调用、生成子智能体以及长期的上下文记忆。可以说,近期 Agent 在各类基准测试中取得的巨大进步,有一半的功劳都要归功于这些精妙的框架层。

然而,这种强大的框架同时也带来了一个致命的副作用:阻碍了开源社区对 Agent 进行端到端的强化学习(RL)训练。因为现有的开源 SFT/RL 训练堆栈(例如 veRL)通常只能处理单轮生成或简单的沙盒代码执行,它们无法原生表达这种充满状态维护和多进程调用的推理过程。为了强行训练,研究人员往往不得不重新手写一个简化版的框架,这直接导致了训练环境与最终部署环境的严重割裂(Train-Deploy Mismatch)。不仅如此,运行这些庞大的框架需要独立的容器化环境,根本无法在训练节点上大规模并行共存。

为了解决这一痛点,一项名为 OpenForgeRL 的全新开源框架进入了我们的视野。它通过一套优雅的解耦机制,让大模型可以直接在它们原本用于部署的真实框架和环境中,接受端到端的强化学习训练。更重要的是,基于该框架训练出的 8B 规模视觉模型,在极少量的训练任务下,就在多个高难度浏览器操作基准上匹敌甚至超越了体量比它大得多的模型。

打破训练与推理的死锁:OpenForgeRL 核心机制

OpenForgeRL 的设计初衷非常明确:不修改现有的 RL 算法库,也不干涉复杂的推理框架,而是通过一层中间件将二者无缝缝合。它能够让任何推理框架与任何环境相结合,同时兼容标准的 RL 代码库。

这种解耦与桥接主要依赖于两个极其轻量但关键的组件:

第一,轻量级代理(Lightweight Proxy)与轨迹重构。OpenForgeRL 在模型和框架之间插入了一个代理层,框架所有的推理调用都会先经过这里。无论外围的推理框架如何启动子进程、如何封装 Prompt 或处理多轮 API 返回,代理只负责默默执行并记录下所有的“输入 Prompt - 输出响应”对。在整个任务执行完毕后,轨迹重构模块会自动将这些零散的交互记录打包成标准的回报样本(Samples),这些样本的格式与任意主流的 RL 框架完全兼容。这使得复杂的长期任务在 RL 优化器眼中,重新变回了它所熟悉的数据结构。

第二,基于 Kubernetes 的远程环境编排器。既然复杂的框架和环境(比如一个完整的虚拟桌面或真实的浏览器进程)不能挤在昂贵的 GPU 训练节点上,OpenForgeRL 借助云服务(如 Microsoft Azure)实现了弹性的容器编排。每一次模型尝试(Rollout)都会在一个独立的远程容器中拉起。这样一来,计算最密集的训练留在本地 GPU 集群,而环境交互带来的 CPU 与内存消耗则被完全卸载并分散到云端,实现了真正的海量并发。

OpenForgeRL 架构总览与多场景表现

在实际的分布式强化学习过程中,由于几百个远程容器在同时跑不同的任务,难免会遇到框架崩溃、网络超时或是某个环境意外死锁的情况。如果按照传统强化学习的同步逻辑,只要有一个 Rollout 卡住,整个训练批次的数据收集就会停滞。OpenForgeRL 放弃了不可靠的“最大交互轮数”限制,转而实施了一种宽容的“墙上时钟超时机制”。一旦某个任务超出时间,框架会直接终止该任务,并让训练继续吸收其他正常完成的任务数据。同时,对于那些因为非模型本身原因(如网络错误)中断的半截轨迹,OpenForgeRL 选择直接丢弃,以防止错误的负向奖励信号污染模型的梯度。

OpenForgeRL 分布式 Rollout 与轨迹收集流程

从文本工具到多模态 GUI:全面超越同级开源基准

研究团队并未将 OpenForgeRL 停留在理论和架构层面,而是真刀真枪地将其投入到了两大类极具挑战性的 Agent 训练场景中:基于文本调用的 Claw Agent(处理收发邮件、查阅知识库等日常工具调用)以及基于纯视觉输入的多模态 GUI Agent(真实控制电脑桌面和网页浏览器)。

为了提供高质量的训练数据,研究人员设计了一套自动化的任务与环境合成管线(Data Synthesis Pipeline),从真实的工具 API 和网页资源库中反向合成具有真实分布的指令。

OpenForgeRL 任务与环境自动合成管线

在文本工具领域,团队基于 Qwen3-30B-A3B-Thinking(约 30B 规模的 MoE 模型)训练了 OpenForge-Claw。令人瞩目的是,模型不仅仅在一个框架里训练,而是同时在 ZeroClaw、OpenClaw 和 Codex 三个完全不同设计理念的流行框架内进行探索学习。

经过 SFT 和 RL 强化后,OpenForge-Claw 在考察日常多步骤工具操作的 ClawEval 基准上达到了 $31.7$ 的 $pass^3$ 以及 $55.9$ 的 $pass@3$ 成功率,在 QwenClawBench 上也拿下了 $33.7$ 的成绩。相比于未经训练的基座模型以及同等参数规模的其他开源模型,不仅平均成功率大幅攀升,其面对多步复杂逻辑时的鲁棒性也得到了本质改善。

在更为严苛的多模态 GUI 领域,难度呈指数级上升:模型必须“看”懂屏幕截图,并输出像素级的鼠标点击和精确的键盘敲击序列。团队以仅 8B 参数的 Qwen3-VL-8B-Thinking 为底座,训练了 OpenForge-GUI 模型。

在这个配置下,每次环境交互都要在远程容器里拉起一个完整的虚拟显示器,加载 VLM 框架去执行点击。结果显示,仅仅使用了大约数千个训练任务,经过 OpenForgeRL 体系的打磨,OpenForge-GUI 在测试真实电脑操作的 OSWorld-Verified 基准上达到了 37.7 的成功率;而在测试网页操控的 Online-Mind2Web 和 WebVoyager 上,分别斩获了 63.0 和 72.3 的傲人成绩。

需要强调的是,相较于动辄使用几十万级别任务进行微调的开源基线模型(如 MolmoWeb),OpenForge-GUI 使用的监督和强化数据少得惊人。这强有力地证明了:当模型能够直接在其最终要使用的框架和真实环境中进行在线试错与奖励反馈时,强化学习带来的样本效率和能力跃升是纯离线 SFT 所无法企及的

深度剖析:强化学习到底改变了 Agent 的什么?

由于 OpenForgeRL 彻底打通了部署与训练的壁垒,这篇论文不仅仅是在发布一个工具,它更向我们揭示了在复杂框架下,强化学习究竟是如何重塑智能体行为特征的。研究团队在后续探讨中,提出了几个极具启发性的结论:

OpenForgeRL 的出现,补齐了开源社区通向高阶通用智能体的一块重要基石。它告诉我们,不要再让大模型在真空中背诵指令了。将它们放进真实的框架,接入真实的浏览器,赋予它们在报错与碰壁中不断试错的自由,这才是让 AI Agent 真正走向实用与可靠的必由之路。