人大 ClawGym II:前缀树黑盒RL框架,长任务提升14.8分
ClawGym II: Exploring Black-Box RL on Agent Harness

在构建能够处理长周期、复杂现实任务的通用智能体(Agent)时,研究人员和工程师们越来越依赖于成熟的“智能体执行框架”(Agent Harness)。像 Claude Code、Codex 或 OpenClaw 这样的生产级系统,将系统提示词、工具接口、上下文管理、工作流编排以及重试与恢复机制封装在了一个统一的运行时环境中。这些框架极大地提升了模型在复杂任务上的表现,但同时也引入了一个致命的副作用:它们过于复杂和不透明,导致传统的强化学习(RL)算法很难在这些框架之上对底层模型进行进一步的优化。
ArXiv URL:https://arxiv.org/abs/2608.16798v1
当模型的交互过程被框架接管后,控制流和执行逻辑变成了“黑盒”。模型不仅无法看到完整的状态转移过程,其暴露出的交互轨迹也变得极度碎片化。为了解决这一行业痛点,中国人民大学 IQuest 实验室提出了 ClawGym II,这是一个统一且可扩展的黑盒强化学习框架,专门用于在复杂执行框架下稳定优化通用智能体。
ClawGym II 的核心亮点在于,它巧妙地将策略优化与不透明的框架执行解耦,通过构建沙盒化的执行基础设施和拦截模型调用的代理服务,成功将碎片化的黑盒调用重构为“前缀树”(Prefix Tree)结构。在此基础上,研究团队对 PPO 和 GRPO 等主流强化学习算法进行了底层适配,使其能够直接在树结构上进行优化,并创新性地引入了多框架混合训练(Mix-Harness Training)机制。实验结果极具说服力:在 Qwen3-30A3B 基座模型上,通过该黑盒 RL 框架训练后,模型在 ClawGym-Bench 的长周期任务中,分别在 OpenClaw 和 Claude Code 框架下实现了 9.98 分和 14.81 分的惊人提升,且在 200 到 400 个优化步数内保持了极高的训练稳定性。
接下来,我们将深入剖析 ClawGym II 是如何一层层打破黑盒限制,重塑智能体强化学习范式的。
核心痛点:为什么现代 Agent 框架成了强化学习的“黑盒”?
在早期的智能体研究中,最典型的交互模式是基于 ReAct(推理与行动)的简单循环。在这种“白盒”或轻量级环境中,环境状态的流转是明确的,模型输出一个动作,环境返回一个观察,整个过程直接暴露给强化学习算法,便于计算奖励和梯度。
然而,对于通用的长周期任务(如软件工程开发、复杂办公自动化),这种简单的循环早已无法胜任。现代的 Agent Harness 扮演了操作系统的角色,接管了大量的底层执行细节。例如,当模型尝试调用一个 API 失败时,框架可能会在后台自动捕获错误,截断部分超长的上下文,甚至启动一个子智能体(Sub-agent)去查阅文档,然后再将处理后的信息重新喂给主模型。
在这个过程中,框架内部的逻辑发生了什么,模型是完全不知道的。对于强化学习算法而言,这带来了三大根本性挑战:
第一,难以实现大规模并发与稳定执行。长周期任务往往需要长达数十分钟的真实环境交互,任何一个后台进程的崩溃或文件系统的污染都会导致整条轨迹失效。
第二,模型调用轨迹的碎片化。由于框架会在内部进行分叉、重试或上下文压缩,算法收集到的不再是连贯的 (状态, 动作) 序列,而是零散的、带有大量冗余历史记录的 API 调用片段。如果直接对这些片段进行学习,不仅会导致信用分配混乱,还会引发严重的训练不稳定。
第三,框架的异构性壁垒。不同的系统(如用于终端代码执行的 Claude Code 与用于通用办公的 OpenClaw)在交互协议和工具接口上天差地别,导致过去的 RL 方法往往只能深度绑定并过拟合于某单一系统,难以泛化。
基础设施:基于沙盒的大规模并发与代理拦截
为了在黑盒状态下收集高质量的强化学习数据,ClawGym II 首先在工程基础设施上进行了彻底的重构。
通用智能体任务不仅需要计算资源,更需要独立且有状态的执行环境。例如,在一个代码修复任务中,智能体可能需要修改多个文件、编译代码并运行测试。为了支持大规模的强化学习采样(Rollout),ClawGym II 为每个并发任务动态拉起一个临时沙盒(Sandbox)。这个沙盒不仅包含了初始化的工作区状态,还封装了所选 Agent Harness 的所有运行时依赖。
沙盒的生命周期与任务完全绑定,按需配置,任务结束后立即销毁。这种物理级别的隔离确保了成百上千个并发 Rollout 之间绝对不会互相干扰。更重要的是,除了框架自带的本地工具外,ClawGym II 还通过模型上下文协议(MCP,Model Context Protocol)在沙盒内部署了标准化的外部服务(如网络搜索),这使得框架在不修改自身原生代码的前提下,能够无缝接入更多复杂的外部工具。
而在模型与框架的交互边界上,ClawGym II 部署了一个关键组件——服务代理(Serving Proxy)。这个代理伪装成标准的模型推理 API,静默地拦截并记录所有的模型调用请求和返回结果。此时,Agent Harness 依然保留其原生的、不透明的执行逻辑,完全独立运行;而策略优化模块则通过代理获取到了模型真实看到的输入和输出。这种巧妙的解耦,为后续的轨迹重构奠定了基础。
轨迹重建:前缀树(Prefix Tree)如何化解碎片化调用?
仅仅拦截到模型调用是不够的,代理服务捕获到的记录往往是一堆带有重复前缀的零散请求。由于复杂的 Agent 框架可能会进行重试、分支探索或子智能体调度,直接将这些请求拉平进行训练,会破坏长周期交互的时序结构,并让模型在相同的历史节点上被重复计算损失,导致梯度爆炸或方向偏移。
ClawGym II 提出了一个优雅的解决方案:将单次 Rollout 中捕获的所有模型调用,组织成一棵“前缀树”(Prefix Tree)。
在这棵树中,每一个节点代表一段交互历史,每一条从根节点到叶子节点的路径,就代表了一条可能的多步完整交互轨迹。通过这种树状拓扑结构,所有共享的历史前缀在内存和计算图中只被保存和计算一次。当框架执行逻辑发生分叉(例如模型第一次调用工具报错,框架提示错误后模型进行了第二次修正调用),这些不同的延续动作自然地成为了前缀树上的不同分支。
建立树结构后,ClawGym II 还会进行严格的轨迹过滤。并非所有的叶子节点都代表任务的主线推进,有些可能是框架为了压缩上下文而发起的后台总结任务,或者是某个被抛弃的子智能体尝试。将任务最终的全局奖励盲目广播给这些辅助轨迹,会引入极大的噪声。因此,算法会剥离这些辅助交互,仅保留主智能体的核心解决路径参与最终的梯度反向传播。
算法适配:在树结构上重塑 PPO 与 GRPO
传统的强化学习算法是为线性轨迹设计的,为了让模型能够在前缀树上学习,ClawGym II 对目前最主流的两种大语言模型 RL 算法——基于评论家的 PPO(Proximal Policy Optimization)和无评论家的 GRPO(Group Relative Policy Optimization)进行了深度改造。
在树结构的优化逻辑中,由于单次 Rollout 最终只对应一个确定的物理工作区状态验证结果,因此从这棵前缀树中提取出的所有有效轨迹,都将共享这一个全局终端奖励。
在计算策略损失时,前缀树的优势被发挥到了极致。对于树上那些属于分支特有的标记(Token)节点,算法会正常计算其对应的优势函数和策略梯度;而对于那些处于共享前缀路径上的节点,在单次 Rollout 的总损失计算中严格只被统计一次。这种精细的节点级去重,从数学上防止了那些因为框架频繁报错重试而产生高度分叉的轨迹,在整个批次中占据不成比例的过大优化权重,从而保障了模型更新的平滑性。
对于 GRPO 这种依赖组内相对优势(Group Relative Advantage)的算法,ClawGym II 在计算每个组的基准均值 $\mu_q$ 和标准差 $\sigma_q$ 时,依然基于独立 Rollout 的最终奖励进行统计。每个分支上的动作在其对应状态 $s_t$ 下的优势值 $\hat{A}_i$ 将直接由该轨迹的相对奖励驱动,并受到 KL 散度的严格约束,防止策略在探索复杂框架漏洞时发生崩溃。
训练一致性:跨越推理与训练的鸿沟
在黑盒强化学习中,有一个极易被忽视但极其致命的工程陷阱——训练与推理的不一致性。
在真实的 Rollout 阶段,模型输出的文本需要经过黑盒框架的解析。框架可能会在内部进行字符串的标准化、去除多余空格、或者将助手的消息重新序列化。如果我们在训练阶段,简单地将重构后的轨迹重新进行分词(Tokenize),那么送入训练引擎的 Token 序列,很可能与模型在推理时实际生成的序列产生微小的偏差。这意味着,模型在被强迫学习一个它从未真正“原样”生成过的概率分布。
为了弥补这一鸿沟,ClawGym II 引入了“Token 进,Token 出”的黑盒对齐机制,并结合 Token 级的重要性采样(Importance Sampling)来进行修正。算法会精确追踪模型在推理引擎中生成每个动作 $a_t$ 时的原始对数概率 $\log\pi_{\text{rollout}}(a_t \mid s_t)$。在训练更新前,训练引擎会重新计算当前策略的对数概率 $\log\pi_{\text{old}}(a_t \mid s_t)$。
通过计算两者的比值并加以截断限制 $\bar{c}$,ClawGym II 能够动态调整每个 Token 的学习权重 $w_t = \min(\exp(\log\pi_{\text{old}} - \log\pi_{\text{rollout}}), \bar{c})$。这种机制不仅吸收了底层引擎差异带来的偏差,还像一道安全阀,限制了异常概率比值对整体梯度的破坏,确保了整个长周期训练过程的极致稳定。
混合框架训练(Mix-Harness Training):走向通用智能
现代开源和商业 Agent 框架百花齐放,如果一个模型只能在某一个特定框架下表现优异,它就算不上真正的通用智能体。得益于 ClawGym II 将策略优化与框架执行完全解耦的设计,它自然而然地解锁了一项前沿能力:混合框架训练(Mix-Harness Training)。
由于所有的框架(无论其内部逻辑多么复杂)最终都被统一接入到了同一个模型服务边界,并被抽象为一致的前缀树轨迹表示,因此,我们可以将不同的“任务-框架”对混合在一起,作为基本的数据实例喂给单一模型进行联合优化。
这意味着,模型可以在同一个批次中,上一秒还在学习如何通过 Claude Code 框架在终端中高效排查代码 Bug,下一秒就在学习如何利用 OpenClaw 框架调用日历和邮件 API 安排会议。混合训练不仅没有导致模型在不同协议间发生认知混乱,反而促使模型学习到了更本质的工具调用和逻辑推理表征,从而大幅提升了模型跨场景的泛化能力。
实验验证:不仅分数大幅提升,且具备极强的稳定性
为了验证该框架的真实威力,研究团队使用了 Qwen3-8B 和 Qwen3-30A3B 作为基座模型,在 ClawGym-Bench 和 PinchBench 两大长周期复杂任务基准上进行了详尽的评估。评估体系结合了严格的代码单元测试和基于强 LLM(如 GPT-5.4)的综合评判。
实验数据展示了黑盒 RL 的巨大潜力。以 30A3B 参数规模的模型为例:
在 OpenClaw 框架下训练出的 ClawII-OC-30A3B 模型,相比于其初始策略,在 ClawGym-Bench 的 Pass@1 指标上提升了 9.98 分,甚至比经过精细监督微调(SFT)的基线模型还要高出 5.80 分。
在专门针对代码和终端操作的 Claude Code 框架下,ClawII-CC-30A3B 更是展现出了统治力,实现了 14.81 分的惊人跨越。这些能力同样完美迁移到了 PinchBench 外部基准上,最高斩获了 17.28 分的相对提升。
此外,该框架对初始化策略表现出了极强的鲁棒性。无论模型是经历过轻量级的冷启动预热(Cold-start),还是直接从基座模型“裸考”起步,ClawGym II 都能稳定地引导模型收敛。在 200 到 400 个优化步数(Optimization Steps)的长时间区间内,无论是使用 PPO 还是 GRPO 算法,模型的胜率曲线都呈现出平稳上升的态势,彻底打破了长周期任务强化学习容易中途崩盘的魔咒。在 JobBench 和 OfficeQA 等更具挑战性的泛化任务上,该框架同样带来了持续且一致的性能增益。
总结
ClawGym II 的提出,标志着大模型智能体优化从“调整框架去适应模型”向“通过强化学习让模型驾驭框架”的范式转变。通过沙盒基建、前缀树轨迹重建以及定制化的 PPO/GRPO 算法,它成功将黑盒 Agent 框架转化为高效的强化学习引擎。这不仅为构建能够适应任意复杂执行环境的通用智能体扫清了工程障碍,也为未来多模态、跨系统的 Agent 联合训练指明了切实可行的技术路径。