Envs-FORGE:按学习边界定制训练环境,终端智能体Pass@1提升9.2分
Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
在软件工程、系统运维和终端命令行操作等场景下,终端智能体(Terminal Agent)正在展现出替代人工完成复杂长链任务的潜力。然而,要通过强化学习(RL)进一步提升这些智能体在容器化终端中的解题能力,学术界与工业界面临着一个共同瓶颈:缺乏高质量、可执行且难度匹配的训练环境。
ArXiv URL:https://arxiv.org/abs/2608.14312v1
以往合成强化学习任务时,研究者通常直接套用成熟的大模型提示词策略,例如 Few-shot、Self-Instruct 或 Evol-Instruct。这些固定配方的问题在于对所有种子任务“一刀切”:无论当前模型在某个任务上的表现如何,生成系统都只会机械地将任务改写得更长、更复杂,或者随机生成同类任务。如果一个初始任务对当前策略而言已经难如登天,继续“拔高难度”只会生成毫无训练价值的死局;反之,若任务过于简单,单向拓展也无法触及智能体的能力瓶颈。
针对这一问题,来自香港科技大学、IDEA 研究院和 DataArcTech 的联合团队提出了 Envs-FORGE。该研究放弃了静态的 Prompt 模板,转而将环境合成形式化为一个由验证器奖励驱动的动作决策问题。系统首先依据当前策略在种子任务上的真实执行表现评估其通过率,随后在 6 种包含“增加难度、降低难度、多样化”与“深度拓展、广度拓展”的动作空间中,通过混合整数线性规划(MILP)为每个种子精准选择最能落入模型“学习边界(Learning Frontier)”的演化动作。
在相同的训练规模与资源消耗下,以 Qwen 3.5 35B 为基座并采用 GRPO(Group Relative Policy Optimization)训练,Envs-FORGE 在基准测试 tb-core 上的 Pass@1 相比 Base 模型从 40.0% 提升至 49.2%(绝对提升 9.2 个百分点),在 tb-2.0 上提升 6.4 个百分点,并在 SWE-bench Verified 上取得了 77.1% 的高分,全面超越了传统的静态合成方案。
为什么终端智能体的环境合成不能走“老路”?
在大模型文本生成或简单的单轮问答中,合成数据通常只需关注文本的流畅性与语义相关性。但终端智能体的执行载体是完整的容器化环境,一个标准任务 bundle 通常由五部分强耦合组成:
-
自然语言指令($I$):告知智能体目标是什么;
-
测试脚手架与数据包($D$):环境初始化的文件配置、代码仓库或系统状态;
-
权威解答($S$):确保任务在理论上存在可通行的标准答案;
-
评估测试集($T$):能够自动判分、提供环境奖励的测试套件;
-
可执行镜像环境($E$):承载执行过程的 Docker 容器。
这种多组件耦合导致了环境合成的极高脆弱性。如果仅仅像传统文本改写那样修改了指令,而没有同步修改 Dockerfile、测试套件与参考实现,生成的环境极大概率会出现“指令说 A、测试测 B”的语义漂移,或者直接变成无法通过验证的坏死容器。
更深层次的矛盾在于难度与策略能力脱节。强化学习中样本的价值并不取决于文字是否精妙,而取决于其难度是否正好处在当前策略的学习边界上。根据强化学习与信息论的基本规律,若一个任务的预期通过率极高(接近 1.0),策略无法从中获得有效的策略梯度更新;若预期通过率极低(接近 0),智能体在环境中持续摸黑碰撞却始终得不到正向奖励,同样无法实现有效学习。只有处于通过率在 0.5 上下的探索边界任务,才能为模型带来最大的信息增量。
现有的固定 Prompt 策略在这一点上存在结构性缺陷。Few-shot 倾向于保留原始结构、仅改变具体实体;Self-Instruct 倾向于泛化到同领域的其他任务;而 Evol-Instruct 则一味追求加深约束、增加推理步数。当智能体面对复杂终端运维任务时,这些策略既无法动态回撤难度以构建“搭桥任务(Bridge Tasks)”,也无法根据当前模型真实的失败模式针对性地横向拓展。
动作空间与学习边界建模
Envs-FORGE 的核心洞察在于:在调用 LLM 重写环境之前,先通过数学优化决定这个环境应该朝哪个方向演变。
算法将任务变换分解为一个双维度的动作空间:
-
投影方向(Projection, $\mathcal{A}$):包括
increase(增加难度)、reduce(降低复杂度)、diversify(多样化/横向泛化); -
演化方向(Direction, $\mathcal{D}$):包括
in_depth(深入纵向约束)、in_breadth(拓宽横向覆盖)。
两者笛卡尔积组合,形成了 6 种明确的合成动作候选。特别值得注意的是 reduce 投影的引入:对于那些当前策略通过率为 0 的困难种子,系统主动要求生成模型删去次要干扰、放宽系统约束或简化依赖关系,从而构造出一个可以让智能体逐步建立梯度的过渡环境。
为了评估每一个候选动作将任务推向学习边界的程度,系统先利用当前策略对种子任务 $s_i$ 执行 $n_i$ 次真实 Rollout,根据可执行验证器的返回奖励 $r_{i,t} \in [0, 1]$ 估计种子任务的基础通过率:
\[\hat{p}_i = \frac{1}{n_i} \sum_{t=1}^{n_i} r_{i,t}\]随后,算法引入预设的转移先验参数 $\Delta_a$ 与 $\gamma_d$,对动作执行后的预测通过率 $\tilde{p}_{i,a,d}$ 进行估算:
\[\tilde{p}_{i,a,d} = \operatorname{clip}\!\left(\hat{p}_i + \Delta_a \gamma_d,\, 0,\, 1\right)\]这里将最优学习边界设定为高斯分布的中心 $\tau = 0.5$(方差 $\sigma = 0.2$)。任何一个候选动作的目标分数 $F_{i,a,d}$,即取决于其预期通过率距离理想边界 0.5 的贴近程度:
\[F_{i,a,d} = \exp\!\left(-\frac{(\tilde{p}_{i,a,d} - \tau)^2}{2\sigma^2}\right)\]若某个任务模型已经能稳定答对($\hat{p}_i \approx 1.0$),increase 操作会降低其预期通过率,使其向 0.5 靠拢,从而获得最高分;反之,若任务通过率为 0,reduce 操作将其预期通过率上抬至 0.2~0.4,获得最高分。系统借此摆脱了主观臆测,实现了完全由真实执行奖励锚定的难度调控。
基于 MILP 的全局离散决策
对于单个种子,贪心挑选最高分候选动作是可行的;但在实际的批次生成或包含技能覆盖要求的场景下,局部最优容易导致任务技能分布严重失衡。Envs-FORGE 将动作挑选建模为每个任务上的混合整数线性规划(MILP)。
定义二进制决策变量 $x_{i,a,d} \in {0, 1}$ 表示是否对种子 $i$ 采取投影 $a$ 与方向 $d$。若考虑任务所涉及的技能图谱节点,令 $u_{i,a,d,v} \in {0, 1}$ 表示对应技能节点 $v$ 是否被该动作激活,优化目标被形式化为:
\[\max_{x, u, \xi} \sum_{i,a,d} x_{i,a,d} F_{i,a,d} - \varepsilon \sum_{i,a,d} \sum_{v \in O_{i,a,d}} u_{i,a,d,v} - \lambda \sum_v \xi_v\]其中目标的第一项最大化所有选中任务的学习边界得分;第二项带有极小惩罚项 $\varepsilon$,用于抑制对可选技能节点($O_{i,a,d}$)的不必要冗余扩展;第三项则是对全局技能覆盖缺口松弛变量 $\xi_v$ 的惩罚。求解过程中施加了严格约束:每个种子任务至多触发一个动作;总计选取 $N$ 个输出任务;对于任务固有的必选技能节点($R_{i,a,d}$),只要选择该动作就必须强制覆盖;每个技能节点的总覆盖频次需满足预设配额($\sum u + \xi_v \ge m_v$)。
这种建模方式还有一个巧妙的副产物:现存的经典 Prompt 策略可以被严格视作这一 MILP 决策空间下的特化掩码(Mask)。
-
Few-shot 等价于将动作硬编码锁定为 $(\texttt{diversify}, \texttt{in_depth})$;
-
Self-Instruct 等价于锁定为 $(\texttt{diversify}, \texttt{in_breadth})$;
-
Evol-Instruct 则分别锁死方向维度为纯纵向或纯横向。
通过这种统一视角的约束,研究团队将看似散乱的经验型 Prompt 技巧纳入了同一个运筹优化框架之中。
同步生成与黄金闭环验证
在 MILP 求解器确定了最优动作元组 $(a^, d^)$ 后,合成引擎才正式介入。与普通指令微调仅输出文本不同,生成模型接收到的是一个严格的“多构件协同生成契约”。
Prompt 中明确禁止单修改 Instruction 文本的做法,而是要求 LLM 同步输出或更新五个构件:
-
指令与背景描述:明确目标任务边界;
-
环境依赖文件:包含 Dockerfile、启动脚本或初始测试环境配置;
-
Oracle 验证解:提供标准答案或自动化修复脚本;
-
自动化评测套件:执行即得 0/1 结果的评测脚本;
-
规范化奖励落盘格式:确保容器内执行完毕后能够自动输出标准化评测结果文件。
生成完成后,所有生成的环境 bundle 必须进入真正的执行层闭环检验——即“黄金验证(Gold Verification)”。系统首先运行静态 Schema 校验与 Docker 镜像构建,若构建失败直接剔除;随后在容器中先执行测试套件,确保初始状态处于“失败”或待解决状态(防止任务平凡化);最后载入 Oracle 解法并在容器内运行测试,必须全绿通过且生成预期的 Reward 信号。只有全部通过这些严苛动态验证的环境,才被标记为 Accepted 并正式导出给下游 RL 训练。
实验评测:同等资源下的显著优势
为了保证对比的公平性,评测没有无限制地堆叠训练数据,而是设定了一个统一的刚性终点:所有合成方法必须且仅导出恰好 100 个通过黄金验证的容器环境。下游强化学习统一采用 Qwen 3.5 35B 作为基座模型,使用 GRPO 算法进行训练,Rollout 过程直接由任务自带的测试套件提供奖励,不引入任何额外训练的神经奖励模型。

从上图左侧的关键评测结果可以看出,在无需合成数据训练的原始 Base 模型上,tb-core 和 tb-2.0 的 Pass@1 分别为 40.0% 和 23.0%。引入静态合成配方后,模型性能得到了一定程度的释放:Few-shot 分别达到 43.2% 和 24.1%;Self-Instruct 达到 45.6% 和 27.3%;Evol-Instruct 达到 46.8% 和 25.6%。
而经过 Envs-FORGE 筛选优化的 100 个环境训练后,Qwen 3.5 35B 在 tb-core 上直接跃升至 49.2%,在 tb-2.0 上提升至 29.4%。相比 Base 模型分别取得了 +9.2 和 +6.4 个百分点的显著提升;相比各个基准上表现最强的静态配方,依然保持着 2.4 和 2.1 个百分点的明确优势。
在更严苛的代码修复基准 SWE-bench Verified 上,Envs-FORGE 同样展现了强大的泛化能力,从 Base 的 73.4% 提升至 77.1%,超越了最强静态基线的 75.8%。更进一步的模型规模消融实验表明,这种增益并非 35B 参数规模特有:在 4B、9B、27B 和 35B 全系列 Qwen 3.5 模型上,Envs-FORGE 带来的 tb-core 相对 Base 提升幅度稳定在 6.8 至 9.2 个百分点之间,证明其环境合成策略对不同容量的策略模型具有一致的适配价值。
算力账本:生成质量高于堆量
评测同时记录了各方法在数据合成阶段的完整算力开销。上图右侧清晰展示了各方法达到“100 个黄金环境”所付出的 Token 与尝试代价:
-
Few-shot 消耗 2.27M Token,执行 190 次尝试,生成 194 个任务目录;
-
Self-Instruct 消耗 2.44M Token,执行 226 次尝试,生成 208 个任务目录;
-
Evol-Instruct 消耗 2.45M Token,执行 201 次尝试,生成 200 个任务目录;
-
Envs-FORGE 消耗 2.88M Token,执行 291 次尝试,生成 210 个任务目录。
所有四种方法的 Token 总消耗量均落在 2.27M 到 2.88M 的同一数量级区间内。细致分析尝试特征会发现,Envs-FORGE 的单次尝试平均 Token 开销仅为 9,901,明显低于静态配方的 10,810~12,163 Token。这是因为 Envs-FORGE 通过 MILP 选定了明确的动作指向(例如在部分困难任务上执行精简操作),降低了单次生成的盲目性与冗余度;虽然由于约束更严格导致尝试次数略多,但整体合成成本与传统方案完全持平。
这一结果有力地回应了一个核心疑问:性能的飞跃并不是靠超大规模合成暴力洗出来的,而是在有限的算力预算内,将生成的每一个任务精准钉在智能体最需要的认知断层处。
总结与技术启示
在智能体强化学习的体系中,社区过去的注意力长期集中于算法层面的探索(如 PPO、DPO 到 GRPO)或架构层面的适配(如 ReAct、SWE-agent 脚手架)。然而,随着底层策略能力的提升,训练环境本身的分布质量正在成为新的决定性天花板。
Envs-FORGE 带来的启示十分清晰:
-
合成不仅是“生成”,更是“运筹规划”:脱离智能体当前能力边界的 Prompt 改写本质上是一种随机扰动。引入可量化的学习边界先验,用整数规划统一约束生成动作,能将离散任务演化纳入精确控制。
-
“降级”与“升级”同等关键:传统指令进化一味追求更难更长,但在工程与系统运维场景中,大量种子任务因现实复杂度过高,在训练初期只能充当噪声。提供受控的复杂度削减机制(
reduce),为智能体搭建递进式认知跳板,是环境库走向实用化的必要路径。 -
闭环黄金验证是可执行环境的底线:任何不带可执行 Docker 验证、不带可复现 Oracle 答案的文本合成,在终端智能体 RL 面前都存在极高的虚假奖励风险。
随着开源社区逐步从静态语料预训练转向基于环境交互的强化学习微调,以 Envs-FORGE 为代表的这种由可执行反馈驱动、面向学习边界定向合成的范式,或将成为构建高质量智能体训练生态的标配底座。