PATS:为Agent打造动态训练脚手架,推理零依赖且最高涨点18.6%

PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在大语言模型(LLM)智能体(Agent)的强化学习训练中,长流程决策任务一直是一块难啃的硬骨头。当初始策略(Policy)面对复杂多步环境时,往往会陷入“反复在同一个地方犯错”的窘境。在使用类似 GRPO(Group Relative Policy Optimization)这类基于组内对比的强化学习算法时,如果一个组内的所有采样轨迹全部失败,奖励方差直接归零,策略就无法获取任何有效的梯度更新信号,训练随之陷入停滞。

ArXiv URL:https://arxiv.org/abs/2607.21419

为了打破这种死锁,近年来的主流思路大多转向“技能外挂”(Skill-centric):利用外部知识库或反思记忆,在 Prompt 中注入经验技巧。但这类方法通常陷入了另一个极端——它们将技能视为最终推理时的永久拐杖,导致模型严重依赖冗长的上下文提示,既推高了部署成本,又限制了泛化能力;另一些尝试逐步丢弃技能的方法,又往往因为策略尚未真正内化能力而导致性能雪崩。

最新提出的 PATS(Policy-Aware Training Scaffolding)框架提供了一种截然不同的解法:它不再把外部技能当成推理资产,而是将其重构为随模型能力演化、在部署时完全剥离的“动态训练脚手架”。在弱策略阶段,脚手架提供强力先验引导模型完成探索;随着策略变强,冗余的支架被动态修订或拆除。最终,部署模型不仅无需任何外部技能挂件,反而在 ALFWorld 和 WebShop 等基准上较基线提升高达 18.6%,同时在推理阶段砍掉了 25% 至 50% 的 Token 消耗。

ALFWorld 150步训练动态曲线

探索困境:为什么“推理有用的技能”反而会毁掉强化学习?

在探讨 PATS 的设计之前,必须先厘清一个被长期忽视的核心矛盾:在推理阶段表现最好的 Prompt 技能,在强化学习训练阶段往往并不是最优的

推理任务追求的是即时确定性,即 Prompt 越详尽、约束越死,模型犯错的概率就越低。然而,以策略梯度为代表的强化学习,其核心驱动力在于“差异化的探索轨迹”。为了让策略计算出非零的优势函数(Advantage),同一个任务批次(Rollout Group)中必须同时存在成功的探索与失败的尝试。先前的理论研究表明,当探索成功率维持在 0.5 左右时,组内对比产生的梯度信号最丰富,训练效率最高。

如果直接给训练中的模型塞入一份极其完美的“专家操作手册”,所有采样子轨迹可能轻易取得相同的高分,组内对比失去方差;更糟糕的是,模型学会的是“如何照抄 Prompt”,而非在自身参数中建立状态到动作的内在表征。相反,如果不给任何先验,弱策略在多步交互中就会呈现大面积的零回报,探索完全失效。

PATS与其他技能学习及课程学习范式对比

如上图所示,现有的处理范式各有缺陷:单调技能扩张(Skill-expansion)不断累积 Prompt,模型最终难以脱离外部提示;单调技能移除(Skill-removal)试图硬性剥离技能,模型性能往往随之下滑;传统的数据课程学习(Curriculum Learning)则需要人为控制任务分布的难度排期。PATS 则开创了第四种范式:不改变底层任务分布,仅通过监控策略自身的能力水位,自适应调节训练上下文中的“脚手架”厚度,在训练终点将脚手架彻底拆除

PATS 核心机制:以证据卡片驱动的动态脚手架

PATS 的全流程被设计为一个闭环系统,其核心在于让外部文本支持始终跟随策略能力动态适配。整个训练脚手架 $\mathcal{B}_k$ 在语义上分为三个层次:通用操作原则(General)、特定任务类型规则(Task-specific)以及错误规避记忆(Mistake)。

PATS框架整体架构与并行更新流程

在每一个训练迭代中,当前策略 $\pi_{\theta_k}$ 会携带脚手架渲染出的上下文 $z_{\tau,k}$ 进行环境交互与轨迹采样。采样完成后,这些轨迹数据兵分两路、并行处理:一路送入标准的 GRPO 流程计算环境奖励并更新模型参数;另一路则被聚合为证据卡片,驱动脚手架的自适应调整。

1. 规避单点噪声的组级“证据卡片”

如果直接根据单条失败或成功的轨迹来修改外部规则,系统很容易被环境分支的偶然性或采样的随机噪声带偏。PATS 将同一个具体任务 $q$ 下并行的 $n$ 条轨迹打包为一个组(Group),提取出胜负对比:

\[c_{q,k} = \operatorname{Card}\big( q, \tau(q), s_{q,k}, \Phi(G_{q,k}^{+}), \Phi(G_{q,k}^{-}), \operatorname{Rep}(G_{q,k}^{+}), \operatorname{Rep}(G_{q,k}^{-})\big)\]

其中 $s_{q,k}$ 表示该任务组的即时成功率,$\Phi$ 提取成功与失败轨迹的对比特征。随后,框架将同类任务(Task Type)下的卡片进一步平滑聚合为类别级证据 $c_{\tau,k}$。这一聚合机制既保留了任务内部“为什么成功、为什么失败”的直接对比,又过滤掉了单次尝试的偶然扰动。

2. 四大原语构成的能力控制器

脚手架究竟该增、该减,还是该改?PATS 引入了一个基于滑动平均成功率 $\bar{s}_{\tau,k}$ 的状态机控制器。根据分类能力水平,系统自动在四种控制原语之间切换:

3. 确定性校验与原子提交(Atomic Commit)

提炼模型仅负责提出编辑提案,绝对不能直接篡改脚手架。所有提案必须经过一套严格的确定性校验逻辑:新增条目必须至少有两张证据卡片交叉印证,修改与删除必须指向已存在的条目,且严格受限于当前原语的方向约束(例如 COMPRESS 模式下总长度必须非递增)。只有通过验证的提案才会通过原子提交写入下一阶段的快照;未通过的则作为空操作(no-op)丢弃。

尤为关键的是,脚手架更新与策略的梯度反传完全解耦并行。更新脚手架无需对脚手架生成器做强化学习,也不产生额外的反向传播计算,整个适配过程不会拖慢常规 RL 的训练吞吐。

训练与解耦:冷启动对齐与零外挂部署

将文本脚手架引入强化学习,一个避不开的前提是:模型得能“读懂并准确落实”这些规则。未经初始化的基础模型面对结构化的脚手架提示,往往会出现忽略指令或幻觉执行。

为此,PATS 设定了一个极其轻量的阶段一预热(Warmup SFT):利用少量离线数据,让模型熟悉脚手架的格式输入与动作输出映射。请注意,这个阶段仅仅是为了建立 Prompt 接口认知,并不产生或更新任何脚手架内容。

一旦进入强化学习阶段,所有外部脚手架调整均由真实采样的在线经验驱动。损失函数完全遵循环境奖励导向的 GRPO 目标,并在剪枝区域内限制策略偏离:

\[\mathcal{L}_{\mathrm{GRPO}}(\theta) = -\frac{1}{n}\sum_{i=1}^{n}\frac{1}{L_i}\sum_{\ell=1}^{L_i} \min\Big(\rho_{i,\ell}(\theta)\widehat{A}_i,\, \operatorname{clip}(\rho_{i,\ell}(\theta), 1-\epsilon, 1+\epsilon)\widehat{A}_i\Big) + \beta D_{\mathrm{KL}}(\pi_\theta\|\pi_{\mathrm{ref}})\]

在部署阶段,整个脚手架(包括通用规则、任务规则和防错记忆)被彻底置空($z = \varnothing$)。测试时的模型完全裸机运行,面对环境直接输出决策。这彻底斩断了过往技能框架在测试期对长 Prompt 检索的依赖。

实验评测:更高胜率,更少开销

研究团队在具身环境基准 ALFWorld、复杂电商决策基准 WebShop 以及七个单跳/多跳搜索增强问答(Search-augmented QA)基准上进行了全量评测。不同于以往工作常用的抽样子集,该研究全部在固定全量测试集上评测,以杜绝数据选择偏差。

1. 具身与交互任务表现

在 ALFWorld 和 WebShop 上,PATS 展现出了显著超越纯 GRPO 以及传统技能保留方法的综合性能。

在 1.5B 规模下,脱去脚手架的 PATS 在 ALFWorld 上的成功率(SR)达到了 80.71%,相比原生 GRPO 的 67.86% 提高了近 13 个百分点;在 WebShop 上的得分从 0.528 提高到了 0.563。扩展到 7B 规模时,优势进一步扩大:PATS 在 ALFWorld 上冲到了 91.43%(对比 GRPO 的 84.76%),在 WebShop 上达到了 78.40%(对比 GRPO 的 70.07%)。

更令人瞩目的是推理效率。由于在测试阶段剥离了全部脚手架,PATS 在两个环境中的平均交互 Token 消耗相比基线下降了 30.4% 至 38.7%。反观那些在推理期依旧保留 SkillBank 的模型(如 SkillRL),虽然胜率尚可,但每个交互轮次都背负着庞大的检索上下文,推高了计算开销与延迟。

2. 搜索增强 QA 的泛化能力

在包含 NQ、HotpotQA 及五个跨域数据集的搜索增强问答任务中,PATS 在仅使用 Qwen2.5-7B 进行训练的情况下,展现出了出色的迁移能力。

相比于在训练中逐步硬性丢弃技能的强基线 SKILL0,PATS 在零技能测试环境下的平均分高出 3.5 个百分点。面对始终保留完整技能库的 SkillRL,PATS 取得了与其极其接近的准确率(仅在 $\pm 3\%$ 范围内波动),但平均 Prompt Token 消耗却骤降了 32.1%。这直接证明:PATS 并没有因为抛弃脚手架而丢掉解题能力。

机理拆解:脚手架是如何被策略“吸收”的?

为了严谨回答“脚手架是否真正改变了模型的内在行为”,作者设计了深入的消融实验与诊断测试。

1. 语义修订(REVISE)是性能的核心支柱

在针对 1.5B 模型在 ALFWorld 上的消融分析中(见下表),如果彻底移除在线脚手架更新,模型表现立即下跌 7.14 个百分点。而一旦在原语中拿掉 REVISE 操作(即控制器只能粗暴地增减,不能修改合并已有条目),模型成功率狂跌 12.62 个百分点,成为除接口预热外破坏性最强的消融项。

实验变体配置 成功率(SR %) 性能变化($\Delta$)
完整 PATS 框架(无外挂部署) 80.71 $\pm$ 1.54 -
移除在线脚手架(仅保留静态预热) 73.57 $\pm$ 0.89 -7.14
移除组级聚合(退化为单轨迹反馈) 77.14 $\pm$ 4.77 -3.57
仅允许扩张操作(EXPAND-only) 74.05 $\pm$ 9.04 -6.66
冻结脚手架(不可更新) 72.86 $\pm$ 8.81 -7.85
移除语义修订(w/o REVISE) 68.10 $\pm$ 6.45 -12.62
静态专家库热启动(Warm-start) 70.24 $\pm$ 7.73 -10.47

这个结果击碎了“只要给模型不断加经验就能学好”的直觉。在训练中段,策略遇到的错误模式已经发生位移,盲目累加只会制造信息混乱;唯有结合策略当前错误进行精准的语义修正,才能保持对探索的持续牵引。

此外,如果改用单轨迹(Trajectory-wise)生成卡片,方差会显著增大($\pm 4.77$),验证了组级对比平滑环境噪声的必要性。

2. 从外部拐杖到内在参数:内化过程的可视化诊断

脚手架在训练后被丢弃,策略到底有没有真正把知识变成自己的?作者在受控诊断实验(Stage 0)中监控了模型在无脚手架状态下的负对数似然损失(NLL)。

Stage 0阶段策略对脚手架知识的内化曲线

如上图所示,随着强化学习迭代步数的增加,模型在脱离脚手架时的预测损失曲线持续平稳下降。在 50 步内,无外挂状态与有外挂状态之间的 NLL 差距相对缩窄了 38.3%。这用强有力的信息论证据表明:原本由上下文承载的规则、约束与决策模式,正在通过强化学习的参数更新,逐步沉淀到策略模型的权重深处。

在测试阶段,脚手架训练出的模型在完全裸跑下的成功率($22.97\%$)显著高于未使用脚手架训练的模型($17.66\%$);若在此时把脚手架重新装回,性能更可进一步跃升至 $34.38\%$。这证明脚手架不仅传授了独立执行能力,还兼具了未来上下文扩展的适配潜力。

总结与启示

PATS 的成功打破了以往智能体学习中“要么做重推理 Prompt,要么硬啃纯 RL”的两难壁垒。它给整个大模型强化学习社区带来了极具价值的认知迭代:

通过将外部知识库降级为可拆卸的“脚手架”,PATS 既享受了先验知识带来的探索破局红利,又在最终交付时交出了一个轻量、高效、无外部依赖的高性能纯血模型。这种以策略进化为中心的动态辅助思想,无疑为下一代复杂长流程 Agent 的端到端强化学习训练提供了极具启发性的工程与理论范式。