EvoHarness-RL:自主调度外部支架,8B模型成功率达96.9%

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

EvoHarness-RL:自主调度外部支架,8B模型成功率达96.9% 论文图示

在构建长程(Long-Horizon)智能体(Agent)的实践中,开发者往往很快就会遭遇一道难以逾越的墙:仅仅依靠单次 Prompting 或自回归推理,大语言模型面对动辄数十步、涉及复杂状态变迁的真实任务时,极易陷入迷航。模型可能会在中途忘记环境事实、混淆当前任务子目标的完成状态,或者在同一个逻辑死胡同里反复犯错。

ArXiv URL:https://arxiv.org/abs/2608.05446v1

业界应对这一痛点的标准解法通常被称为“运行时支架”(Runtime Harness)。工程师们在模型外围搭建起错综复杂的基础设施,包括外部记忆模块、子目标追踪器、工具调用框架、格式校验器以及历史日志检索器。然而,这种依赖人工工程的外部支架正在遭遇瓶颈。现存的智能体大多依赖静态的 Prompt 模板或硬编码的启发式规则来决定何时读取记忆、何时记录状态。支架本身不仅繁琐脆弱,更关键的是,模型从未在参数层面真正“学会”如何协调外部支架——模型并不知道外部状态何时值得查询,也不知道每一次调用支架其实都在消耗有限的动作步数与交互预算。

针对这一核心断层,Meta AI 联合伊利诺伊大学厄巴纳-香槟分校(UIUC)提出了 EvoHarness-RL 框架。这项研究不再把外部支架看作不可修改的环境包装或静态脚手架,而是将其抽象为可由策略直接调度的元动作空间,并提出了包含“信念-进度-经验”(Belief, Progress, Experience,简称 BPE)的统一外部状态表示。通过“监督微调(SFT)初始化语义 + 成本感知(Cost-Aware)GRPO 强化学习”的两阶段训练配方,Agent 获得了自主决定何时构建、访问、更新与整合外部支架状态的能力。在具身家庭任务基准 ALFWorld 上,基于 Qwen3-8B 的 EvoHarness-RL 将基线成功率从 47.9% 提升至 96.9%,不仅逼近专有前沿大模型的表现,还揭示了极具启发性的“支架退火”与“经验演化”双重动力学机制。

外部支架的悖论:为何单纯堆砌组件治标不治本?

要理解 EvoHarness-RL 的立意,首先需要看清当前长程 Agent 系统所面临的结构性矛盾。在复杂的具身交互、代码生成或长程工作流自动化中,Agent 必须与动态环境进行长达数十乃至数百个步骤的闭环交互。在这些场景中,模型的决策上下文极为脆弱:

  1. 信念迷失:环境观察充斥着高噪声与局部可见性,模型极难仅凭几千 Token 的滑动窗口准确追踪物理或逻辑世界中关键实体的最新状态。

  2. 进度丢失:复杂的复合目标由多步依赖构成,模型一旦在某一步受挫或遇到重试,就容易混淆哪些子目标已完成、哪些受阻、下一步真正应该推进什么。

  3. 经验隔离:跨回合的经验无法有效内化,模型往往在不同回合中重复尝试已证实失败的死路。

为了修补这些缺陷,学术界与工业界倾向于走“支架工程”(Harness Engineering)的路线:设计越来越厚重的系统提示词、增加向量检索库、引入复杂的外部状态机脚本。然而,这种人工搭建的支架存在致命的协同断层。

一方面是状态形成的噪声挑战。外部组件往往机械地记录所有环境轨迹,导致记忆库迅速膨胀,充满大量与当前决策无关的琐碎信息。另一方面是运行时访问的控制挑战。在真实的交互场景中,调用外部支架的操作并非免费。每一次查询记忆、每一次更新追踪器,不仅消耗模型宝贵的上下文长度与时间延迟,在设定了最大步数预算的环境中,甚至会直接占用宝贵的动作预算。如果模型完全依照提示词在每一步都死板地运行检查清单,系统的执行效率将极其低下;如果减少调用,模型又会在需要关键先验时缺乏支持。

核心症结在于:现有的外部支架是“外挂”上去的,决策模型从未参与过支架使用的策略优化。如果模型不能把“管理与调用支架”内化为自身策略动作的一部分,外部系统就永远只是一个笨重的拐杖,无法形成自适应的闭环协同。

BPE 三元抽象:为大模型统一外部状态与元动作

为了打破支架与模型策略之间的隔阂,EvoHarness-RL 的第一步是将异构的外部组件收敛为一种通用的功能接口。研究团队观察到,无论具体的任务领域多么不同,长程执行失败的根本诱因高度一致。因此,他们将外部支架统一划分为三种面向策略的核心状态——Belief(信念)、Progress(进度)与 Experience(经验),合称 BPE 架构。

EvoHarness-RL 架构概览

如上图所示,在每个交互时间步 $t$,外部支架向智能体渲染由三部分构成的状态:

\[\mathcal{H}_t = (B_t, P_t, E_t)\]

在此抽象之上,EvoHarness-RL 将原本繁杂的外部接口折叠为四个精简的元动作(Meta-Actions):

\[\mathcal{A}_{\mathrm{bpe}} = \{\text{track}, \text{commit}, \text{recall}, \text{note}\}\]

这组元动作构成了模型与 BPE 支架交互的标准协议。模型可以通过 track[object]track[world] 定向查询当前信念库中的实体属性或全局态势;通过 commit[subgoal] 将刚刚达成的阶段性成果或决策意图固化到执行记录中;通过 recall[query] 从经验库中检索相关的历史先验或规避策略;通过 note[insight] 将执行过程中最新捕获的教训暂存入临时缓冲区。

通过将支架元动作与环境原生动作空间直接求并集:

\[\mathcal{A} = \mathcal{A}_{\mathrm{env}} \cup \mathcal{A}_{\mathrm{bpe}}\]

模型的动作策略 $\pi_\theta$ 在做决策时,不再只是在“向左走”或“拿取物体”之间做选择,而是可以在“继续推进环境动作”与“停下来整理进度或检索经验”之间动态权衡。外部支架从此从环境外部的静态提示词,降维变成了策略网络随时可调用、可优化的第一类公民(First-Class Citizen)。

两阶段训练配方:从模仿示范到成本感知的 GRPO

将支架动作纳入动作空间后,新的挑战随之而来:如果未经训练,基础模型根本不理解 committrack 这些元动作的精确语意,极易产生语法幻觉;更重要的是,模型无法预判何时使用外部动作才划算。为了解决这些问题,EvoHarness-RL 引入了一套解耦的两阶段训练流水线。

EvoHarness-RL 训练流程

第一阶段:监督支架微调(Supervised Harness Fine-Tuning)

第一阶段的目标是为基础语言模型建立动作语意基底。研究团队利用高质量专家教师轨迹,生成包含环境观察、BPE 状态视图以及下一步动作的标准示范。输出格式统一规范为包含思考链与具体动作的格式:<think>...</think><action>...</action>

在这一阶段,模型基于 Qwen3-8B 进行全参数监督微调。其核心作用不是让模型直接学会最优调度,而是解决“合法性”与“语义理解”:让模型理解何种情况下可以发起 trackcommit 该如何填写子任务名称,以及 note 记录教训的标准句法。同时,教师在收集轨迹过程中沉淀下来的经验数据,直接构成了第二阶段强化学习时经验库的初始种子。

第二阶段:成本感知 GRPO 强化学习

监督微调只能让模型模仿“别人是怎么用支架的”,但它无法教会模型权衡成本。在没有探索奖励的情况下,模型很容易退化为机械式的模式匹配。为此,EvoHarness-RL 在第二阶段采用了群组相对策略优化(GRPO, Group Relative Policy Optimization)。

在环境交互中,执行一个外部支架动作同样消耗步数。如果模型过度滥用支架,步数预算耗尽后同样会被判失败;如果完全不用,又会丧失长程推理的精度。为了引导策略找到最佳平衡点,研究人员设计了精细的轨迹级综合奖励函数:

\[R(\tau) = R_{\mathrm{succ}}(\tau) + \lambda_{\mathrm{eff}}R_{\mathrm{eff}}(\tau) + \lambda_{\mathrm{div}}(u)R_{\mathrm{div}}(\tau) - \lambda_{\mathrm{spam}}R_{\mathrm{spam}}(\tau) - \lambda_{\mathrm{inv}}R_{\mathrm{inv}}(\tau)\]

这套奖励机制由五个核心信号共同驱动:

  1. 任务成功主奖励($R_{\mathrm{succ}}$):这是决定性的稀疏信号,只有完整解决长程目标时才给予回报。

  2. 效率奖励($R_{\mathrm{eff}}$):基于完成任务所消耗的实际步数与理论基准步数的比值计算,严厉惩罚拖沓无意义的迂回动作。

  3. 退火动作多样性奖励($R_{\mathrm{div}}$):衡量轨迹中不同动词调用的丰富度。为了防止强化学习早期策略快速坍缩到狭隘的环境动作中,多样性奖励的权重系数 $\lambda_{\mathrm{div}}(u)$ 采用了余弦衰减调度:

\[\lambda_{\mathrm{div}}(u) = \frac{\lambda_{\mathrm{div}}^{\max}}{2}\left(1 + \cos\frac{\pi u}{U}\right)\]

其中 $u$ 是当前的 RL 轮数,$U$ 为整个退火周期。这一机制在训练初期大力鼓励模型大胆探索各种 BPE 元动作,而在训练后期逐渐降权,迫使模型剔除冗余动作,走向极致的高效执行。

  1. 滥用惩罚($R_{\mathrm{spam}}$)与非法格式惩罚($R_{\mathrm{inv}}$):针对连续多次重复发出相同支架查询的死循环行为、或生成破坏交互协议的畸形文本进行针对性扣分,从根本上杜绝退化解。

通过这一设计,GRPO 不仅在优化最终的任务达成率,更在策略内部重构了一套隐式的“成本-效益分析机制”,迫使模型在漫长的交互过程中精准识别出那些非查不可的枢纽时刻。

核心实验评估:8B 模型逼近专有前沿大模型

为了检验 EvoHarness-RL 的威力,研究人员在 ALFWorld 具身基准上展开了全面评测。ALFWorld 包含六类极具挑战性的长程家庭场景任务,涵盖简单的物体拾取与放置(Pick)、灯下检查(Look)、清洁后放置(Clean)、加热后放置(Heat)、冷却后放置(Cool)以及双目标放置(Pick2)。其中后几类任务要求模型严格遵循状态前置条件,极易因记忆失效而崩溃。

显著的主任务突破

评测对比了三类主流方案:未经训练的专有前沿大模型(Claude Opus 4.5、GPT-4.1、GPT-5)、静态外挂记忆方案(包括 ReAct、ExpeL、ReasoningBank、MemP、SkillOS-base 等),以及具有参数优化或结构探索的可训练方案(标准 GRPO、SkillOS、SkillRL)。

实验结果呈现出极具说服力的梯度跨越:

泛化性检验:未见环境下的真实自适应能力

智能体研究最忌讳的是在训练集闭门造车,死记硬背环境拓扑。当将训练好的策略迁移至完全陌生的房间布局与任务实例(ALFWorld Unseen Split)时,更深层的机制差异显现了出来:

Qwen3-8B ReAct 在未见环境下的成功率仅有 50.0%。值得注意的是,经过监督微调的 EvoHarness-SFT 模型在该测试集上的成功率从训练集的 68.6% 轻微下滑至 69.4%,甚至不如纯推理期 Prompt 方案的表现(77.6%)。原因在于,纯模仿学习使模型把特定训练环境下的支架调用频率误当成了绝对真理,学到了僵化的模式。

然而,经过完整 RL 训练的 EvoHarness-RL 在未见环境上取得了 86.6% 的高成功率。强化学习没有让模型死记硬背外部知识库的内容,而是重构了模型何时访问外部知识的决策本能。这种自适应调度的泛化能力,正是长程智能体最需要的核心素质。

核心动力学发现:支架退火与经验自进化

相比于最终分数的飙升,这项研究最引人入胜的洞见在于揭示了强化学习过程中发生在智能体与支架之间的两条共生演化轨迹。

动力学之一:策略端的“支架退火”(Harness Annealing)

在以往的直觉中,人们可能会假设性能越高的 Agent,调动外部工具和记忆的次数越频繁。然而,EvoHarness-RL 在训练过程中展现出了截然相反的演变曲线。

支架调用在 GRPO 训练期间的退火现象

如上图所示,当策略刚从 SFT 检查点开始接入 GRPO 时,Agent 在交互初期会表现出极高频的支架调用行为,大量使用 trackrecall 来试探状态、检索先验。此时外部 BPE 支架扮演着密集的认知脚手架,托底智能体的早期探索。

但随着强化学习轮数的演进,轨迹中的支架动作调用频率呈现出戏剧性的断崖式下跌,最终平稳收敛在平均每个任务回合仅调用约 1 次支架动作的极简水准。

这种现象被作者命名为支架退火(Harness Annealing)。在效率奖励与任务成功的双重驱动下,原本需要反复依赖外部查询才能确定的推理套路和环境因果模式,逐渐被“蒸馏”并内化进了语言模型自身的参数权重中。模型不再需要在每一个细微决策前向外部系统打报告,而是学会了将外部支架视为昂贵的救急手段:唯有当环境的不确定性极高、或是长程目标发生重大跨越的关键拐点,模型才会精准地发出一次 recalltrack。从密集依赖转向节制访问,标志着模型完成了从笨拙模仿到高效协同的跃迁。

动力学之二:支架端的“经验自进化”(Harness Evolution)

在模型策略端发生“退火”的同时,外部支架本身的经验存储库也在经历深刻的新陈代谢。

与简单的日志堆积不同,BPE 中的经验库是一个具有生命周期的活性基底。在并行的训练轨迹收集期间,模型发出的 note[insight] 先行暂存入临时缓冲区;在每个训练 Epoch 结束时,专门的整合模块会对累积的见解进行语义去重、冲突裁决与结构性合并。

监测数据显示,经验库在训练最初阶段经历了一段野蛮生长,涵盖基础探索、特定任务规程、常见失误反思与搜索先验的条目总数迅速飙升。但随着训练深入,粗放式扩张被精细化的剪枝所取代:那些被调用频次极低、已被模型内化为参数直觉的陈旧规则被主动遗忘剔除,而反复被检索并证明有效的核心原则被进一步提炼固化。经验库最终稳定为一个结构紧凑、高度提纯、适应性极强的专业技能池。

这就构成了完美的互补闭环:模型策略通过强化学习学会了“何时调用外部状态”,而外部支架通过周期性整合学会了“该保留什么高价值经验供模型调用”。

走向自进化的智能体架构

Meta AI 与 UIUC 的这项研究,为当下处于瓶颈期的 Agent 架构设计提供了一条清晰的突围思路。

长期以来,开发社区陷入了一种无休止的“支架工程内卷”:只要大模型在长程任务中迷路,工程师们就会在 Python 层面叠加更多的防御性代码、写更长的系统提示词、拼接更繁琐的外部状态机。这种做法不仅加剧了系统的工程脆弱性,也严重低估了大语言模型自身的策略优化潜力。

EvoHarness-RL 的成功证明了一个截然不同的范式:外部支架不应该是一组固定不变的静态规则,而应当是一个对模型策略开放的动态控制接口。

当把外部信念追踪、子目标进度管理与长期经验沉淀统一抽象为语义清晰的动作元语,并借助强化学习让模型直接面对调用的真实收益与成本时,模型能够展现出极强的自组织能力。从早期对外部拐杖的高度依赖,到后期内化认知并实现精准调用,这种“支架退火”与“基底进化”的动态平衡,正是实现高可靠、长续航自主智能体的必经之路。

对于正在构建复杂工作流 Agent、代码演进 Agent 以及具身智能系统的开发者而言,这一工作指明了一个明确的方向:停止继续堆砌臃肿的外部硬编码逻辑,把调度支架的权力还给模型本身,通过端到端的策略强化学习,让模型在探索中学会与自己的外部记忆共生演化。