AgentBrew:无需验证器与模拟器,单批离线数据让32B逆袭235B

AgentBrew: Offline Tool-Use Agent Learning from Raw Real-World Trajectories

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

AgentBrew:无需验证器与模拟器,单批离线数据让32B逆袭235B 论文图示

在大模型技术从“单轮对话生成”迈向“自主工具调用”(Tool-use Agent)的过程中,工业界正在遭遇一堵坚硬的现实之墙。借助模型上下文协议(Model Context Protocol, MCP)等标准接口,Agent 已经能够直接挂载 GitHub、Notion、PostgreSQL 等复杂业务系统。然而,要把通用大模型训练成能在特定生产环境中稳定执行数十步复杂 API 调用的熟练工,门槛却高得异乎寻常。

ArXiv URL:https://arxiv.org/abs/2609.05837v1

现有的训练范式主要依赖两条路径:一条是在真实环境中设计大量预定义任务与验证器(Verifier),执行轨迹收集后做拒绝采样(Rejection Sampling),只挑完全成功的轨迹做监督微调;另一条则是试图搭建沙盒模拟器,通过在线强化学习(On-policy RL)让模型在数万次交互中试错迭代。

这两条路在真实的工业级应用中几乎都走不通。真实业务系统既没有现成的任务集,更缺乏判定任务是否成功的外置验证器;而高保真模拟器的开发成本不仅极其高昂,甚至常常因无法复刻复杂的系统实时状态而引发严重的 Sim-to-Real(仿真到真实)性能衰退。更致命的是,对线上 API 进行高频反复试错,还会直接面临调用配额限制、高昂的账单开销以及对生产数据造成不可逆破坏的风险。

快手技术团队、南洋理工大学与东南大学联合提出的 AgentBrew 框架,试图打破这一死局。该方案放弃了对外部验证器和模拟器的依赖,仅凭单次采集的原始离线交互数据,便在三个真实的 MCP 复杂应用(GitHub、Notion、PostgreSQL)上,将 Qwen3-32B 基座模型的平均准确率提升了 8.7 个百分点,平均任务得分提升 9.7 分。不仅大幅击败了传统拒绝采样方法,其最终性能甚至跨级超越了参数量数倍于己的 Qwen3-235B 底座模型。

这项工作的核心洞察在于:在复杂的现实工具交互中,所谓“失败的轨迹”绝非毫无价值的废料;真正限制数据利用效率的,是粗暴的轨迹级丢弃机制。

轨迹过滤与细粒度归因的对比

为什么说真实场景的工具学习被“困在筛选里”?

要理解 AgentBrew 的突破,首先需要审视传统工具训练管线的结构性缺陷。

当模型在复杂的真实环境(例如包含数十个涉及页面管理、数据库操作、富文本编辑 API 的 Notion 空间)中执行任务时,往往需要调用多步 API 才能完成一个长链条目标。在这个过程中,即使是业界顶尖模型,端到端的完全成功率也非常低。

传统的过滤训练范式遵循“全有或全无”(All-or-Nothing)的逻辑:只要某个轨迹中的最后一步报错,或者最终产物未完全符合预期,整条包含数步甚至数十步工具调用的轨迹就会被直接当作失败样本丢弃。这带来了双重困境:

一方面,海量原本就极难获取的真实 API 交互数据被白白浪费。一条未能完全达成原定目标的轨迹中,往往包含着极其规范的鉴权、环境检索、参数拼装以及多步正确的中间调用。这些有效操作仅仅因为模型在最终汇总阶段犯了一个小错误,就伴随整条轨迹一同湮灭。

另一方面,很多真实场景根本不存在能够稳定判定“成功与否”的自动化判定器(LLM-as-a-Judge 在面对数十步深层状态变更时极易产生幻觉)。如果直接使用未经过滤的原始轨迹进行监督微调,模型又会不可避免地把错误的调用行为与初始指令强行绑定,导致严重的策略毒化。

AgentBrew 绕开了“依靠外部反馈给轨迹打标签再决定存废”的旧思路,将问题重构成一个纯粹的离线自监督信息解耦过程:既然环境交互已经发生,能否在完全不增加线上调用的前提下,倒推这条轨迹到底做对了什么,并精确算出每一个动作在其中贡献了多少有效价值?

框架全景:三步闭环实现纯离线知识提炼

为了在无验证器、无模拟器、仅有单批交互预算的苛刻约束下完成训练,AgentBrew 设计了一套分阶段的离线处理流程。整个流水线包含三个紧密咬合的环节:基于环境状态的具身探索、双机制经验提炼,以及基于互信息加权的策略微调。

AgentBrew整体框架示意图

第一阶段:基于活体环境的具身任务采样与执行

以往合成任务时,主流做法往往是拿着 API 文档直接让大模型“无中生有”地编写任务。这种做法在真实系统中极易翻车,因为模型生成的任务经常会指向根本不存在的数据库表名、已注销的用户名或非法的配置项。

AgentBrew 的第一步是让 Agent 进入目标真实环境进行具身探索(Grounded Exploration)。系统首先从工具定义中抽象出高阶能力画像(例如“协作权限变更”或“级联数据检索”),然后让模型调用环境的只读类 API 检索当前系统的实体数据和实时状态。在此基础上生成的任务指令集 $\mathcal{I} = {I_n}_{n=1}^N$,天然保证了所引用的资源在系统中真实存在。

拿到这批自生成的任务后,Agent 在真实环境中执行交互,收集交互轨迹。为了防止模型在遇到错误时死循环刷爆接口,系统仅对达到最大步数阈值 $T_{\max}$ 的退化死循环样本做丢弃处理,其余所有自然终止的轨迹全部进入离线语料库 $\mathcal{D}_{\text{raw}}$。在此阶段,没有任何人工介入,也不使用任何质量过滤器。

第二阶段:回溯式任务反推(Retrospective Task Inference)

拿到充满噪声、充斥着失败与偏航的原始轨迹库后,核心瓶颈在于:原始指令 $I_n$ 与实际轨迹 $\tau_n$ 存在严重错配。

为此,AgentBrew 提出了回溯式任务反推机制。研究团队观察到,模型的“思考链”(Chain-of-Thought)中往往夹杂着许多最初的主观预设,容易干扰对客观事实的判断。因此,提炼的第一步是剔除所有思维链文本,仅保留纯粹的动作调用与环境观测序列:

\[\bar{\tau}_n = \{(c_t, o_t)\}_{t=0}^{T_n}\]

随后,引入一个参考模型,要求其严格基于客观发生的环境返回值,反向推导出一个全新的指令 $\hat{I}_n$。这个反推过程受到严格的形式化约束:

这一步的作用极其关键:它把原本“未完成原任务 $I_n$ 的失败轨迹”,重新表征为了“完美完成衍生任务 $\hat{I}_n$ 的成功轨迹”,在指令语义和行为输出之间建立起了第一层刚性对齐。

第三阶段:基于点互信息(PMI)的动作级无损归因

即便重构出了对齐的指令 $\hat{I}_n$,轨迹内部的动作质量依然参差不齐。有些动作可能是此前探索原任务时留下的无用调用,有些动作则是报错的死胡同。如果直接拿 $(\hat{I}_n, \bar{\tau}_n)$ 去做监督微调,依然会学到无效或冗余的行为模式。

如何给没有标注的离线轨迹里的每一个动作打分?AgentBrew 给出了一种极其优雅的数学解法:利用点互信息(Pointwise Mutual Information, PMI)的链式法则进行信息量分解。

在直觉上,如果某个动作所引起的环境状态变化,能够大幅度降低参考模型对目标任务 $\hat{I}_n$ 的预测困惑度,那么这个动作就极大概率是达成该任务的关键核心动作;反之,如果一个动作发生后,模型推断 $\hat{I}_n$ 的难度毫无变化甚至升高,说明该动作是无用功甚至是干扰项。

形式化地,整条简化轨迹 $\bar{\tau}_n$ 与重构指令 $\hat{I}_n$ 之间的总信息量定义为:

\[\text{PMI}(\hat{I}_n;\,\bar{\tau}_n) = \log\frac{\pi_{\text{ref}}(\hat{I}_n\mid\bar{\tau}_n)}{\pi_{\text{ref}}(\hat{I}_n)} = \mathcal{L}_{\emptyset} - \mathcal{L}_{T_n} = \Delta\mathcal{L}\]

其中 $\mathcal{L}{\emptyset}$ 是无任何上下文时生成 $\hat{I}_n$ 的负对数似然(Negative Log-Likelihood),而 $\mathcal{L}{T_n}$ 是在观察到整条轨迹后预测 $\hat{I}_n$ 的负对数似然。两者的差值 $\Delta\mathcal{L}$,精确衡量了整条轨迹消除关于目标任务不确定性的总体贡献。

关键在于分解。借助 PMI 的链式法则,总信息量被完全无损地拆解到了每一个时间步 $t$:

\[w_t = \text{PMI}(\hat{I}_n;\,(c_t, o_t)\mid c_{<t}, o_{<t}) = \mathcal{L}_{t-1} - \mathcal{L}_t\]

从 $t=0$ 到 $t=T_n$ 将各个单步的 $w_t$ 累加,中间项由于差分性质全部对消(Telescoping Sum):

\[\sum_{t=0}^{T_n} w_t = (\mathcal{L}_{\emptyset} - \mathcal{L}_0) + \sum_{t=1}^{T_n}(\mathcal{L}_{t-1} - \mathcal{L}_t) = \mathcal{L}_{\emptyset} - \mathcal{L}_{T_n} = \Delta\mathcal{L}\]

这种数学分解带来了令人惊艳的理论性质:它在严格意义上实现了信息的无损归因——既不虚增任何一分信息,也不遗漏任何一分信息,轨迹蕴含的每一单位有效互信息都被精确归结到了具体促成它的那一个动作上。

在得到单步的原始权重 $w_t$ 后,系统对引起不确定性增加的负值进行截断归零(因为导致混乱的动作如果后续被纠错动作所弥补,纠错动作本身会自然捕获这部分正向信息增量),并在单条轨迹内部将其归一化至 $[0, 2]$ 的区间,生成最终的样本权重 $\tilde{w}_t^{(n)}$。

最终的策略优化目标,变成了一个被互信息精准调权的加权对数似然损失:

\[\mathcal{J}(\theta) = -\sum_{n=1}^{N}\sum_{t=0}^{T_n}\tilde{w}_t^{(n)}\cdot\log\pi_{\theta}(a_t\mid\hat{I}_n, s_t)\]

那些决定性的正确 API 调用获得了数倍的梯度放大,而冗余、报错或游离于目标之外的调用动作,其损失权重则被直接压制至接近于零。

实验结论:小参数模型对大底模的离线反超

为了严苛验证该方法的实战表现,实验选取了由真实生产级系统支撑的三个 MCP 场景:GitHub(代码仓库管理与协同)、Notion(多层级知识库与页面流转)以及 PostgreSQL(关系型数据库实机操作)。测试基准采用了业界通用的 mcp-universe 和 mcpmark,其内建的精确验证逻辑仅在最终评测阶段充当裁判,在整个训练过程中严密隔离。

整个实验全部以开源的 Qwen3-32B 作为全流程统一底座(策略模型、任务反推模型以及 PMI 参考模型均采用该模型),没有借助更大规模闭源模型的“教师蒸馏”。

评测结果揭示了几个具有冲击力的核心事实:

  1. 大幅超越大模型与传统过滤法:经过 AgentBrew 离线微调后的 Qwen3-32B,在三个复杂环境下的平均准确率达到了 18.2%,平均得分达到了 58.7。这一表现直接超过了零样本推理下的 Qwen3-235B 底座模型(15.9% / 54.3%),更大幅领先了基于 LLM-as-a-Judge 判准后微调的经典拒绝采样方案(12.3% / 48.4%)。

  2. 算力与数据效率极高:相比在线强化学习动辄需要数万次高危线上环境交互,AgentBrew 在每个应用下仅采集了约 2500 至 3500 条原始轨迹。得益于自回归生成前缀与 KV 缓存复用,计算全部 8500 条轨迹的逐步 PMI 信用分,在 4 张 H100 GPU 上仅耗时约 9 个小时,后续仅需进行常规的有监督微调。

值得注意的是,真实工具测试集上的绝对准确率看似不高(即便顶尖的闭源旗舰如 Gemini-3 Pro 和 GPT-5,在这些严苛的环境基准上也仅取得 50% 至 57% 左右的绝对完成率),这恰恰反映了生产级环境中状态依赖、参数严苛所带来的真实挑战,也进一步印证了低成本环境自适应框架的紧迫性。

关键消融:机制拆解背后的深层逻辑

为了厘清各个模块对最终表现的决定性影响,研究人员进行了一系列深度消融与特性分析。

为什么不用 LLM 直接给动作打分?

一个直观的替代思路是:既然需要动作级别的权重,为什么不直接把轨迹喂给大模型,让它“指出哪几步做对了并打个分”?

消融对比显示,这一看似符合直觉的做法在实践中全面溃败。在针对动作归因策略的对比实验中,使用参考模型进行自我打分的“LLM Score”方案,在 Notion 环境中的表现断崖式下跌至 7.1% 准确率和 54.7 分,甚至大幅落后于不对动作做任何区分的均等加权 baseline(10.7% / 61.6%)。相比之下,PMI 归因方案则稳定斩获 14.2% 的准确率和 70.1 分的高分。

这揭示了一个在 Agent 训练中极易被忽视的陷阱:大模型在面对自身执行的长上下文、多状态环境轨迹时,其 Prompt 级别的反思与自我打分极不可靠。 它往往难以理解多步 API 之间隐蔽的状态依赖关系,倾向于给出主观且不一致的评价。而基于 PMI 的信息论计算,衡量的是模型自身输出分布的真实概率转移,是一种纯粹客观的统计度量,因而具备了极高的鲁棒性。

PMI 的“自动纠偏与抗噪”防护网

任务反推步骤真的能百分之百保证精准吗?显然不能。即使是非常强大的模型,有时也会推导出与轨迹实际效果不甚匹配的虚假指令。

令人惊喜的是,实验数据表明,PMI 机制天然自带对错误指令的免疫抗体。当反推出来的任务 $\hat{I}_n$ 与实际轨迹 $\bar{\tau}_n$ 发生语义偏离时,整条轨迹中的各个动作在模型眼中都无法提供与该任务相关的有效信息,导致各步的条件互信息极小甚至全部归零。

在 GPT-5 的独立判定辅助下,研究人员将样本分为了“反推对齐良好”和“反推存在偏离”两组。统计分布显示,偏离样本的均值互信息和总互信息绝大多数聚集在坐标轴最底端,在经过负值截断与归一化后,这些样本在反向传播时贡献的梯度权重几乎被自然抹除。这意味着体系不需要人为设定阈值去层层质检,数学本身的度量特性就实现了自适应降噪。

去除任务反推的代价

如果保留 PMI 的动作打分,但跳过任务反推,直接沿用初始目标 $I_n$ 进行训练,会发生什么?

在 Notion 场景的对照实验中,直接沿用初始目标的配置,其准确率从 14.2% 暴跌回 7.1%。这深刻证明了“目标对齐”是工具学习的前提。当模型本来就做错了的时候,强行通过奖励衰减去抑制错误动作,依然无法建立“正确的输入指令到正确的调用模式”之间的有效映射。只有先通过回溯把目标“纠偏”为实际产出,动作级的互信息归因才能真正发挥其点石成金的功效。

工业启示:从“依赖外部奖励”走向“挖掘内在信息”

AgentBrew 的提出,不仅给受制于生产环境限制的 Agent 研发者提供了一套立即可用的工程解法,也为大模型智能体训练范式带来了深层次的启发。

在过去很长一段时间里,强化学习与具身智能领域的研究目光高度聚焦于“如何构建更完美的 Reward”、“如何训练更强悍的 Verifier”以及“如何构建更加庞大的仿真环境”。但真实的工业系统往往是异构、动态且充满隐私限制的,绝大多数业务部门既没有资源给上千个内部 API 搭建沙盒,也无法承受外置判定模型带来的成本与不确定性。

这项研究证明:Agent 在复杂环境中的试错痕迹,本身就是极高密度的信息富矿。 失败与成功在信息论的视角下并非二元对立;只要通过逆向视角重构任务目标,并用严格的信息测度将有效动作从噪声中剥离,单次“盲盒式”的探索交互,就足以沉淀出高质量的专家级策略。这种轻量、完全离线且无序依赖外部奖励信号的方法,或许正是自主智能体走向深水区应用时最需要的一道解题公式。