Branch2Skill:用推理树兄弟分支提炼稠密监督,技能进化Token消耗降低73.2%

Branch2Skill: Efficient Skill Evolution Through Reasoning Trees

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在大模型智能体(LLM Agent)的研究脉络中,如何让模型“在不更新神经网络权重的前提下变得越来越聪明”,一直是个兼具理论意义与工程价值的核心命题。从最早的 Reflexion 语言反思,到后来将经验沉淀为可重用的模块化代码、动作模版或自然语言规则,“技能进化”(Skill Evolution)已成为赋予冻结大模型持续学习能力的关键范式。

ArXiv URL:https://arxiv.org/abs/2608.08677v1

但现存的技能进化框架普遍面临一个隐蔽却致命的效率瓶颈:它们几乎都在单条完整轨迹(Single Trajectory)上做文章。当智能体解决任务失败时,往往是早期某个隐蔽的分支走错了路;随后模型在错误的假设上苦苦挣扎,后续所有动作都沦为无谓的修补或连锁反应。外部评估器在给整条长轨迹做后验归因时,往往只能提炼出一个模糊或单一的改进点。要想进一步改进,就必须开启下一轮“重新生成-重新诊断-更新技能”的昂贵循环。

北航、快手、南洋理工、港理工与莱斯特大学等机构联合提出的 Branch2Skill,试图打破这一恶性循环。这项研究的核心直觉非常纯粹:比起反复跑完整的长链条,不如在推理树的同前缀兄弟分支(Sibling Branches)中就地提炼正反对比。通过将蒙特卡洛树搜索(MCTS)产生的中间分支转化为高密度的监督信号,Branch2Skill 让单次探索生成的一棵推理树同时覆盖多个决策深度的成败教训。

实验结果令人振奋:在涵盖数学推理、专业问答、表格操作与具身环境等 6 个主流基准的横向评测中,以 GPT-5.5 作为目标模型时,Branch2Skill 相比当前最具代表性的基线方法 SkillOpt,在技能进化阶段的 Token 消耗直降 73.2%,同时在全量测试集上的综合得分提升了 9.3%,每百万 Token 带来的收益倍增超过 4 倍。

推理树提供多步稠密监督

单轨迹反思的困局:为什么技能进化总是“又慢又贵”?

要理解 Branch2Skill 的价值,必须先透视过往技能进化算法的底层逻辑缺陷。

现有的进化类工作(如 Trace2Skill、SkillOpt 等)通常将当前技能注入系统提示词,让目标模型生成端到端的解决路径。如果模型成功了,轨迹作为正向模版被吸收;如果失败了,就将执行日志扔给专门的“优化器大模型”,试图从中推断当前技能哪里有缺陷。

但问题在于,单条采样轨迹只能展现模型策略空间中的一个极其狭窄的截面。在复杂的长程任务中,最常见的失败模式是“步步错源于一步错”:比如在第一步把数据库表头字段理解偏差,导致后序四五步查询和计算全部崩塌。如果在整条轨迹结束之后再做全局反思,优化器大模型很容易把注意力分散在后序的症状上,而不是源头的病因。

即便像 SkillAdaptor 这样引入了“定位首个可操作错误点”的诊断策略,也无法改变其核心约束——每次长程交互只能提供极度稀疏的反馈。想获取另一个不同情境下的错误,智能体必须重新调用模型生成一条新轨迹。反复的 Rollout 和诊断使得 Token 消耗像滚雪球一样急剧攀升。

相比之下,树搜索(Tree Search)在推理阶段早已被证明具有极高的探索价值。在每一个关键节点,模型不会孤注一掷,而是会展开多个候选步骤。这些候选步骤天然共享完全相同的上文与历史前缀,仅在当前决策点产生分流。这意味着,树结构本身就已经完成了严格的变量控制:同一个状态下,为什么动作 A 导向了死胡同,而动作 B 保留了成功的希望?这种局部对比所包含的信息量,远比两条各跑各的独立完整轨迹高得多。

以往的工作(如 SVPO、Math-Shepherd 等)大多把树搜索用于训练过程奖励模型(PRM)或直接做单次推断选择;而 Branch2Skill 的巧妙之处,在于将原本在推断结束就扔掉的树分支信息,提炼并沉淀为了长效、显式的自然语言技能资产。

Branch2Skill 架构拆解:如何把一棵树榨取成结构化技能?

Branch2Skill 将技能更新抽象为周期性的离散步进过程。整个系统由两个角色组成:一个是负责生成并评估推理节点的目标模型(Target Model),另一个是负责阅读树证据并改写技能文档的技能优化模型(Skill Model / Optimizer)。

Branch2Skill 整体架构流程

整个流程严密而精炼,主要由三个阶段构成:

1. 预算受限的逐步推理树构建

针对当前批次的每一个训练问题,目标模型在固定当前技能 $\mathcal{K}_t$ 的前提下,从空根节点 $S_0$ 开始自上而下展开探索。与传统单次采样输出完整答案不同,树中的每个非根节点仅代表单一推理步骤或环境操作。

为了在广度与深度之间达成平衡,算法使用经典的 PUCT(Predictor Upper Confidence bounds applied to Trees)算法来调度计算资源:

\[\operatorname{PUCT}(u,v)=Q(v)+c_{\mathrm{puct}}P(v\mid u)\frac{\sqrt{\max(1,N(u))}}{1+N(v)}\]

其中 $Q(v)$ 表示节点 $v$ 累积的值函数估计,$P(v\mid u)$ 是先验策略概率,$N(u)$ 和 $N(v)$ 分别代表父节点与子节点的访问计数,$c_{\mathrm{puct}}$ 则是探索系数。这保证了模型既能深度挖掘高分路径,又不会忽视访问频次较低但可能蕴藏潜力的备选分支。当遇到预算耗尽或深度触顶时,算法还会对有效的非终止前缀执行一次单向补全,确保这些分支能产生明确的终端结果,从而避免未竟路径无法提供可信评价。

2. 共享前缀下的局部证据抽取

树构建完成后,并非全盘一股脑塞给优化模型。为了防止冗杂无关的信息冲垮上下文,Branch2Skill 实施了一套极其克制的证据切片策略:

首先,在树中筛选出一条精英路径(Elite Path) $\pi^{\star} = \left(S_{1}^{i_{1}^{\star}},\ldots,S_{L}^{i_{L}^{\star}}\right)$。如果树中存在能最终解决问题的成功路径,则优先锁定它;若搜索未果,则选取价值回传得分最高、探索最充分的强失败路径,以便从中提炼最接近成功的教训。

随后,沿着这条精英路径的每一个深度 $d$,系统提取所有与当前选中节点共享同一个父节点的兄弟节点集合:

\[\mathcal{B}_{d} =\Bigl\{S_{d}^{j}\,\Bigm\vert{}\,\operatorname{pa}(S_{d}^{j})=\operatorname{pa}(S_{d}^{i_{d}^{\star}}),j\neq i_{d}^{\star}\Bigr\}\]

这些切片是高度浓缩的局部对比实验:在相同的局部背景下,精英节点的动作与备选动作的后续走向截然不同。优化器模型无须进行复杂的后验因果推断,只需要对比同一前缀下的兄弟节点差异,就能立刻发现目标模型在哪个具体节点更容易误判、落入陷阱。

3. 多步证据聚合与门控验证

批次内所有训练样本提取出的树切片证据会被汇总在一起,统一提交给技能优化模型。

优化器并不是无约束地自由发散写作,而是被限定在三种明确的编辑操作中:追加(Append)、替换(Replace)与删除(Delete)。优化器依据多步证据,审视现有技能文档中哪条指引误导了兄弟节点的失误、哪条规则在精英路径中起到了正面兜底作用,进而输出一份完整的候选技能 $\widehat{\mathcal{K}}_{t+1}$。

为了杜绝大模型自我改写时常出现的过拟合或退化现象,Branch2Skill 设置了严格的直接验证门控(Direct Validation Gate):

\[\mathcal{K}_{t+1}=\begin{cases}\widehat{\mathcal{K}}_{t+1},&\mathbf{g}(\widehat{\mathcal{K}}_{t+1};\mathcal{V})\succeq\mathbf{g}(\mathcal{K}_{t};\mathcal{V})\\[4.0pt] \mathcal{K}_{t},&\text{otherwise}\end{cases}\]

候选技能会直接在固定的验证集 $\mathcal{V}$ 上进行免搜索(Zero-Search)的标准推理评测。只有当新的技能版本在各项关键指标上“完全不低于”历史技能时(即满足 Pareto 非劣或更优),才会被系统正式合并采纳;否则坚决回滚。这种确定性的门控机制,从工程上根除了技能“改好了一个样本却搞垮了一片样本”的灾难性遗忘隐患。

具身案例深潜:局部对比如何映射为自然语言指令?

为了直观展现同前缀对比的精妙机制,论文在 ALFWorld 具身控制任务中给出了一个典型用例。

ALFWorld 任务中基于树分支的证据提取与技能修改示例

在图中的具身场景中,智能体的目标是清洗一个肥皂棒并将其放入机架。在执行过程中,精英路径与兄弟路径的对比展现出极具说服力的诊断价值:

在深度为 2 的节点,智能体成功拿到了肥皂。紧接着面临抉择:当前技能原本的表述比较模糊,只是泛泛地指导智能体“找到对应的电器”。在这一步骤下,树搜索产生了分叉:

如果仅仅看后序的失败日志,分析者很难分清智能体到底是没有认清目标物品,还是搞错了电器的功能属性。但是在同一个父节点下,由于历史动作序列完全一致,这三个分支的差异被赤裸裸地暴露在当前这一步的决策上:目标模型清楚任务需要清洗,但在将抽象动作映射到具体环境交互元件时发生了歧义。

面对这一清晰的局部证据,技能优化器生成了极具针对性的编辑操作:

这种基于共享前缀的局部“微观手术”,比起让模型在通篇失败轨迹的宏观迷雾中瞎猜因果,展现出了高出几个数量级的精确度。

实验评测:不仅跑得更快,而且学得更透

为了验证 Branch2Skill 的泛化表现,作者在六个具有显著代表性的场景上展开了全方位评测:

基线覆盖了“无技能裸跑(No Skill)”、“人工手写技能”、“单次模型参数化常识生成”,以及当前主流的自动化技能进化框架:Trace2Skill、TextGrad、GEPA 与 SkillOpt。在评测中,目标模型横跨了 GPT-5.5、GPT-5.4 系列(含 mini 与 nano)以及开源代表 Qwen3.6-35B-A3B 等 5 种不同量级的模型底座。

1. 全面领跑的主任务表现

在全部 30 个模型与任务的交叉评测组合中,Branch2Skill 在多达 26 个设置中斩获第一或并列第一,在 27 个设置中明确击败了前代 SOTA 方法 SkillOpt。

从宏观平均分来看,目标模型在没有技能注入时的平均基线得分为 50.8 分;经过 SkillOpt 迭代后提升至 66.0 分;而 Branch2Skill 则将平均得分直接推高至 69.1 分。不仅在相对难度极高的研究级数学基准 LiveMath 上建立了 5.6 分的显著优势,在考验结构化多跳分析的 OfficeQA 上也取得了 4.7 分的领先。

尤为值得注意的是,在模型能力相对受限的端侧小模型上,这种技能进化的杠杆效应更为剧烈:在 GPT-5.4-nano 上,Branch2Skill 带来的性能增益达到惊人的 26.9 分,相比 SkillOpt 亦高出 6.5 分。这充分表明,小模型并不缺乏执行规范步骤的底层能力,真正制约其表现的是缺乏清晰严谨的行为边界和排错规则,而这正是稠密分支证据所擅长弥补的短板。

2. 进化开销的断崖式下降

如果仅仅是微弱提升指标,在工业界往往难以抵消树搜索本身的计算开销;但 Branch2Skill 最核心的突破恰恰在于进化效率(Evolution Efficiency)的逆势暴增。

通过汇总 GPT-5.5 在全部 6 个评测集上的技能优化全生命周期开销,本文给出了极为震撼的成本对照:

将性能收益平摊到进化成本上,Branch2Skill 每百万 Token 换取的性能提升从 0.224 飙升至 0.911,效率足足提升至原来的 4.07 倍。在难度最大、推演步数最多的 LiveMath 数学基准上,技能进化的 Token 消耗从 2320 万断崖式下降至 670 万,降幅达 71.1%。这一结果有力打破了“树搜索必然带来 Token 爆炸”的刻板印象:用有限预算换来高质量的稠密分支,反而可以终结无休止的外层迭代循环。

3. 跨模型与跨任务的“知识迁移”能力

在实践中,如果每次换用不同的下游目标模型,都要把整套进化流程重跑一遍,工程成本依然高昂。为此,论文深入考察了技能文档在不同角色间的解耦特性。

目标模型与技能模型的交互表现

目标模型与技能模型的交互表现

首先是“优化器”与“执行者”的角色解耦。实验表明,负责产生搜索树的目标模型与负责修改技能的优化模型完全可以异构搭配。热力图分析显示,在 LiveMath 这种极具深度的数学探索中,高智力水平的优化器(如 GPT-5.5)能从哪怕较弱的目标模型产生的树分支中,精准淘洗出极具价值的方法论规则(平均分达 45.7,显著压制其他搭配)。而在 SearchQA 这类偏重规则遵循的任务上,模型搭配则展现出极强的鲁棒性与平替性。

更重要的是即插即用的零样本泛化能力。研究人员将基于 GPT-5.4 探索轨迹进化出的技能文档直接冻结,转交给其他模型零样本使用:

这充分证明,Branch2Skill 提炼出的绝非机械应试的记忆碎片,而是能够指导大模型穿透具体数据分布的高维认知资产。

消融实验:为什么不能偷懒?

为了验证各组件的必要性,消融实验提供了更具启发性的细节:

如果抛弃兄弟分支、退化回单一精英路径(Single Path),虽然 Token 消耗略微变少,但在 LiveMath 上的表现直接跌落 4.3 分,在 SpreadsheetBench 上滑落 3.7 分。这直接印证了核心假设:单条成功路径只能展现“怎么做是对的”,却无法告知智能体“为什么不能那么做”,丢失了兄弟分支所携带的反事实(Counterfactual)警戒信号。

反之,如果走向另一个极端——不做任何精选,把整棵树的所有节点全盘打包塞给优化器(Whole Tree),效果同样发生了大幅下挫(LiveMath 下降 4.1 分,SpreadsheetBench 下降 4.8 分)。究其原因,未加结构化约束的超长上下文充斥着海量的中间死胡同和无意义碎屑,严重稀释了大模型注意力,反而破坏了优化器提炼高质量规律的准确度。

在搜索参数的权衡上,实验也给出了清晰的“甜点区”:最大深度设为 6、每步展开 3 个子节点、迭代预算设在 40 次左右,能够在维持可控开销的前提下,最大化证据提取的边际收益。

总结与展望:让探索计算真正转化为持久沉淀

长久以来,学术界对于“推理计算(Inference Computation)”的理解主要停留在测试时增强(Test-time Scaling)的维度:给模型更多的时间、更深的搜索树或更长的 CoT,让它把当前这道难题解出来。然而一旦答案输出,刚才那些耗费大量算力探索出的死胡同、被证伪的假设、局部走通的捷径,通通随着上下文的清空而被彻底抛弃。

Branch2Skill 最大的理论与工程启示在于,它将测试时搜索(MCTS)与长期资产进化(Skill Evolution)打通成了一个优雅的闭环。

那些为了解决当下问题而不得不展开的探索分支,不再是一次性的开销负担,而是反哺系统进化的黄金养料。通过共享前缀的局部因果对比,系统将瞬时的计算流,沉淀为外挂的、人类可读可编辑的显式自然语言规则。

这一思路为大模型系统的持续自我演化铺设了一条高效且实用的工程路径:未来,我们或许不再需要昂贵的周期性强化学习全量微调,只需让智能体在日常的任务探索中,将每一棵思考之树结出的教训自然沉淀为技能库。智能体自此不再是“考完就忘”的单次执行器,而真正成为一个能在每一次试错分支中汲取智慧、在实践中不断自我迭代的常青系统。