Search2Skill:打破大模型自进化上限,向外搜索提炼技能让准确率提升9.3%
Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning

在过去一年里,大语言模型(LLM)驱动的智能体(Agent)研究迎来了一个极具吸引力的方向:自进化(Self-Evolution)。研究者希望智能体不必依赖反复的底层参数全量微调,而是像人类专家一样,在解决任务的过程中沉淀经验,把具体解题步骤抽象成模块化的“程序性技能”(Procedural Skills)存入技能库,在后续遇到类似问题时直接调用。
ArXiv URL:https://arxiv.org/abs/2608.05245v1
然而,现有的自进化路线普遍存在一个根本性盲区——几乎所有的技能提炼都是“向内看”(Inward-Looking)的。无论是基于历史轨迹反思的 Trace2Skill,还是各种基于外部记忆(Memory)构建的技能库,其技能提炼的原料完全来自模型自身的生成轨迹与参数记忆。如果面对需要特定领域专业共识、冷门定理推导或标准业务流程的硬核问题,模型参数本身就不具备相关知识,这种“向内反思”就会沦为无源之水。模型再怎么在原本的认知边界内自我重组,也无法凭空发明出它未曾知晓的外部规律。

针对这一核心痛点,来自阿里巴巴集团、厦门大学、浙江工商大学和浙江大学的研究团队提出了 Search2Skill 框架。该研究一改过去闭门造车式的反思路线,转向“向外看”(Outward-Looking)的主动探索机制:让模型在感知到自身能力短板时主动调用外部搜索,并将检索到的零散外部证据提炼抽象为通用、可持久复用的结构化技能。为了解决传统强化学习在复杂智能体决策流中难以分派信用的难题,研究团队进一步设计了基于细粒度评分准则的强化学习(Rubric-Based RL)方案。
实验表明,在涵盖数学、物理、化学、法律、哲学、代码等 8 个高难度专业领域的基准测试中,Search2Skill 在动态流式推理(Streaming)评测下使模型准确率最高提升了 9.3%,在不借助网络搜索的纯测试集(Held-Out)迁移评测下依旧保持显著优势。更关键的是,研究证实这种性能跃升并非来自简单的网页文本缓存,而是真正源自“技能抽象”;提炼出的一套高质量技能库,甚至能直接赋能给更小尺寸的模型,实现跨尺度的能力支撑。
模型的自知之明与 14.3% 的进化天花板
在动手设计算法之前,研究团队做了一项非常启发性的探索性实验(Preliminary Study):大模型到底知不知道自己什么时候“不会做”?如果知道,它能不能说清楚自己究竟缺什么能力?
研究团队在 SuperGPQA 科学子集上对不同尺寸的 Qwen3 系列模型(8B、14B、32B、235B)进行了观测。当面临复杂问题时,模型可以选择直接作答,也可以选择进入探索状态向外检索。统计结果发现了一个显著现象:在模型最终回答错误的题目上,触发外部探索的概率比最终回答正确的题目高出了 27 到 36 个百分点。这意味着,现阶段的前沿开源模型对自己的能力边界其实具备相当程度的感知能力,并不会盲目自信地在所有未知领域强行硬答。
既然模型在相当程度上能意识到自己的盲区,那么如果能精准填补这些已知短板,模型的潜力上限究竟有多高?
为了量化这个理论上限,研究人员让智能体在触发探索但作答错误的题目上,明确陈述自己认为缺失的能力;同时引入能力更强的教师模型(Qwen3.7-Max),结合标准答案与解题轨迹,独立诊断智能体真正缺失的能力。当智能体的主观诊断与教师模型的客观诊断完全吻合时,说明智能体不仅卡住了,而且精准清楚自身的问题所在。分析显示,这类由于“知其所缺却无法自愈”而导致的性能落差,在各个尺度的模型上平均达到了 14.3%。
换言之,现存的闭门自进化方法之所以遇到瓶颈,是因为它们试图用已知去推导未知。如果能以模型自身感知到的能力缺陷为锚点,定向向外检索专业知识,并将其固化为永久技能,14B 和 32B 模型的解题准确率在理论上可以分别提升至 81% 和 77%,不仅逼近、甚至能够反超 235B 超大参数量模型的直接推理水平(79%)。这正是 Search2Skill 的出发点:用精准的外部检索来补齐这 14.3% 的短板,将模型的执行边界向外推移。
机制设计:从散碎网页检索到持久程序性技能
要想把外部搜索变成稳定可复用的技能,智能体面临着三个环环相扣的决策问题:第一,什么时候搜(When to Search)?如果无论题目难易无节制地频繁调用搜索,不仅推理开销急剧飙升,容易引入外部网络噪声,还会拖垮原本就能直接解出题目的常识;第二,怎么搜(How to Search)?针对抽象缺陷发出的检索词,不能是照搬当前题目细节的具象词,而必须聚焦于底层方法或核心定理;第三,怎么提炼技能(How to Distill Skills)?检索到的往往是零散、充满冗余的网页片段,智能体必须将其高度凝练成具有泛化价值的通用解题流程,并沉淀到持久化技能库中。
针对这套复杂的行为链条,传统的基于最终答案正误的强化学习(如单纯依赖 GRPO 的 Outcome-Based Reward)往往捉襟见肘。一个回答失败的轨迹,究竟是因为最初不该搜索、搜索词偏离了核心,还是最后提炼技能时产生了幻觉?单指标的最终奖励无法解决这种严苛的信用分配(Credit Assignment)难题。

Search2Skill 提出的解决方案是:在标准强化学习的基础目标上,引入一套组合式、具有门控结构的细粒度准则强化学习(Rubric-Based Reinforcement Learning)体系。整个奖励体系由底层任务奖励与三个专项决策奖励共同构成:
-
探索必要性奖励($R_{\text{when}}$):为了避免人为设定一个僵化的搜索阈值,该奖励采取组内相对对比机制。对于同一个问题采样出的多条 Rollout 轨迹,算法自动将其划分为“进行探索”的子集与“直接作答”的子集,并计算两组的平均准确率差值 $\Delta$。只有当探索组的准确率明显胜过直接作答组时,探索行为才被认定为必要,进而有资格激活后续的高质量技能奖励;反之,若直接作答本身更稳定正确,系统则给予直接作答正面奖励,惩罚盲目搜索。
-
检索质量奖励($R_{\text{search}}$):利用大模型作为裁判,基于显式评分细则对检索词和召回信息进行多维度评估。其重点考查两点:检索词是否具备足够的抽象度,能否脱离当前题目的具体数字直击通用原理;召回的文本片段是否切实消除了问题的核心不确定性。一旦智能体发出毫无信息量的劣质搜索词,便会受到惩罚因子 $p_q$ 的折扣。
-
技能生成奖励($R_{\text{skill}}$):这一项是决定技能质量的关键。它由“重用度”($s_{\text{reuse}}$)与“忠实度”($s_{\text{ground}}$)两部分组合而成。重用度直接通过执行反馈验证:用提炼出的新技能去辅助解答相似的候选问题,统计其相较于直接推理带来的准确率增益;忠实度则考查该技能是严格从外部检索证据中概括而来,还是由模型自身的参数幻觉臆造而出。
最终的综合奖励函数构成了一个严密的门控结构:探索必要性决定了智能体“是否有资格拿到决策加分”,而检索质量与技能提炼水平则决定了“具体能拿多少加分”。这种设计从机制上杜绝了智能体“为了拿搜索奖励而恶意水检索词”的投机行为。
实验评测:不仅跑赢传统搜索,更胜在“知识抽象”
为了全面检验 Search2Skill 的真实表现,研究团队在 8 个覆盖多门类的专业子领域展开了评测,涵盖物理、化学、科学、数学竞赛、法律、哲学、历史以及编程。评估设立了两种互补的测试协议:
-
动态流式协议(Streaming Protocol):模拟真实的终身学习环境。输入是一串连续的任务流,模型在前面题目中检索、提炼出来的技能,会立即固化并注入持久技能库,供后续接收到的题目即时检索调用。
-
留出测试协议(Held-Out Protocol):将题目分为技能挖掘集与独立测试集。模型在测试集上推理时,完全切断外部网络搜索功能,只能单纯依靠先前从挖掘集中沉淀下来的冻结技能库作答。该协议能极其严苛地剔除网络实时检索带来的增益,纯粹考查技能本身的通用复用性。
在流式评估下,以 Qwen3-4B 和 Qwen3-8B 为基座的 Search2Skill 展现出了显著优势。相较于无任何外部辅助的直接推理,Search2Skill 分别带来了 +8.3% 和 +9.3% 的平均准确率提升。
与现有基线方法的横向对比揭示了更多本质差异。传统的向内提炼方法(如 ReasoningBank、Memp)在专业领域表现不尽如人意,在某些复杂子项上甚至因提炼出带偏见或错误的低质量经验,导致整体准确率跌破了直接推理的基准线;而同样经过针对性强化学习训练的自演化记忆基线 EvolveR,其表现也比 Search2Skill 逊色 3.3 到 3.7 个百分点。
更具说服力的是与纯搜索智能体(Search Agent)的对比。即使用相同的高质量搜索工具和相同的数据集通过 GRPO 训练一个深度搜索智能体,Search2Skill 在 4B 和 8B 模型上依然分别取得了 +1.0% 和 +3.0% 的领先。这直接证明:性能的提升不仅仅在于给模型配了一套 Google 搜索 API,更在于它学会了将搜出来的信息升华为条理清晰的长期记忆,而非每次遇到同类任务都从零开始重新做无头苍蝇式的网页遍历。
而在彻底断绝网络连接的留出集测试中,Search2Skill 的表现彻底打消了外界对“它只是个高级 RAG”的疑虑。在不能联网的情况下,凭借先前积累的技能库,4B 和 8B 模型依然分别实现了 +5.1% 和 +6.6% 的绝对提升。
这里涉及一个根本性的技术质疑:既然模型能够缓存之前搜出来的东西,那把之前搜索到的网页纯文本全部作为上下文存起来(Raw Evidence Caching),跟费尽周折提炼出来的抽象技能(Abstracted Skills)相比,真的有差别吗?
| 经验复用形式(Qwen3-8B 基座) | 留出集平均准确率 | 相比直接推理提升 |
|---|---|---|
| 直接推理(Direct Inference) | 49.9% | — |
| 复用原始检索证据(Raw Evidence) | 51.7% | +1.8% |
| 复用抽象技能(Search2Skill) | 56.2% | +6.3% |
实验数据给出了确凿的答案。直接在上下文重用搜出来的原始网页片段,仅带来了 1.8% 的微弱提升;而从相同网页证据提炼出程序性技能后,增益直接飙升至 6.3%,两者拉开了 4.5 个百分点的显著差距。这表明,原始网页往往高度绑定特定问题、语言冗余且信噪比低,强行拼入 Prompt 反而极易分散注意机制;只有将其经过解耦、去具象化、提炼为逻辑链完整的操作规程,才能跨越题目细节的差异,真正演变为智能体通用的“解题内功”。
深入剖析:智能体行为是如何被重塑的?
除了最终数字的增长,进一步的消融与定性分析解答了 Search2Skill 究竟在底层改变了什么。
首先是智能体在决策链路中的五类典型失败模式:漏触发搜索(Missed Search Trigger)、检索词低质偏颇(Poor Query)、操作格式异常(Formatting Error)、技能覆盖度不足(Insufficient Coverage)以及技能幻觉(Skill Hallucination)。对比未经 RL 优化的初始冷启动模型,经过 Rubric-RL 训练后的模型在上述所有模式上的失败占比均出现腰斩,整体失败率从 25.3% 骤降至 11.9%。其中,改善最突出的是“漏触发搜索”和“基于噪声网页产生技能幻觉”,这恰好对应了 $R_{\text{when}}$ 与 $R_{\text{skill}}$ 所约束的目标。
在技能获取效率(Sample Efficiency)的动力学分析上,对比曲线同样极其剧烈。在 MMLU-Pro 哲学领域的多次迭代中,传统的向内提炼方法 Trace2Skill 和 Memp 几乎在整整三轮迭代中陷入停滞,模型在自身知识边界的牢笼内兜圈子,甚至因为累积了错误的内部归纳经验而发生剧烈的准确率震荡;而 Search2Skill 在接触到前 168 道题目时,测试集准确率就瞬间从 51.8% 跃迁至 57.2%,并且随着训练深入持续平稳爬坡,在仅仅一半的样本量下就达到了所有向内基线耗尽全部样本都无法企及的精度高度。
各奖励模块的消融实验也揭示了极其关键的工程经验:如果从奖励体系中剔除必要性奖励 $r_{\text{when}}$,智能体的搜索行为将立即失控,触发率瞬间飙升至 96.6%。这意味着智能体退化成了一个极度依赖外部信息的“惰性搜索器”,在最简单的常识题上也无休止地调用工具,最终提炼出一大堆细碎冗余的低质伪技能,反而将平均测试准确率拉低了 3.8 个百分点。只有当三个细粒度奖励共同约束时,智能体才能学会在自信直接作答与严谨向外探索之间保持平衡。
最后值得一提的是技能的跨模型尺度转移(Cross-Scale Transfer)。当研究团队把由 8B 模型挖掘、提炼出来的技能库,直接灌注给 4B 小模型使用时,4B 模型在 SuperGPQA 科学子集上的准确率达到了 56.5%,一举超越了没有任何辅助的 8B 大模型本身的直接推理成绩(50.0%)。这一现象传递出一个颇具实用价值的信号:高质量的程序性技能库可以作为一种外挂式的认知脚手架,以轻量、非侵入的方式,实现从高参数模型向小参数边缘端模型的知识迁移与能力赋能。
总结与展望
Search2Skill 带来了一个认知上的转变:让大模型智能体实现自进化,并不意味着必须将它封闭在参数内做穷举式的反思与自我催眠。当智能体面对高度专业、超越其当前认知边界的真实任务时,拥抱外部开放世界的信息检索,并将瞬时的检索结果压缩内化为长期的程序性技能,是一条更符合知识认知规律、也更高效的自进化技术路径。
从被动的 RAG(每次遇到问题现查现用、查完即扔),到向内自省的 Memory(仅限于重组已学知识),再到 Search2Skill 所展示的“主动探索、提炼内化、持久固化为通用技能”,这种将信息检索与强化学习技能提炼深层次融合的范式,为打破大模型参数知识壁垒、构建真正能够适应开放复杂环境的长寿命专业智能体,提供了坚实且具实操性的解题框架。