微软新研究:告别昂贵的逐次思考,离线技能蒸馏让非推理模型省下最高6倍Token

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

微软新研究:告别昂贵的逐次思考,离线技能蒸馏让非推理模型省下最高6倍Token 论文图示

在复杂的大模型智能体(Agent)任务中,开启推理模式(如思维链或强化学习诱导的“思考”机制)往往能带来显著的成功率提升。然而,这一表现的背后往往伴随着沉重的推理溢价(Reasoning Premium):模型的输出 Token 数量通常会膨胀 3 到 6 倍,并且每次交互、每个任务实例都要重新进行一遍完整的推导。

ArXiv URL:https://arxiv.org/abs/2608.07885v1

微软的一项最新研究提出了一个极具颠覆性的观察:在特定业务领域或固定环境下,推理模型每次耗费海量 Token 进行的深度思考,很大一部分并非在解决当前个案特有的数学或逻辑难题,而是在机械地重复推导“跨任务通用的领域规则与操作流程”。既然这些流程知识在同领域内是高度不变的,那么反复为它支付计算账单就是一种巨大的浪费。

为此,研究团队提出了一种被称为被动技能蒸馏(Passive Skill Distillation)的离线分摊方案。该方法利用轻量级代码智能体(Coding Agent)分析离线保存的少量历史执行轨迹(仅需 35 至 50 条任务记录),通过数据统计和模式对比,提炼出 40 至 130 行紧凑的自然语言规则,并直接注入到非推理模型的系统提示词中。在覆盖家庭具身、电子表格操作与双轮客服对话等四项具有代表性的智能体基准上,注入技能的普通非推理模型追回了 55% 到 100% 以上的推理性能差距,甚至在两项基准上直接反超了原生的推理模式,同时输出 Token 数量大幅缩减 2.7 到 6 倍,推理 Token 消耗完全归零。

这项工作从搜索视角重构了当下大模型计算开销的分配逻辑:在线推理本质上是单个任务内部的“深搜”(Deep Search),成本在每次调用时反复结算;而轨迹蒸馏则是跨任务维度的“广搜”(Wide Search),成本仅需离线支付一次。当智能体所需的核心知识属于领域级通用流程时,“横向提炼”往往远比“纵向硬想”更为经济高效。

痛点剖析:推理溢价背后的“算力打水漂”

大语言模型开启推理模式后,其强大的多步规划与反思纠错能力被广泛证明能够突破复杂任务的瓶颈。无论是在数学演算、代码生成,还是在交错调用工具、读取环境反馈的 Agent 场景中,推理模式已经成为业界追求高准确率的标配。

但这种标配正在带来极高的部署成本。在研究团队的实测中,GPT-5.4-mini 开启推理模式后,在各个 Agent 基准测试中的单次任务输出 Token 数量是未开启时的 3.0 到 5.1 倍;在开源模型 Qwen3.6-27B 上,这一倍数最高达到了 6.2 倍。更为棘手的是,这些思考 Token 并非是一次性生成的资产,只要智能体还在运行,面对千千万万个用户请求,每一个独立的交互周期都必须从零开始把整套思考路径重新推演一遍。

当研究人员深入拆解这些推理模型的内部思考文本(Reasoning Traces)时,发现了一个极其普遍的浪费现象:模型在每个任务中耗费的大量推演步数,实际上都在重复推导完全相同的领域规则。

例如在零售客服场景($\tau^2$-bench retail)中,推理模型每次面对新用户,都会在思考层反复告诫自己:“在客户真正提供有效邮箱之前,我不应该提前调用账号查询接口”;在家庭模拟环境 ALFWorld 中,推理模型每次都在思考链里重新摸索并确认“加热物体”在环境底层其实是一个原子的复合指令,不需要分别拆解为拉开微波炉门、放入物体、关门再启动。

相反,未开启推理的普通模型之所以频繁失败,并非缺乏基础的工具调用能力或语言理解能力,而恰恰是因为缺少这种跨任务不变的先验规则约束。以零售支持领域为例,非推理模型在训练集轨迹中,高达 59% 的轮次都会犯下“在没有客户邮箱参数的情况下随意捏造参数调用身份验证工具”的严重错误,该单一行为占到了全部观测到的工具调用错误的 94%。

既然错误模式如此集中且具有高度的领域通用性,这就属于典型的“重复计算”。在系统设计中,重复计算的最佳解法正是计算分摊(Amortization)。

核心机制:三步到位的被动技能蒸馏

为了把昂贵的在线实时推理转化为廉价的离线一次性成本,研究人员构建了一套极度轻简的被动技能蒸馏流程。该方法不需要对模型进行微调,不需要为了蒸馏去在线交互并生成新的数据,也不引入复杂的提示词优化外循环,整个过程仅仅依托现有的交互日志。

流程的第一步是收集离线轨迹语料库 $\mathcal{D}$。研究所使用的并非专门清洗或构造的数据,而是模型在训练集划分上留下的常规评测记录,涵盖 35 到 50 个任务。这些记录包含每一步的环境观察、模型输出、工具调用参数、返回值以及最终的任务奖励。在实验中,语料库分为两种形态:一种是成对(Paired)语料库,既包含推理模式成功/失败的轨迹,也包含非推理模式的轨迹;另一种则是纯非推理(No-think-only)语料库,仅包含廉价的非推理执行日志。

流程的第二步是利用外部 Coding Agent 进行自动提炼。研究团队并未让执行任务的底层模型自行反思,而是直接调用一个具备代码编写与文件执行能力的外部编码智能体(实验中使用驱动 Claude Code 的 Claude Sonnet 5)。将智能体置于包含所有轨迹文件的离线目录中,给出一句固定的自然语言分析要求,不提供任何实时环境接口。

编码智能体会自行编写并运行 Python 分析脚本,在离线语料库上自动化计算错误模式频率、动作 $n$-gram 转移分布、循环死锁检测以及成功与失败任务之间的对比差异。在统计数据的指引下,智能体会深入翻阅典型个案的执行文本,最终将这些规律归纳编译为一份 40 到 130 行 Markdown 格式的紧凑技能文档。文档中的每一条规则都具有高度的确定性,并且直接对应着统计证据。例如在零售技能中,智能体明确写道:“在调用 find_user_id_by_email 之前,必须先核查客户的消息中是否真的包含合法邮箱……该 Bug 在 22 次任务执行中出现了 13 次,导致了 18 次工具错误中的 17 次”。

流程的第三步是无感部署。编译出的技能文档被原封不动地直接追加到非推理模型的系统提示词末尾。整个执行框架、底层工具集、采样解码参数完全不作变动。由于技能文档是一个固定的自然语言前缀,在现代推理架构中完全可以命中 Prompt 缓存,几乎不会增加首 Token 的延迟。单次离线蒸馏的 API 成本仅为 1.28 至 2.44 美元,相当于仅花几块钱,就完成了一个领域的流程固化。

实验评测:非推理模型能否反超推理模式?

研究团队在四个极具挑战性的 Agent 基准上系统评估了该方案的有效性:包含具身操作的 ALFWorld、涉及真实电子表格复杂公式与单元格修改的 SpreadsheetBench-Verified(SSB-Verified),以及面向真实商业场景的客户服务基准 $\tau^2$-bench(包含电信和零售两个子领域)。主实验涵盖了闭源轻量模型 GPT-5.4-mini 与开源模型 Qwen3.6-27B,所有评估均取 3 个不同随机种子的均值。

实验数据表明,将蒸馏出的紧凑技能注入非推理模型后,模型在保持极低 Token 输出的同时,成功率发生了显著跃升。

在 GPT-5.4-mini 上,注入技能的非推理模型跨四个基准追回了 55% 到 100% 以上的“非推理到推理”的性能落差。在 ALFWorld 和零售场景中,带技能的非推理模型甚至直接反超了耗费数倍算力的完整推理模式。更为关键的是 Token 开销:与原生推理模式相比,带有技能的非推理模型单任务输出 Token 减少了 2.7 到 5.1 倍,且完全省去了所有的推理内部 Token。

在开源模型 Qwen3.6-27B 上的验证也展现了类似的规律。在 ALFWorld 上,原本非推理模式成功率为 82.7%,注入技能后跃升至 98.0% 的近饱和水准,甚至远高于该模型自身推理模式下的表现(其原生推理模式在 ALFWorld 和 SSB-Verified 上反而因冗余推演引发逻辑混乱,导致性能下滑)。在电信客服场景下,带技能的 Qwen3.6-27B 以 0.933 的高成功率追平了推理模式,但单次任务的输出 Token 消耗仅为其六分之一(缩减达 5.9 倍)。

ALFWorld 执行对比

上图所展示的 ALFWorld 具体任务(“put a cool tomato in microwave”)直观揭示了技能注入带来的行为变化。左侧为未配置技能的原始非推理模型,由于缺少环境复合命令的认知,陷入了不断重复 look 的盲目循环直至步数耗尽超限失败;而右侧配置了蒸馏技能的模型,明确知晓降温操作与冰箱的交互逻辑,直接命中关键指令 cool tomato 1 with fridge 1,干脆利落地完成了任务。

颠覆性发现:蒸馏技能甚至不需要“思考过程”

该项研究中最令人意外的消融实验,出现在对蒸馏语料库来源的探索上。通常的技术直觉会认为:要想蒸馏出高质量的领域技能,训练集里必须包含高水平模型或推理模型留下的完整思考链(Reasoning Traces),从高级思考中抽取经验。

为了验证这一点,作者对比了两组技能提取来源:一组是包含了推理轨迹与非推理轨迹的成对语料库(Paired);另一组则完全剔除推理记录,仅保留廉价、原始且错误频出的纯非推理语料库(No-think-only)。提炼出的技能统一注入到完全相同的非推理模型中进行评测。

结果表明,推理轨迹根本不是有效蒸馏的前提条件。单纯依靠非推理模型的失败与成功记录提炼出的技能,在各项测试中展现出了极强的竞争力,完整追回了 55% 至 100% 以上的推理差距。

不仅如此,在涉及复杂电子表格逻辑的 SSB-Verified 基准上,纯非推理轨迹提炼出的技能得分高达 56.0%,反而比融入了推理思考链的技能(46.0%)高出整整 10 个百分点。

为什么多看了推理过程,提炼出来的技能反而变弱了?作者给出了精辟的解释:推理模型的思考链往往是冗长且高度风格化的,它记录的本质上是模型主观认为发生了什么;而未开启推理的普通任务轨迹在遭遇失败时,环境抛出的异常与报错反馈记录的才是真实世界客观发生了什么。在面向真实数据表格的场景中,编码智能体如果沉溺于阅读推理模型洋洋洒洒的主观论述,反而容易被误导;直接统计客观操作报错分布,能够更精准地抓取真正的致错死穴。

这一发现带来了极大的工程落地价值:企业在实际落地智能体系统时,全生命周期的自优化循环完全不需要昂贵的推理模型介入。团队可以直接上线低成本的普通模型,收集线上日常交互产生的粗糙日志,交由 Coding Agent 定期离线横向提炼,并将更新后的技能写回 Prompt,即可完成闭环自愈。

对比提示词优化器:一次提炼完胜多轮迭代

学术界以往解决 Prompt 质量问题的常见手段是自动提示词优化器(如 GEPA、DSPy、MIPROv2 等)。这类工具的基本机制是通过多轮评估指标反馈,在验证集上不断生成、评测并变异 Prompt。

研究团队将该方法与顶级的反思型提示词演进工具 GEPA 进行了严格对照。在相同的 GPT-5.4-mini 基础模型与 Claude 反思能力支持下,在电信与零售两个领域展开测试。

实验显示,被动技能蒸馏生成的 Prompt 在两个领域均取得了更高的测试通过率(零售领域为 45.8% 对比 GEPA 的 39.2%,电信领域为 32.5% 对比 GEPA 的 30.8%)。而在成本端,被动技能蒸馏展现了压倒性的优势:GEPA 为了探索提示词变体,需要在线发起多达 120 次带有真实环境执行的评估循环,单领域优化成本高达 15.28 美元;而被动技能蒸馏只需一次性静态扫描日志,单领域成本仅为 3.72 美元,成本降低了 4.1 倍,且避免了频繁调用真实业务环境的风险。

广搜与深搜:重新审视大模型的推理本质

从更深层的计算理论角度审视,这项研究实际上探讨了解决复杂任务时两种截然不同的搜索范式。

在线实时推理属于任务内的纵向深搜(Deep Search)。在面对单个任务实例时,模型试图在动作空间树中向前探索多条考虑路径。但这种深搜的知识留存率为零,一旦切换到同一领域的下一个任务,模型必须重新付出一次深搜代价。

语料库蒸馏则是一种跨任务维度的横向广搜(Wide Search)。它跳出单个任务的微观推导,将几十个任务横向摆在一起,利用统计工具统一提取失败分布中的宏观规律。只要任务所需的主要是领域级、流程级的通用经验(例如环境操作语法、接口参数依赖、前置鉴权逻辑),横向广搜不仅在经济性上完全碾压纵向深搜,在可靠性上也更胜一筹——经过几十个样本统计验证的硬规则,其稳定性远高于模型每次实时脑暴时临时推导正确的概率。

当然,该论文也清晰地指出了这种离线分摊的边界所在。在电信客服与电子表格测试中,即便注入了顶级技能,非推理模型与原生推理模式之间依然保留了一定的性能差距。这一残余差距客观划定了两种范式的分水岭:当任务包含极长的即时逻辑依赖链,或者包含高度特定于当前数据实例(Instance-specific)的复杂公式推导时,任何全局静态的通用提示词都无法完全替代即时的纵向动态搜索。

将领域不变的公共逻辑下沉为静态自然语言资产,将有限且昂贵的在线思考算力留给真正需要临场推演的特异性难点,这种“以横向提炼平摊纵向开销”的设计哲学,正在为高性价比 Agent 系统的构建提供了一条极其务实的新路径。