MAPD:用结构化协议跨越分布鸿沟,开源小模型搜索成功率达44.4%

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

MAPD:用结构化协议跨越分布鸿沟,开源小模型搜索成功率达44.4% 论文图示

让大语言模型自主交替进行多步思考与外部工具检索,也就是所谓的“智能体搜索”(Agentic Search),已经成为解决复杂开放知识问答的主流路径。但在训练这类智能体时,学界与工业界面临着两难选择:如果单纯依赖最终答案是否正确的强化学习(如 RLVR 或 GRPO),在面对动辄数轮的长交互轨迹时,这种仅凭终局对错提供的稀疏奖励极难给复杂的中间规划与检索行为精准定责;如果退而求其次,试图借助 Claude、GPT 等顶级闭源商业模型充当教师进行知识蒸馏,又会立刻撞上黑盒 API 的技术高墙。

ArXiv URL:https://arxiv.org/abs/2607.24280v1

商业模型既不开放底层 Logits,其词表和分词器(Tokenizer)也与开源小模型截然不同,经典的概率分布对齐方法完全无法实施。更致命的是,如果直接让开源模型去模仿商业模型输出的自然语言轨迹,开源小模型往往只会学到商业模型冗长啰嗦的话风与格式外壳,反而诱发严重的风格漂移和幻觉,根本无法内化深层的分解与检索策略。针对这一痛点,来自北京大学、清华大学、中国科学技术大学等机构的研究团队提出了 MAPD(Multi-Agent Protocol Distillation,多智能体协议蒸馏框架)。该方案不再让开源模型生搬硬套商业模型的自然语言废话,而是通过离线多智能体系统将商业模型的解题能力提纯为结构化的 JSON 协议,并配合特权同源自蒸馏与强化学习,成功在开源轻量模型上实现了高密度监督。在 Qwen3-1.7B 与 Qwen3-4B 上,该框架在七个问答基准中的平均成功率分别达到了 39.4% 与 44.4%,在多跳复杂推理场景下较强基线取得了显著突破。

图1:商业模型蒸馏面临的分词器不匹配与风格漂移困境

跨架构蒸馏的两大屏障:为什么学不会闭源强模型

在智能体搜索任务中,模型需要针对一个复杂问题进行拆解,生成检索词,调用检索器获取文档,再根据返回的上下文判断是否需要补充信息或修正方向。这种复杂的长程决策如果只靠结果对错来进行强化学习更新,梯度反馈极其微弱。为了让中间决策获得更密集的反馈,近年来的研究尝试引入在线策略蒸馏(Online Policy Distillation, OPD)。

然而,当希望把 Claude-Opus-4.6、GPT-5.5 或 Gemini-3.1-Pro 等顶级商业模型作为专家教师时,传统的知识蒸馏范式全盘失效。首先是数学层面的无法对齐。经典蒸馏依赖于计算教师与学生在 Token 级别概率分布上的 KL 散度(Kullback-Leibler Divergence)。商业 API 仅提供文本输出,隐藏了所有 Logits 信息;即便强行计算概率,商业模型与开源模型(如 Qwen 系列)采用的完全是不同的词表切分方案,两个异构 Tokenizer 之间的对齐在数学上根本没有良定义。

退而求其次的做法是“自然语言轨迹模仿”,即把商业模型生成的完整思考与搜索过程当作示范文本,让开源模型做有监督微调或模仿学习。然而实验证明,这种做法在智能体交互中极易引发灾难性后果。商业专家在解题时带有极强的特定语言风格、繁复的自言自语以及冗长的话语结构。开源小模型受限于参数容量,在强行拟合这些自然语言外壳的过程中,核心的认知逻辑没学到,反而迅速出现风格漂移(Style Drift)和字数膨胀(Verbosity Degeneration),导致推理幻觉加剧、环境交互步数超标。如何剥离商业模型的语言外壳,仅提纯其底层的规划与事实支撑能力,构成了智能体蒸馏的核心挑战。

将认知解耦为协议:离线多智能体提纯流水线

MAPD 的核心洞察在于:开源模型需要的是商业模型在搜索任务中的核心认知策略与事实锚定,而不是它的语言风格。 为此,研究团队设计了一种标准化的中间表达载体——结构化 JSON 协议,并在离线阶段搭建了一套高度解耦的多智能体系统(MAS)来生成这一协议。

图2:MAPD 整体框架总览,包含离线协议合成、结构化协议桥接与联合在线蒸馏

这套离线多智能体流水线由四个分工明确的角色串联而成:

第一个角色是编排智能体(Orchestrator)。面对原始复杂问题,它负责进行多轮拓扑任务分解,将大问题拆分成具备明确依赖关系的子任务。

第二个角色是检索智能体(Searcher)。它并行接收分解出的子任务,针对本地 Wikipedia 语料库发起多轮精准检索,并将检索到的段落压缩为简要的事实发现。编排智能体收集所有子任务的结果,若信息不足则启动下一轮分解,直到得出候选答案。

第三个角色是修复智能体(Repair)。在初次探索结束后,系统通过严格的精确匹配(EM)比对候选答案与真实标签。一旦失败,修复智能体会在离线环境下将真实答案作为诊断线索反推推理链条,定位失败究竟是由于“表达不当(已检索到证据但答案未规范提取)”还是“检索缺陷(检索路径走偏)”,进而触发针对性的重新拆解与补充搜索。这一步极大提升了离线合成高质量探索轨迹的成功率。需要强调的是,真实答案始终被严格限制在修复智能体的内部诊断中,绝不会泄露给检索词或开源模型后续可见的上下文。

第四个角色是协议化智能体(Protocolizer)。它的任务是将前述探索过程中所有详尽但杂乱的交互日志,提炼为统一格式的 JSON 协议。对于成功轨迹,生成包含完整答案的成功协议(Succeeded Protocol);对于多次重试仍未完全收敛的轨迹,则生成仅保留事实证据的证据协议(Evidence Protocol),使用客观中立的语言总结局部发现,防止模型在缺乏证据时强行脑补。

整个协议严格规范为五个核心字段:任务类型(task_type)、逐步规划(reasoning_plan)、抽取引证(grounding_facts)、阶段性发现(partial_findings)以及最终答案(answer)。为了杜绝幻觉与信息泄露,协议生成必须遵循两大约束:第一是“禁止后视”(No Hindsight),规划步骤必须严格按照前向探索视角呈现,严禁提前剧透后续检索结果或最终答案;第二是“抽取式锚定”(Extractive Grounding),所有列出的事实必须是检索返回文档中的逐字子字符串,不可由大模型进行带有自由发挥的重写。

在进入正式训练之前,合成出的协议还必须经受包含四道防线的自动化质量门控(Quality Gate):Schema 格式校验、答案一致性检查、抽取式事实比对以及信息泄露拦截。任何一项未达标的协议都会被直接丢弃。统计显示,该流水线在处理 25,600 个样本时,生产出了 25,584 个完全合规的高质量协议,质检通过率高达 99.94%。

特权同源自蒸馏:绕开黑盒 Logits 与 Tokenizer 差异

有了纯净的结构化协议后,如何将其有效转化为开源模型的内生能力?MAPD 并没有尝试让开源模型直接跨模型去预测商业模型的概率分布,而是巧妙地采用了同源条件自蒸馏(Online Policy Self-Distillation, OPSD)结合强化学习的联合优化范式。

在在线训练阶段,学生策略模型 $\pi_{\theta}$ 实际上同时扮演了两个分支。普通学生分支只接收用户问题与模型自身的历史交互状态 $s_{t} = (x, y_{<t})$,用于正常的探索与交互;而特权分支则额外接收离线合成好的结构化 JSON 协议作为特权信息(Privileged Information),输入状态为 $s_{t}^{+} = (x, p, y_{<t})$。

因为特权分支与普通分支完全属于同一个开源模型实体,它们的词表与 Tokenizer 天然一致,且模型自身在两个状态下的输出 Logits 完全透明可求。训练过程中,系统固定特权分支的前向传播,仅计算两个分支在下一个 Token 预测分布上的反向 KL 散度:

\[\mathcal{L}_{\text{OPSD}}^{(t)}=\mathbb{D}_{\text{KL}}\bigl(\pi_{\theta_{k}}(\cdot\mid s_{t})\parallel\pi_{\theta_{k}}(\cdot\mid s_{t}^{+})\bigr)\]

通过这种设计,特权分支利用高质量协议中的清晰规划与事实指引,生成了极具确定性和指导意义的高质量 Token 概率分布;普通分支在此密集分布信号的拉动下,逐步学会在没有特权协议输入的前提下,自发做出类似高级规划的决策步骤。

与此同时,为了确保模型不会因过度拟合先验知识而失去在动态环境中自主探索的能力,MAPD 引入了基于分组相对策略优化(GRPO)的环境奖励信号。模型对每个问题采样多条轨迹,根据最终答案的精确匹配给与离散环境奖励 $R \in {0, 1}$,并结合裁剪后的代理目标函数计算策略梯度 $\mathcal{L}_{\text{GRPO}}$。

最终的联合训练目标由两部分加权组成:

\[\mathcal{L}(\theta)=\lambda_{OPSD}\cdot\mathcal{L}_{\text{OPSD}}(\theta)+\mathcal{L}_{\text{GRPO}}(\theta)\]

其中 $\lambda_{OPSD}$ 调节密集蒸馏信号与稀疏强化学习信号之间的平衡。该机制使得模型既有来自商业大师提纯协议的步步指引,又有来自真实检索交互环境的终局约束。更关键的是,推理部署时完全切除特权分支与多智能体系统,开源模型以单体结构纯粹依靠自身策略与外部环境交互,推理阶段完全没有任何额外的延迟或成本开销。

复杂多跳推理上的决定性优势

为了验证 MAPD 的实际表现,研究团队在基座模型 Qwen3-1.7B 和 Qwen3-4B 上展开了全面评测。训练集严格局限于 NQ 和 HotpotQA 的部分训练划分,而评估则横跨七个高难度知识密集型问答基准,包括单跳任务(NQ、TriviaQA、PopQA)与考验深层拆解能力的多跳任务(HotpotQA、2WikiMultihopQA、MuSiQue、Bamboogle)。其中五个评测集在训练中完全未出现,属于严格的分布外(OOD)泛化测试。

实验对比涵盖了无微调基座、纯 GRPO 强化学习、纯 OPSD 自蒸馏、传统 GRPO+OPSD 混合训练,以及目前领先的混合蒸馏基准 SDAR。结果表明,MAPD 在两大学生模型规模上均取得了全方位的压制性领先:在 Qwen3-1.7B 上,MAPD 取得了 39.4% 的平均成功率,相较于此前表现最好的 SDAR 相对提升了 4.8%;在 Qwen3-4B 上,平均成功率达到 44.4%,相对提升 3.3%。

更深入的数据分析揭示了一个关键规律:任务越复杂、多跳关联越多,MAPD 展现出的相对优势就越巨大。 在单跳基准上,Qwen3-1.7B 的相对增益为 2.3%,而在需要多次跳转检索的多跳基准上,相对增益猛增至 7.9%(在 Qwen3-4B 上亦体现为 5.1% 对 1.8% 的差距)。这种现象直接印证了结构化协议的核心价值所在:简单的单跳问答往往依赖浅层知识匹配,纯粹的强化学习即可通过蛮力试错覆盖;但面对多跳关联问题,没有经过高水平多智能体拆解的逻辑指引,开源小模型几乎无法在巨大的搜索空间中盲目探索出正确路径。

实验中还暴露出一个惊人的现象:如果直接采用开源模型自身生成的成功轨迹作为特权信息进行纯 OPSD 自蒸馏,模型在多轮交互环境中会出现灾难性崩溃——Qwen3-1.7B 的平均成功率骤降至 5.9%,Qwen3-4B 跌至 20.9%。监控显示,此时模型的长度截断率(Length Clip Ratio)从正常的 5% 暴涨至约 74%。这表明,没有外部更强认知梯度的输入,单纯让开源模型自言自语地“自我蒸馏”,只会诱发病态的冗长循环,彻底锁死在退化的低效解中。商业模型的高阶协议输入,正是打破这种自反馈闭环的关键外力。

消融分析与商业教师无关性

为了厘清各个设计环节的独立贡献,消融实验针对商业模型(PM)、结构化协议(SP)以及离线多智能体系统(MAS)分别进行了剔除验证。

当去掉多智能体系统,仅靠单一商业模型直接生成协议时,数据质量明显下滑,下游问答准确率出现显著回落;如果去掉结构化协议格式,直接把商业模型的长文本交互过程塞给特权分支,模型的输出长度迅速失控,验证了自然语言外壳对学生策略造成的严重污染;而如果彻底移除商业模型特权,仅保留强化学习框架,模型在多跳推理上的天花板则被牢牢压制。

针对超参数 $\lambda_{OPSD}$ 的敏感性分析同样揭示了强化学习与蒸馏的博弈。当权重设定在 $0.05$ 时,模型在各个尺寸上均达到性能峰值。权重过低(如 $0.01$)会导致密集指引不足,退化为低效的稀疏强化学习;而权重过高(如 $0.1$)则会让学生分支过度死记硬背特权分支的分布,丧失了在不确定环境下的自适应探索韧性。

图3:采用不同商业教师模型时在学生尺度上的稳定表现

另一个极具工程实践价值的结论是 “教师无关性”(Teacher Agnostic)。研究团队分别接入 Claude-Opus-4.6、GPT-5.5 和 Gemini-3.1-Pro 三种截然不同的商业模型作为离线流水线的底座,在不改动任何下游超参数的前提下进行协议合成与训练。

实验数据显示,三款教师模型所驱动的开源学生模型在测试集上的平均准确率波动范围被严格限制在 2 个百分点以内(Qwen3-1.7B 成绩分布在 37.9% 至 39.4%,Qwen3-4B 分布在 44.0% 至 44.6%)。这一极其平稳的收敛表现有力地证明:标准化的 JSON 协议充当了绝佳的语义绝缘层,它成功滤掉了不同闭源厂商模型特有的提示词怪癖、语言习惯与废话冗余,仅保留了最纯粹的推理意图与事实关联。在实际落地中,工程师完全可以根据各家商业 API 的成本、速率配额与可用性自由切换教师后端,而无需担心下游蒸馏流程受挫。

在合成成本方面,以调用 Gemini-3.1-Pro 为例,处理 25,600 个训练样本累计消耗调用约 16 万次,平均单个样本产出成本仅为 0.057 美元,整个数据集的一次性合成费用仅约 1,454 美元。鉴于这笔开销完全属于离线离散计算,且合成的协议可以跨版本沉淀为长期资产,其性价比相较于漫长而昂贵的大规模强化学习试错具有显著优势。

结语

长久以来,将大参数量商业模型的复杂决策智慧迁移至端侧或开源轻量模型,一直受困于“黑盒无法对齐”与“模仿导致变形”的死结。MAPD 的探索为这一难题提供了一条极其清晰的解题路径:跨越模型异构鸿沟的桥梁,不应是难以对齐的底层浮点概率,也不该是充满噪音的自然语言独白,而应是高信噪比、可验证的结构化任务协议。

通过将商业模型的能力规整进离线多智能体的质检漏斗,并借助特权同源自蒸馏将其无损内化,开源小模型得以在保持自身精简表达的同时,掌握原本只有百亿甚至千亿级模型才具备的多步搜索规划力。随着智能体搜索走向更多垂直专业领域,这种将黑盒智能转化为标准化协议进行密集指导的范式,无疑将成为缩小开源与闭源认知差距的重要工具。