蚂蚁集团提出Soft Clamp:打破行为杠杆不平衡,过度调用率降至9%
Behavior Leverage Imbalance in Multi-Teacher On-Policy Distillation

大语言模型正在加速演进为能够自主执行复杂任务的智能体(Agent)。在这一演进路线中,模型面对的最核心挑战之一不仅是“如何准确地生成工具调用参数”,更在于一系列离散的战略决策:“何时该调用工具”、“何时该消化工具的返回结果”,以及“何时该直接用自然语言回答用户”。
ArXiv URL:https://arxiv.org/abs/2607.07050v1
如果一个模型在使用工具时过度保守,它将无法完成需要外部实时信息的任务;但如果它染上了“工具瘾”(Over-calling),即使在应该直接回答的简单场景下也盲目抛出API请求,不仅会导致高昂的延迟与调用成本,还极易在多轮交互中陷入死循环。
为了让模型同时精通“结构化工具调用”和“流畅自然语言回复”这两种截然不同的行为模式,研究人员通常会采用多教师在线策略蒸馏(Multi-teacher On-Policy Distillation, MOPD)。在这种策略中,一个教师模型专门负责教导工具调用,另一个教师专门负责教导自然语言回复,而学生模型则基于自己生成的分布向两位教师学习。
这听起来是一个完美的分工,但蚂蚁集团(Ant Group)的最新研究揭示了一个此前被严重忽视的隐蔽失效模式:这种多教师蒸馏策略会引发严重的模型行为偏移,导致模型不可避免地滑向“过度调用工具”的深渊。而更棘手的是,这种行为偏移是无法通过宏观的总损失曲线(aggregate losses)被察觉的。
论文指出,真正的元凶在于行为杠杆不平衡(Behavior Leverage Imbalance)——在特定的模式切入点,极其微小的局部Token级信号能够对全局生成轨迹产生不成比例的巨大控制力。为此,研究团队提出了一种轻量级的Token级散度校准方法 Soft Clamp,在保留学习梯度的同时动态压缩极端信号。实验表明,在 APIGen-MT 基准测试中,Soft Clamp 成功将工具过度调用率从 13.7% 压降至 9.0%,同时维持了极高的决策准确性。
宏观统计的盲区:为什么模型偏爱调用工具?
在探讨解决方案之前,我们首先需要理解多教师在线策略蒸馏(以广义知识蒸馏 GKD 为代表)在实际应用中究竟遭遇了什么困境。
在这项研究的设定中,学生模型在训练时会根据上下文和自己当前的策略生成后续轨迹。针对每一条训练样本,系统会将其路由给特定的教师:如果是需要外部动作的任务,就由工具调用教师(Tool-call teacher)接管监督;如果是纯对话任务,则由回复教师(Response teacher)负责监督。
实验表明,普通的广义知识蒸馏(Vanilla GKD)确实显著提升了模型在应当调用工具时的召回率。但硬币的另一面是,它同时也大幅推高了过度调用(over-calling)的比例。换句话说,模型变得越来越倾向于把不需要工具的问题也扔给工具处理。
当研究人员试图从训练日志中寻找原因时,他们发现常规的宏观统计指标完全失效了:
-
是工具调用数据占比太多了吗? 并非如此。统计显示,回复类样本实际上获得了更多的 Token 曝光量。
-
是工具教师给出的散度(损失)更大吗? 依然不是。在整个序列级别上,全序列的每个 Token 上的 Jensen-Shannon 散度(JSD)平均值,以及梯度代理指标,在回复教师这一侧往往更大。
如下图所示,无论是累积的曝光比例,还是原始的平均散度比例,均显示自然语言回复一侧占据主导地位。按照直觉,模型应该变得更偏向于直接回复才对,但最终的实体行为却完全背道而驰。

这就排除了最简单的解释:最终的行为偏移并不能用样本数量、Token 数量或者总散度的绝对大小来解释。模型之所以滑向工具调用,必然存在某种局部信号,它的“杀伤力”并未在全序列的宏观平均中体现出来。
核心机制发现:行为杠杆不平衡
如果总账算不清楚,我们就必须深入微观层面。蚂蚁集团的研究团队提出了这篇论文中最核心的概念——行为杠杆(Behavior Leverage)。
我们可以把文本生成看作是一个在岔路口不断做决定的过程。行为杠杆定义了某个具体位置的 Token 对未来整体生成模式(Generation Mode)的控制程度。
在基于大语言模型的工具调用体系中,诸如 <tool_call> 这样的特殊标记、函数名以及结构化的符号,是典型的模式进入标记(Mode-entry tokens)。这些位置具有极高的行为杠杆。为什么?因为一旦模型在当前步骤输出了 <tool_call>,后面的整条路线就被彻底锁定进了结构化输出的逻辑框架中,对话的性质发生了不可逆的改变,后续的轮次也将围绕工具观察结果展开。
相比之下,自然语言回复中的内容 Token(例如形容词、副词或事实陈述)虽然也可能会产生很高的局部预测损失,但修正这些 Token 仅仅只会改变局部的一句话,它几乎不具备改变“模型当前是在聊天还是在调用API”这种宏观状态的能力。
这就造成了多教师蒸馏中的内在脆弱性:当一个教师(工具教师)的监督信号高度集中在少数几个具有超高杠杆的决策点上,而另一个教师(回复教师)的监督信号均匀稀释在大量低杠杆的内容 Token 上时,两者的博弈就不再是公平的。工具教师只要在关键的分岔口施加一点点极端压力,就能轻易将模型的默认行为推向工具调用,哪怕回复教师在后面几百个 Token 里喊破了喉咙,也无法改变模型已经进入工具执行模块的事实。
为了验证这一假设,研究团队检查了在回复类样本上的“决策压力”(Decision Pressure)。他们观察学生模型在本来应该直接回答的样本中,给予工具调用特殊标记的概率。


分析结果高度吻合了理论预测:在回复样本上,模型输出工具调用标记的概率与最终评测中的过度调用率表现出了极强的正相关。这说明,局部关键位置的极端散度信号,才是主导模型行为偏移的真正幕后推手。
Soft Clamp:精准校准高杠杆信号
找到了病因,如何对症下药?我们不能简单地降低工具教师的全局权重,因为那会损害模型处理合法工具调用的能力。我们需要的是一种只针对局部极端信号进行压制的机制。
本文提出了一种名为 Soft Clamp 的轻量级 Token 级散度校准方法。它的核心思想不是一刀切地丢弃困难样本,而是动态地压缩那些可能导致行为偏移的极端 Token 级信号。
对于一个批次中的监督 Token,计算它们各自的 Jensen-Shannon 散度 $d_i$ 后,Soft Clamp 首先根据当前批次的散度均值设定一个动态阈值:
\[C = k \cdot \mathrm{mean}_i(d_i)\]接下来,针对每个 Token 的散度,执行如下操作:
\[d'_i = \begin{cases} d_i, & d_i \leq C, \\ d_i \cdot \frac{C}{\mathrm{stopgrad}(d_i)}, & d_i > C. \end{cases}\]这个公式的设计非常精妙。如果一个 Token 的散度低于设定的阈值 $C$,它保持不变,正常参与训练;如果散度超过了极值阈值,它的前向传播值会被强制拉平到 $C$。
但是,这里的关键在于分母使用了 $\mathrm{stopgrad}(d_i)$。这意味着在反向传播计算梯度时,该极端 Token 并没有像硬截断(Hard Clipping)那样失去所有的学习信号,而是将其梯度按 $C/d_i$ 的比例进行了平滑缩放。
与全局重加权(Global Reweighting)相比,Soft Clamp 只作用于极端的异常值,不影响普通 Token 的学习节奏;与硬截断相比,Soft Clamp 为高杠杆位置保留了非零的梯度反馈,确保模型依然知道自己在这个分岔口犯了错。

从上图中可以观察到,通过合理控制干预强度,Soft Clamp 能够对过度调用行为进行极为有效的靶向治疗,同时并不影响大盘的稳定。值得一提的是,为了防止纯在线蒸馏带来的结构化输出模式崩塌(Schema Drift),研究人员在训练中还引入了一个很小的监督损失作为格式锚定(Format Anchor),确保模型输出的工具请求格式始终合法可用。
实验结果:治愈多轮交互中的“工具瘾”
为了全面评估 Soft Clamp 的实际效果,研究团队在多个行业标准基准上进行了详尽测试,所有模型均基于 Qwen3.5-9B 进行训练。
单轮决策博弈:APIGen-MT 结果
APIGen-MT 是评估模型在域内是否能正确决策工具调用的核心测试场。在这里,过度调用(Over-calling)指的是模型在遇到不该用工具(应该直接响应)的问题时,却发出了工具调用的比例。
下表展示了多方对决的结果。基础的监督微调(SFT)模型虽然过度调用率很低,但它在真正需要工具时的召回率(Call Recall)不足。引入普通的广义知识蒸馏(Vanilla GKD)后,虽然召唤工具的能力被强力拉升到了 91.4%,但副作用极其明显——过度调用率飙升到了 13.7%。

当切换到 Soft Clamp 之后,模型在保持了 89.2% 极高决策准确率的同时,成功将过度调用率大幅降低至 9.0%。这证明了对极端局部信号的动态压缩,有效地削弱了不受控的行为杠杆。不仅如此,在 BFCL 的无关请求拒绝(Irrelevance refusal)测试中,Soft Clamp 同样在所有 GKD 变体中表现最为优异,证明该方法具备跨出特定数据集的泛化能力。
迈向实际应用:多轮循环的毁灭与重生
仅仅评估单轮的决策失误可能无法完全体现“工具瘾”在实际部署中的危害。当一个拥有工具过度调用倾向的模型被放入多轮自动化流程中时,灾难往往会被放大。
研究团队为此设计了一套包含 800 个 BFCL 任务、3136 个用户交互轮次的多轮诊断环境。在这个环境下,重点监测模型是否会陷入重复调用某个无效工具的“死循环”。

如上表所示,诊断数据揭示了过度调用在系统层面的破坏力:
-
使用普通的 GKD 时,模型平均每轮对话试图发起 1.494 次工具调用;在高达 14.8% 的轮次中,模型陷入了至少3次以上的循环(Loop@3);在 16.7% 的情况里,模型在反复重试一模一样的工具请求。
-
应用 Soft Clamp 进行训练后,这些指标得到了显著抑制:平均每轮调用次数降至 1.268 次,陷入死循环的比例降至 10.1%,重复调用率收窄至 11.1%。更重要的是,模型最终成功给出回答(Final-answer)的比例从 89.6% 跃升到了 94.1%。
这意味着,通过在蒸馏阶段校准行为杠杆,我们不仅仅是美化了测试集上的某个单项指标,而是切切实实地挽救了一个在多轮应用环境中濒临崩溃的 Agent 系统。
结语与启示
多教师监督和蒸馏机制已被公认为训练下一代通用智能体的必由之路。蚂蚁集团的这项研究为我们敲响了警钟:在处理混合行为的蒸馏时,我们不能陷入“唯 Loss 论”的陷阱。
损失相加并不等于行为均衡。当一部分监督信号作用于模式切入点(具备高行为杠杆),而另一部分信号稀释于庞杂的内容生成中时,表面上看似平衡的宏观统计,往往掩盖了底层的严重倾斜。
Soft Clamp 的提出,不仅为缓解工具过度调用提供了一个优雅且轻量的工程解法,更在理论诊断思路上提供了一种全新的视角:我们必须去监控教师的知识信号究竟“落在”了整个轨迹的什么位置,以及这个位置是否处于撬动整个系统状态的支点上。
未来,这种“行为杠杆”的分析范式有望推广到大语言模型更多对立能力的训练平衡中去——例如代码生成与自然语言的混排、安全拒绝与有益回答的界限划分、或是短促精确与长链条推理的切换等。只有深刻理解局部标记如何掌控全局行为,我们才能真正驾驭越来越复杂的 AI 智能体。