半数算力提升4.8分!GRADE:四大门控重构自适应多智能体推理
Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning

大模型推理能力的发展,正逐渐从依赖单体模型参数的线性增长,转向多智能体(Multi-agent)协作机制。然而,简单地堆叠多个智能体往往会带来推理延迟与显存占用的成倍增加,更关键的是,过去的研究并未彻底解决三个核心问题:遇到具体查询时究竟该唤醒哪些智能体?查询信息需要在智能体层级中下探到多深?智能体之间的互相通信在何时才是真正具有性价比的?
ArXiv URL:https://arxiv.org/abs/2607.10836v1
来自印度理工学院德里分校(Indian Institute of Technology Delhi)的最新研究提出了 GRADE(Gated Routing and Adaptive Depth for Efficient Reasoning)框架。这是一种层次化的多智能体系统,它没有选择无脑堆砌算力,而是通过四个轻量级的可学习门控机制,联合动态控制智能体的选择、推理层级的深度、跨智能体通信以及分支剪枝。
实验结果给出了极具说服力的回答:在平均激活约 17B 参数的约束下,GRADE 在 GSM8K、MMLUPro 和 GPQA 等推理基准上超越了所有对比基线。特别是在 MMLUPro 测试中,GRADE 在仅消耗上一代最强基线(Puppeteer)一半激活算力的情况下,将准确率拉高了 4.8 个百分点。GRADE 的成功证明了一个违反直觉的结论:多智能体系统的性能提升,更多来自于对冗余算力的“克制”,而非盲目扩充容量。
四大门控机制:让算力好钢用在刀刃上
GRADE 的核心架构是一个包含共享编码器、一个轻量级协调器($M_0$)以及一个由管理者和子智能体组成的层次化团队。为了精细管理这个系统,作者引入了四个基于两层多层感知机(MLP)的独立门控机制。它们的目标是截断不必要的计算,过滤会引入噪声的冗余信息。
分配门控(Assignment Gate)负责决定针对当前查询,究竟需要激活资源池中的哪些子智能体。它通过计算查询特征、智能体描述符特征以及管理者给出的分组信号之间的亲和度,来输出每一个智能体的激活得分。
深度门控(Depth Gate)则是实现自适应计算的最核心组件。它类似于深度混合(Mixture of Depths)机制,决定了当前查询在网络中需要下探的层级。GRADE 被设计为三层结构:层级 0 仅需轻量级协调器即可返回结果(成本最低);层级 1 引入管理者介入;层级 2 才全面激活底层的子智能体池。对于简单的数学题,深度门控会选择尽早退出,避免杀鸡用牛刀;而只有面对高难度推理时,才会动用完整的专家资源。
跨读门控(Cross-Read Gate)解决了多智能体系统中最容易失控的通信成本问题。当被激活的子智能体生成了各自的消息嵌入后,跨读门控会对所有智能体对进行打分,通过 Gumbel-sigmoid 松弛机制输出一个二值化的通信决策。只有当得分超过 0.5 时,两个智能体才被允许在随后的交叉注意力阶段交换信息。这种稀疏化的通信机制有效阻止了无关专家之间的“废话连篇”,防止跨领域知识融合时产生噪声。
剪枝门控(Prune Gate)作为最终融合前的最后一道关卡,会给每个活跃的推理分支评估一个标量价值。如果某个分支的价值低于 0.35 的硬性阈值,它就会被直接丢弃。这一步在昂贵的交叉注意力融合操作发生之前剔除掉无价值信息,极大挽回了系统整体的延迟劣势。
CoGRPO:专为多智能体层次结构设计的强化学习
上述四个门控机制由于涉及大量的离散路由与二值化决策,无法通过标准的微调反向传播来优化。近期在推理模型中大放异彩的 GRPO(组相对策略优化)成为了解决离散决策的利器,但原生的 GRPO 是为单体模型输出单一序列设计的,无法直接套用于多智能体的联合动作空间。
为此,研究团队提出了一种无评论家(Critic-free)的强化学习新配方:CoGRPO(协作组相对策略优化)。
在 CoGRPO 中,针对每一个查询会采样 8 组联合 rollout。这里的差异化不仅体现在最终的文本输出上,更体现在门控所选择的深度、分配的智能体、跨读的拓扑结构以及剪枝决策上。CoGRPO 摒弃了传统的价值网络,而是直接在 8 个 rollout 组成的组内进行奖励归一化。
最为精妙的是它的“协作信用分配”机制。在传统的强化学习中,要厘清哪一个门控模块对最终结果做出了贡献,往往需要极其昂贵的反事实推演。而 CoGRPO 让每一个参与了当前 rollout 的组件(包括做出非平凡决策的门控模块和最终存活的子智能体)共享同一个组相对优势信号 $\hat{A}^{(i)}$。只要整个 8 个 rollout 的输出奖励完全一致,说明当前组不具备区分度,所有组件都不会产生梯度更新。配合各种防止崩溃的辅助损失函数(如负载均衡惩罚、深度惩罚和稀疏通信惩罚),CoGRPO 成功让这套复杂的系统实现了端到端的联合收敛。
专家热插拔与校准:解决动态替换的灾难性衰减
在实际部署中,多智能体系统的优势在于其模块化,开发者希望能够在不重新训练整个网络的情况下,随意将旧的子智能体替换为更新的 API 模型或本地模型(即“热插拔”)。然而,由于不同模型的输出特征分布(尺度、方差等)截然不同,一旦替换,原本在训练阶段拟合好的门控阈值就会全盘失效。
GRADE 给出的方案是为每一个智能体引入一个可学习的仿射校准映射 $\kappa_a$。当新的专家模型被接入时,只需在极少量的校准数据(如 64 个查询)上更新这个仿射变换的参数,将新模型的输出特征重新拉回系统共享的嵌入空间即可。

实验数据印证了这一机制的必要性。如果没有校准映射直接进行热插拔替换,GRADE 的准确率会瞬间暴跌 18.1 个百分点(从 78.2% 跌至 60.1%),并且在后续评估中彻底失去恢复能力。而加入校准机制后,即便是将 GPT-4o-mini 这种 API 模型直接替换为本地的 Qwen2.5-7B,系统也能在短短几个批次的校准后恢复到原本的最佳性能。
克制才是多智能体性能的解药
GRADE 展现出的核心哲学非常明确:计算资源的收益并非总是正向的,许多时候过度激活专家反而会损害结果。
在对跨读门控的消融实验中,研究人员发现,当允许所有被激活的智能体互相通信时(通信频率 $\rho=1.0$),有半数的智能体对实际上是在产生噪声或冗余信息,这直接导致模型性能下降了 2.1 个百分点。最终,门控网络自发将通信频率稳定在了约 0.5 的水平,只让最必要的专家进行信息交换。

类似的情况也出现在智能体数量的选择上。强制使用固定数量的专家(固定 $k$)进行评估时发现,当激活的专家数量从 3 个增加到 5 个时,MMLUPro 的准确率不仅没有提升,反而从 63.5% 下降到了 62.1%。因为当最强硬的领域专家已经就位后,强行拉入第六个不相关的专家只会扰乱最终的特征融合。GRADE 的动态路由通过精确截断有效规避了这种内耗,超越了所有的固定 $k$ 设定。
通过对不同难度基准测试的 Token 消耗追踪,可以更直观地看到 GRADE 的自适应调度能力。对于较为简单的 GSM8K,模型在经过初期的探索后,迅速学会了克制,将平均调用智能体数量压缩在 2.1 个,深度降至 1.8 左右,甚至许多问题直接由管理者层级返回;而面对极其困难的 AIME-2025 竞赛题,系统则毫不吝啬,平均调用 3.8 个智能体,并且全部下探到底层专家池。

GRADE 为未来的多智能体大模型框架提供了一个清晰的范本。通过层次化的深度控制与精细的门控裁剪,AI 系统完全有能力在单体模型与堆料式多智能体之间找到最佳平衡点。将计算资源视为一种需要被动态分配和收回的昂贵资产,或许正是下一代高效推理模型需要跨越的关键门槛。