LLMRouter:统一16种路由算法,性能相对提升14.6%
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

在大模型落地走向深水区的当下,工程师和架构师面临着一个极其现实的矛盾:前沿专有大模型的推理费用居高不下,而轻量级开源模型在特定垂直场景下又足够胜任。由于没有任何单一模型能在所有任务类型和预算约束下同时取得最优表现,大模型路由(LLM Routing)顺理成章地成为了兼顾质量与成本的兵家必争之地。
ArXiv URL:https://arxiv.org/abs/2608.06867v1
然而,路由技术的发展长期陷入各自为战的泥潭。有的团队训练轻量二分类器在强弱模型之间做分流,有的引入多轮迭代与验证级联(Cascade),有的探索基于强化学习的智能体路由,还有的试图根据用户个性化画像进行动态分发。不同方案往往采用完全不兼容的代码库、不同的模型候选池和各自独立的评估标准。由于缺乏标准化的数据标注流水线,想要公平比较“到底哪种路由算法最好”,在工程上极其困难。
来自南洋理工大学、普渡大学、伊利诺伊大学厄巴纳-香槟分校等机构的研究团队推出了统一开源基础设施 LLMRouter 以及多场景路由基准 xRouteBench。这项工作不仅首次将单轮、多轮及个性化路由统一抽象为标准序列决策过程,还集成了超过 16 种代表性路由器,并在 18 个不同梯队的大模型池上完成了系统性评估。实验表明,学习型路由器相较于“始终调用最强固定大模型”的基线,实现了 14.6% 的相对性能提升,同时彻底揭示了多轮路由与个性化路由在实际落地时的核心边界。

将纷繁复杂的路由机制抽象为序列决策过程
过往文献中的路由方案五花八门,从传统的嵌入匹配、分类预测,到近期的图神经网络与多智能体级联。要将它们放在同一个竞技场内比较,首先需要建立一套普适的数学语言。
LLMRouter 将大模型路由规范化为一个序列决策过程(Sequential Decision Process)。在任意决策步骤 $t$ 上,路由器观察到的当前状态可以形式化表示为:
\[s_{t} = (q, u, h_{t})\]其中 $q$ 代表输入的原始查询;$u$ 代表可选的用户上下文(例如用户身份标识、历史交互记录或偏好反馈);$h_{t}$ 则是当前已累积的交互历史。路由器根据该状态执行动作 $a_{t} \in \mathcal{M} \cup {\bot}$。如果执行分发动作 $a_{t} = m$,系统便会将状态发送给候选模型池 $\mathcal{M} = {m_{1}, \dots, m_{K}}$ 中的指定模型 $m$,并将其生成的响应结果 $y_{t}$ 追加到历史记录中,即 $h_{t+1} = h_{t} \oplus y_{t}$;如果执行终止动作 $a_{t} = \bot$,则本次路由生命周期结束,系统对已收集的多轮响应进行汇总并输出最终答案 $y$。
在这一公式下,传统的单轮路由不过是系统在第一轮分发后立即终止的特例。路由器的总体优化目标是在生成高质量答案的同时,最大限度压低整个决策轨迹 $\tau = (a_{1}, \dots, a_{T})$ 产生的推理开销:
\[\pi^{\star} = \arg\max_{\pi}\;\mathbb{E}_{q,\;\tau\sim\pi}\big[\,\mathrm{perf}(y\mid q) - \lambda\cdot c(\tau)\,\big]\]在这一形式化定义之上,该框架进一步将任意路由器的内部结构拆解为五个核心组件:
-
上下文编码器(Context Encoders $E_{q}$):负责将查询、多轮历史或用户画像投影为稠密向量特征。
-
模型编码器(Model Encoders $E_{m}$):对候选模型本身的特征、元数据或可学习参数进行表征。
-
打分函数(Scoring Functions $g$):计算输入状态与各个候选模型之间的匹配度或预期收益。
-
决策规则(Decision Rules $d$):依据打分分布决定具体的候选动作,如直接取最大值($\arg\max$)或依据概率策略进行采样。
-
学习信号(Learning Signals $\mathcal{L}$):用于驱动参数更新的目标函数,涵盖基于点对/成对偏好的监督损失、强化学习奖励信号等。
这种高度模块化的解构方式,将繁杂的路由体系梳理成三大流派:单轮路由、多轮与智能体路由,以及个性化路由。对于算法开发者而言,如果要在框架中扩展一种全新的路由器,不再需要重写底层的分发逻辑、数据加载和性能核算模块,而只需专注于实现特定的路由算子与损失函数,便能无缝调用下游所有基准与评测管道。

打破孤立单任务:全场景基准 xRouteBench
评估路由策略的难度远高于评估单体模型。单一模型的评测通常只需要一次推理,而评估路由器则必须知道候选池中“所有模型对该问题的解答表现”与“对应的 Token 级消耗”,以此作为监督信号和真实标签(Ground Truth)。
过去的基准如 RouterBench 或 RouterEval 大多局限于单轮纯文本问答,且基于静态冻结的模型集合,一旦接入新模型或面对跨模态任务就彻底失效。为了填补真实落地场景与评测之间的鸿沟,团队构建了包含 4,767 个测试样本的多场景基准 xRouteBench,并设计了完全自动化的跨模型执行与打分流水线。
整个基准涵盖了五条差异巨大的业务赛道:
-
通用大模型任务(Generic LLM Tasks):集成 MMLU-Pro、ARC-Challenge、GSM8K、MATH、HumanEval 等经典单轮文本评测,覆盖常识问答、深度数学推理和代码合成。
-
长记忆长程对话(Memory):基于 LoCoMo 与 LongMemEval,跨越上百轮历史对话。在这一场景下,输入的上下文 Token 成本在总成本中占据绝对主导地位,模型必须精确权衡长文档理解能力与输入费用。
-
多模态视觉(Vision):涵盖 Geometry3K、MathVista 几何图表数学推理以及 Charades-Ego 第一人称视频理解。候选模型池被天然分化,因为仅有一部分多模态模型能够处理视频与复杂图像。
-
时间序列(TimeSeries):基于 TSRBench,每个时序样本同时提供文本数值与图表渲染图两种格式,路由器除了需要选择模型,还需要决策采用哪种模态输入更加划算。
-
个性化偏好(Personalized):提取真实人类对话与预设的用户画像标签,摒弃传统的二元对错,采用强判定模型评估答案是否符合特定用户的沟通风格与偏好。
该基准依托由 18 个不同价格、参数量和厂商背景的主流模型构成的候选池,不仅记录准确率、F1、代码执行通过率等质量指标,还对每个请求的 Prompt Token、Completion Token 及其对应的官方 API 定价进行了精确审计。
为什么无脑选最大模型不是最优解?
在工业界部署中,一种常见的惯性思维是:大模型的能力是一条单调递增的单向链条,只要预算充足,把所有请求交给最贵的闭源模型就一定能获得最理想的效果。然而,xRouteBench 上的实测数据给出了颠覆性的结论。
在只关注回答质量、完全不考虑推理开销的极限设置下(即性能-成本权重 $(\alpha, \beta) = (1.0, 0.0)$),学习型路由器的表现明显压制了候选池中任何一个固定的单模型。实验显示,经过训练的优秀路由器相较于候选池中表现最强的单模型基线,取得了 14.6% 的相对性能提升。
这一现象背后的本质原因在于:不同大模型之间的能力边界具有很强的互补性,并不存在在全维度绝对占优的“全能冠军”。即便是公认处于第一梯队的千亿参数前沿模型,在处理特定领域的边缘长尾样本、小众格式要求或特殊逻辑推演时,依然会出现解题失误;而某些专门经过代码强化或垂直微调的小型模型,反而能够轻松给出正确输出。
路由器所挖掘的增量,正是这种模型间的“盲区互补”。学习型路由器能够依据查询的语义特征,将复杂逻辑分发给综合推理强的模型,把垂直代码交给代码专用模型,甚至把最难的大模型答错的特例路由给刚好命中特定模式的小模型。盲目固定调用最大模型,不仅让每一次调用的金钱开销达到顶峰,还会因为无法跳出该模型特有的认知死角,最终在平均质量上落后于优秀的动态路由系统。

预算约束收紧时的排行榜重构
当评测目标从单纯关注质量转向严苛的成本敏感场景时,路由器之间的优劣格局发生了剧烈洗牌。在平衡目标函数 $\alpha\cdot\mathrm{perf} - \beta\cdot\mathrm{cost}$ 中逐步调高成本惩罚系数 $\beta$ 的实验揭示了几个关键结论。
首先,轻量化路由器在紧缩预算下展现出惊人的统治力。在没有成本压力的环境下,结构复杂、特征维度高的路由器能够微调出更精细的分发策略;但随着 $\beta$ 权重增加,那些推理延迟更低、调度决策更加果断的轻量级分类路由器迅速登顶。其原因在于,重量级路由器自身的前置开销以及对高阶大模型的倾向性,在严苛的成本扣减下难以抵偿其微弱的质量增益;相反,轻量化方案能极为精准地捕捉到“哪些问题只需几厘钱的百亿级开源模型即可解决”,以极低的成本锁定及格线以上的输出质量。
其次,多轮路由与智能体路由的局限性被充分暴露。在近年来的研究中,借助智能体机制让模型多次规划、反复校验并在多轮交互后聚合答案(Agentic Routing)备受关注。然而跨场景实验表明,多轮路由在面对通用基准时并没有表现出相对于优秀单轮路由的明显优势。
在很多常规任务中,额外的任务分解步骤、多轮中间结果的生成以及冗长的验证循环,不仅直接导致输入输出 Token 费用成倍累加,还极易在中间轮次引入格式崩塌或冗余噪声。更致命的是,多轮路由器的实际表现极度受制于它所依赖的基础编排模型的能力。如果用于负责调度编排的基础小模型自身推理逻辑不稳,多轮调用反而会演变成“错上加错”的开销陷阱。只有在特定复杂推理场景,且配置了足够强大的调度中枢时,多轮级联与验证机制才能真正释放出正向价值。
用户画像注入:个性化路由的真实分界
在 xRouteBench 的个性化赛道以及实际部署在 Slack 环境中的真实用户测试中,团队验证了个性化建模对大模型路由的决定性影响。
现实用户在与 AI 交互时,偏好往往存在主观分歧:有人倾向于简明扼要的极简列表,有人喜欢生动详尽的代码辅导,还有人对特定语气情有独钟。通用的路由打分往往只基于群体统计平均值,容易抹杀个体偏好的差异。实验数据显示,在个性化评测中,引入用户上下文的个性化路由器在匹配准确度上显著超越了传统通用的无状态路由器。例如,基于全局图结构与注意力机制构建的 GMTRouter 取得了 68.78% 的最佳胜率,明显拉开了与传统排名算法(如 EloRouter 的 66.40%)的差距。
然而,实验同时也证明了一个残酷的工程事实:个性化路由的收益并非自动产生,而是极度依赖用户上下文的表征质量。如果仅在输入端简单拼接粗糙的用户 ID 标识,模型很难在冷启动或少样本情况下学出泛化特征;只有将历史交互特征、成对偏好反馈以及用户交互风格进行细粒度向量投影后,路由器才能真正预判出“当前用户会对哪个模型的行文风格和阐述逻辑给出好评”。
从离线实验走向在线多智能体网络
除算法验证之外,LLMRouter 的另一核心突破在于工程落地架构的闭环。为了让离线评测的研究成果能够无摩擦导入工业应用,该框架内置了开箱即用的工程组件。
在服务端,LLMRouter 能够将任意受支持的路由器直接封装为 OpenAI 兼容的标准 API 接口。这意味着上层业务系统(如 LangChain、LlamaIndex 等应用框架)无需改动任何底层调用代码,只需将原有接口的 base_url 替换为 LLMRouter 服务,即可直接享受底层的动态分发与成本控制红利。同时,系统通过外部持久化记忆组件跟踪用户的会话历史,不仅能支撑 Slack、Discord 等端到端聊天机器人,还支持通过 ComfyUI 拖拽式画布快速配置新的路由管线。
更具前瞻性的实验落地在多智能体协作系统(Multi-Agent Systems)中。当系统面对由多个协作 Agent 构成的复杂拓扑(如链式拓扑、星形调度拓扑或全连接协作网)时,LLMRouter 允许每一个工作节点独立挂载自适应路由器。各个节点根据当前局部的输入任务属性、前序智能体的输出特征以及本节点的性能预算,自发选择最优的模型后端。评估表明,这种解耦的分节点路由机制在复杂协作任务中同样取得了显著的质量提升与成本优化,为未来超大规模多智能体网络的基础设施设计提供了极具价值的范式参考。
总结与展望
模型规模与调用成本的持续分化,使“单一模型包打天下”的时代正在加速退场。大模型路由器不再是锦上添花的调度外挂,而是兼顾商业 ROI 与模型效能的关键中间件。
LLMRouter 与 xRouteBench 的价值不仅在于刷出了相对最强模型 14.6% 的性能增益,更在于终结了大模型路由领域长期以来“口径不一、闭门造车”的混乱局面。通过将五花八门的路由策略收敛至标准的序列决策过程,并打通自动构建标签、Token 级成本核算、实机 API 部署与多智能体分发的全链路闭环,这项工作为多模型协同与自适应推理的深入研究奠定了统一且坚实的开源基座。