MERA:不是绕开小模型而是让它持续进化,推理成本直降近40%
MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

在大模型智能体(LLM Agent)执行多步复杂任务时,并非每一步都需要动用昂贵的大脑。整个任务链条中,既有需要缜密规划和高难度代码生成的“硬骨头”,也有大量诸如字段抽取、格式整理、工具参数组装等结构化繁琐步骤。面对这种计算量与认知负荷的不对称,工业界最常见的降本策略是“动态路由”(Model Routing):设计一个分类器,将简单的调用分发给低成本的小模型(SLM),把复杂的调用交给大模型。
ArXiv URL:https://arxiv.org/abs/2608.10333v1
但这一范式存在一个根本性天花板:路由策略无论怎么优化,小模型本身的能力都是静态冻结的。系统能够节省的成本上限,被小模型最初的能力边界死死卡住;一旦遇到小模型无法独立胜任的边缘或高频调用,流量就只能全部溢出给大模型。
来自卡内基梅隆大学(CMU)、加利福尼亚大学洛杉矶分校(UCLA)、上海交通大学等机构的研究团队提出了 MERA(Model Evolution and Routing with Skill Adaptation)。该工作打破了“小模型只是大模型廉价替补”的传统假设,明确主张:在多步智能体系统中,优化的核心应当是小模型本身的持续进化(Model Evolution),而路由和技能库只是服务于安全部署的基础设施。MERA 将单次模型调用(Single Model Invocation)作为自适应的基本单元,通过执行验证后的在线轨迹回放,迭代更新技能书并对小模型进行强化微调。
实验结果给出了极具说服力的反馈:在 582 个完全隔离的 HumanEval+MBPP 编程评测任务中,历经 4 轮迭代适应,仅有 1.5B 参数的 Qwen2.5-Coder-1.5B 独立代码通过率从基线的 28.7% 提升至 49.7%;结合带有执行验证器的回退机制(Fallback),系统整体达成了 88.3% 的通过率,几乎平替了全量调用顶级模型 GPT-5.6 Luna 的表现,而总推理成本仅为全量大模型的 60.8%。在多轮工具交互基准 TAU-2 上,经过微调的 2B 模型同样追平了未适配的 4B 模型。这项工作清晰地证明了:与其被动地绕开小模型,不如建立一套基于执行反馈的闭环系统,在真实的智能体工作流中把小模型直接练出来。
为什么任务级路由不够用?
要理解 MERA 的设计动机,必须先拆解智能体在生产环境下的实际执行负荷。
当用户向智能体提出一个复合目标(例如“排查仓库中的死锁 Bug 并编写回归测试”)时,智能体会将其展开成一个由数十次模型调用交织而成的执行图。在这个长序列中,高难度的算法推演往往与格式转换并存。如果在“用户任务级别”做一次性粗粒度路由,往往陷入两难:由于任务中包含复杂子步骤,路由器只能被迫将整个任务全部发给大模型,导致廉价子步骤被严重过度计算;反之,若强行降级给小模型,整个智能体可能在第二步工具调用组装时就因格式错误而直接崩溃。
细粒度到“单次模型调用级别”的调用级路由固然更符合直觉,但直接在线上环境部署动态微调又伴随着极高风险。线上生成的轨迹数据往往充斥着噪声,仓促更新的小模型 LoRA 适配层极易在生僻场景上发生灾难性遗忘;而试图把高频操作抽取为提示词模板(Prompt Template)时,又常因签名不匹配导致执行失败。
生产环境的智能体系统急需一种严格区分“在线观测(Observation)”与“准入部署(Admission)”的系统架构。它不仅要以单次调用为颗粒度捕捉失败现场,还要有一套保守且可复现的验证机制,确保所有适配层和路由策略只有在联合重放测试中确认不发生能力回退时,才被允许推进到生产服务中。
MERA 的核心机制:三步联动与单次调用闭环
MERA 的整体设计将系统的运行期(Serving Path)与更新期(Update Path)清晰解耦。在运行期,系统采用极度轻量且保守的策略:前置路由器仅根据当前调用的序列化提示词(Serialized Prompt)在小模型、专属小模型与大模型之间做快速分发,完全不依赖隐藏状态或复杂的 LLM 裁判。小模型生成结果后,下游挂载的验证器(Verifier)会对输出进行模式校验、工具调用合法性检查或代码沙箱执行;一旦验证不通过,系统立刻触发回退机制(Fallback),调用大模型补救,确保端到端任务成功率不受损害。
整套系统的质变发生在离线的更新回路中。MERA 将运行时沉淀下来的所有日志规范化为“单步调用切片”(Step Slices),切片中记录了提示词、上下文、生成的输出、验证器返回值、重试次数以及回退元数据。更新时,系统严格按照带有依赖关系的 Skill $\rightarrow$ LLM $\rightarrow$ Router 调度流循环演进。
第一步是更新技能书(SkillBook)。SkillBook 并不是一个简单的输出结果缓存,而是一套外部程序化提示词记忆库。系统通过分析轨迹切片中按数据集或任务签名归类的成功与失败统计数据,提炼出可复用的结构化模式。它将静态任务格式约束、有边界的成功范例以及反复出现的常见陷阱(Pitfalls)融合在一起,形成可动态挂载的执行先验。这一步必须排在最前面,因为后续小模型的训练必须将 SkillBook 生成的最新流程作为前缀输入,避免小模型学到陈旧的流程。
第二步是针对小模型适配器的针对性微调(LLM Update)。MERA 会专门挑选出此前执行失败的硬样本(Hard Examples),或者路由器判断与 SkillBook 建议产生冲突的不确定切片。由大模型在回放中生成经过执行验证的标准演示(Teacher Demonstrations),小模型据此进行监督微调(SFT)。为了让小模型的输出空间进一步对齐真实执行约束,系统在 SFT 之上可无缝衔接基于规则/执行反馈的强化学习算法(GRPO)。此时的小模型不再是一个通用的聊天玩具,而是被打磨成了熟悉特定工具定义与代码约束的高效执行单元。
第三步是训练调用级路由器(Router Update)。路由器的任务标签直接来源于小模型在当前轮次下的真实可执行结果。换句话说,只有当小模型在某一类提示词模式下已经具备稳定通过验证的能力时,路由器才会给这类样本打上“可降级处理(Cheap Route)”的标签。将路由器放在最后更新,彻底杜绝了模型能力与路由策略之间的状态不一致。
更新完成后的三个产物——新技能书、新小模型 LoRA 适配器、新路由器,不能被单独上线。MERA 引入了联合重放门控(Joint Replay Gate):只有在包含验证器回退的端到端离线完整重放中,新的组合状态能够在不损害最终任务质量的前提下显著压降调用成本或降低回退概率,这套状态才会被真正准入到服务注册表中。
实验评测:小模型能扛起多重的大旗?
为了验证 MERA 的实际效果,研究团队在代码生成与多轮工具调用两大典型智能体场景下展开了深入实验。
核心实验采用了 582 个完全隔离的 HumanEval+MBPP 编程任务(报告 3 个随机种子的均值),基础小模型选用了参数量极为紧凑的 Qwen2.5-Coder-1.5B,大模型回退端点则接入 GPT-5.6 Luna。这一实验设计回答了论文最核心的问题:小模型能力的提升,到底能给整个系统带来怎样的质变?
在完全关闭路由器和回退兜底、仅测试小模型独立表现的控制实验中,原始的 Qwen2.5-Coder-1.5B 独立通过率仅有 28.7%。经历四轮 MERA 闭环更新后,仅靠纯监督微调(SFT),其独立通过率就跨越到了 44.2%;若进一步叠加执行奖励引导的 GRPO 强化学习,独立通过率达到了 49.7%,在基线基础上大幅拉升了 21 个百分点。成对 t 检验表明,GRPO 相比纯 SFT 带来的 5.5 到 6.7 个百分点的净增长具有统计显著性。这一组独立模型评测证明:多轮闭环自适应确实实质性拓宽了小模型的基础能力边界,而非仅仅通过过拟合记忆了固定答案。
当把进化后的小模型放回带有执行验证器与 Luna 回退的完整部署架构中时,系统的整体工程表现展现出了巨大的经济价值。此时系统的端到端代码通过率稳定在 88.3%,与全量强制调用 GPT-5.6 Luna 的基准几乎完全一致;但由于 1.5B 小模型接管了近一半的高频正确调用,系统实际消耗的标准化推理成本直降至纯大模型方案的 60.8%。
值得注意的是,研究团队在此做出了非常诚恳的系统消融归因:在部署架构中,传统依赖文本语义的前置轻量级路由器表现其实相对有限,整个系统之所以能在省下近 40% 成本的同时依然稳守 88.3% 的通过率,核心支柱正是“进化后的小模型底座 + 后置验证器兜底”的协同效应。只要下游有一个可靠的沙箱验证器(如 Python 执行环境)把关,系统就敢于激进地把流量交给 1.5B 小模型执行,一旦执行报错立即静默回退,从而在完全不折损服务 SLA 的前提下吞噬大量低成本吞吐。
除了代码基准,研究还在更贴近通用智能体工作流的 TAU-2 评测集上进行了多轮工具使用检验。在统一解析器、数据切分与用户模拟器的严苛无回退对比下,经过微调的 Qwen3.5-2B 模型的成功任务数从 14/35 提升到了 18/35,直接追平了未适配的 4B 模型表现。尽管作者在论文中客观指出受限于样本量(McNemar 检验 $p=0.17$),该结果属于统计功效不足(Underpowered)的工具可用性验证,但依然清晰揭示了基于执行反馈的小模型进化在复杂工具调用场景中的潜力。
算账时刻:模型持续自适应到底划算吗?
很多工程师对在生产系统中引入多轮在线学习持怀疑态度:微调适配器、做强化学习训练、频繁做重放验证,本身都需要消耗可观的 GPU 算力。一次性训练投入的成本,真的能被后续推理节省的费用抹平吗?
论文在第 4.5 节给出了极为接地气的财务回本周期分析(Break-even Analysis)。研究人员以一个金融场景的真实生产负载为基准建立数学模型,测算了不同自适应样本规模下的收支平衡点:
当针对 500 条高质量任务轨迹执行微调时,虽然产生了更高的前期一次性适配开销,但由于小模型在后续高频调用中获得了更强、更稳定的承接能力,其名义投资回本周期仅需 8.68 天;即便在极其保守的商业估算下——假设线上环境由于流量漂移等因素只能兑现预估节省额的 70%,整个系统的投资回收期也仅为 12.47 天。
这意味着,只要一个智能体系统具备持续运转两周以上的业务生命周期,通过执行闭环来演化小模型,在商业 ROI 上就完全是一个正收益决策。这种将学术算法改进与运维财务模型强绑定的论证方式,为智能体工程落地提供了极具实操价值的决策框架。
从静态路由到持续进化的智能体系统
纵观近年来的智能体基础设施研究,路由技术从最早的任务级分发,逐步演进为单步路由、级联调用(Cascades)以及推测推断(Speculative Decoding)。然而,业界此前普遍将重点放在了“如何设计一个更精巧的分流器”上,默认被分流的终端是几尊固定不变的雕像。
MERA 的价值在于重构了这套系统的叙事重心。它清晰地表明:路由只是手段,进化才是目的。在智能体拥有执行沙箱、工具定义和单元测试的环境下,执行轨迹本质上就是最高纯度的自监督数据源。
通过确立“单次模型调用”这一极细粒度的适配单元,并依靠严格的“Skill $\rightarrow$ LLM $\rightarrow$ Router”因果调度与联合重放门控,MERA 提供了一个既激进提效又保守控险的工业级范式。在未来,随着垂直领域小型开源模型的推理效率不断极致化,让大模型充当“导师兼安全员”、让小模型在业务一线的真实回放中不断“吃经验升级”,或将成为大规模智能体系统不可逆转的标准架构。