CMU实测Agent动态路由:74%首步即偏离,静态回放评测了假世界?

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

CMU实测Agent动态路由:74%首步即偏离,静态回放评测了假世界? 论文图示

在大模型推理成本高居不下的背景下,模型路由(LLM Routing)被普遍视为最直接的降本增效利器。它的逻辑非常直观:遇到简单问题交给廉价的小模型,遇到复杂推理才激活昂贵的大模型。随着智能体(Agent)从单轮对话走向跨越数十步的软件工程、工具调用和操作系统操作,研究界和工业界正迅速将路由粒度推向极限——在 Agent 执行轨迹的每一个单步(Per-step)动态决策当前动作由谁执行。

ArXiv URL:https://arxiv.org/abs/2608.08239v1

然而,如何评估这种动态切换策略的优劣,却潜藏着一个几乎被所有人忽视的巨大漏洞。由于在真实交互环境中完整运行成百上千次 Agent 轨迹的成本极高,现有的多步路由基准普遍沿用了单轮路由时代的评测范式:离线静态回放(Replay Evaluation)。评测者预先记录某个模型生成的完整历史日志,当路由算法决定在第 $k$ 步切换到另一个模型时,评测系统只是简单地把新模型在离线日志里的对应输出“缝合”进来,并默认环境和后续的几十步轨迹依然会沿着原有轨迹继续演进。

来自卡耐基梅隆大学(CMU)的一项最新研究尖锐地戳破了这个假设。这篇被 COLM 2026 Efficient Reasoning Workshop 接收的论文明确指出:静态回放评测在多步闭环 Agent 场景中完全是在“给一个根本不存在的世界打分”。在真实环境下进行严格的分支推演(Branching Rollouts)后,研究团队发现,早期切换模型的 Agent 有 74% 至 77% 在切换后的第一个动作就与原轨迹发生剧烈分叉;在关键的任务胜负判定上,基于日志拼接的静态回放做出的 5 次预测全部失败(0 投 5 中),其预测效果甚至不如一个“永远猜失败”的盲猜基线。

这项工作不仅系统性度量了静态回放评测的失真程度,更揭示了推理服务底层量化噪声、强模型“深思税”等一系列在真实 Agent 部署中必须面对的工程现实。

闭环系统的盲区:为什么单轮评估经验在 Agent 身上彻底失效?

要理解静态回放为何失效,首先必须看清单轮路由与多步 Agent 之间的本质拓扑差异。

在单轮问答或单步分类任务中,用户输入是给定的,系统状态是静态的。将请求发送给模型 $A$ 还是模型 $B$,只影响当前的单次返回结果,并不存在后续连带的状态反馈。因此,离线收集一组测试集,分别记录下每个候选模型的答复,评估路由算法时只需根据规则查表取值。这种开环(Open-loop)评测既严谨又极其廉价。

但 Agent 运行在与环境紧密耦合的闭环(Closed-loop)系统中。以软件工程基准 SWE-bench 为例,Agent 在第 $k$ 步执行的每一个 Bash 命令、每一次代码检索、每一回语法修改,都会直接改变底层的 Docker 容器状态,进而决定第 $k+1$ 步返回的环境观察(Observation)。

当静态回放评测者假设“如果在第 $k$ 步把小模型换成大模型,后续轨迹还会照常发生”时,实际上是把一个强马尔可夫决策过程强行拉平为开环查表。任何模型切换引发的细微动作差异——哪怕只是排查代码时换了一个检索命令,或者改用了不同的编辑工具——都会立刻摧毁后续所有预录观察结果的有效性。

强化学习领域的离线策略评估(Off-Policy Evaluation, OPE)早在理论上定义了这种失效:行为策略(生成日志的原模型)与目标策略(切换后的模型)所诱导的状态分布发生了严重漂移。但在 LLM Agent 领域,由于缺乏真机分支推演的基准数据,业界此前并不知道这种漂移到底有多快、有多深,更无法证实静态回放得出的性能提升数字究竟有几分可信。

分支推演方案:在真实容器中做严苛的“平行宇宙”对照

为了测量这种漂移的真实结构与数量级,CMU 团队放弃了廉价的查表评估,采用了一套极其严密但也极其消耗算力的分支实时推演(Branching Rollouts)实验框架

实验依托 SWE-bench Verified 官方环境,选用 mini-SWE-agent 这一轻量级 Bash 交互框架。候选模型池由两个典型模型构成:作为小模型的 Qwen3-4B-Instruct(FP8 量化)和作为大模型的 Qwen3-14B(AWQ 量化,关闭思考模式),均通过 vLLM 在单张 24GB GPU 上以温度为 0 的严苛配置服务,以此模拟实际受限硬件下的端侧或私有化部署。

每一个测试实例的分支推演均包含四个严谨的步骤:

  1. 生成基础轨迹:让基座模型从初始环境出发,独立执行至任务终止(上限 50 步,上下文窗口 28k tokens),完整记录每一步的动作与容器反馈。

  2. 环境重建与前缀回放:在基础轨迹总步数的 30%(早期分叉)和 70%(晚期分叉)两个关键节点实施切断。为了确保分叉点的初始状态毫无偏差,评测框架会启动一个全新的 Docker 容器,按顺序严格重新执行分叉点之前的所有预录动作。研究团队统计了 708 个分支中的 11,702 个回放动作,环境返回码的一致性达到了惊人的 99.99%,707 个分支实现完全一致的状态重建,彻底排除了环境复原不准对分叉产生的干扰。

  3. 注入上下文并切换推演:将分叉点之前的完整消息历史灌入待测模型,使其拥有与基座模型完全一致的历史记忆,随后让模型在实时容器中自主交互直至终止。

  4. 设立同模型对照组(Control Arms):这是整个实验最精妙的设计。任何大语言模型推理栈即使在温度为 0 时,也可能因算子并行度、动态批处理或 KV Cache 管理带来微小的不确定性。因此,在每一个分叉点,团队不仅安排了“换模型推演”的切换组(Swap Arm),还同步安排了“基座模型自己继续跑”的同模型对照组。只有当模型切换引发的差异显著超出对照组本身的扰动底线时,分叉才被确认为由模型切换真实导致。

整个实验覆盖全难度、15 分钟快修子集、带步数提示的快修子集三大场景,双向交叉运行(小模型升配为大模型、大模型降配为小模型),累计完成了近 900 次真实环境推演,沉淀出 717 组配对的分支数据。

数据层面的剧烈发散:静态回放仅剩 3% 的有效状态

分支推演得出的第一组定量结果,以无可辩驳的统计证据击碎了静态回放的可行性。

在衡量分叉后动作序列的归一化编辑距离(Normalized Edit Distance)时,所有的模型切换组均断崖式地高于同模型对照组。经过多重假设检验校正(Bonferroni 98.75% 置信区间)后,切换组相对对照组的编辑距离增量全部显著为正,增幅在 $+0.25$ 到 $+0.66$ 之间,这意味着后续轨迹中 61% 至 94% 的动作被彻底重写

更致命的是分叉发生的速度。在 30% 步数的早期分叉中:

这意味着,当静态回放评测器自以为在评估第 $k+1$ 步、第 $k+2$ 步的模型表现时,真实世界里 Agent 面对的环境观察早已经彻底走样。研究提出的“回放有效性”(Replay Validity,即分叉后首个动作偏离前所保留的原轨迹步数占比)指标显示,在早期切换场景下,回放评测器给出的评价有 92% 至 97% 都是在面对一个从未发生过的虚假状态打分,真正有效的评测状态仅剩下区区 3% 至 8%

分叉程度在结构上也展现出高度的一致性:

首先,分叉程度随分叉深度显著递减。无论升配还是降配,70% 步数的晚期分叉所产生的动作编辑距离明显低于 30% 步数的早期分叉。这是因为在任务后期,代码仓库的勘察与定位基本完成,工作区中已经留下了具体的修改痕迹,后续动作的选择空间被大幅收窄。

其次,升配往往带来即刻重构,降配则表现为逐步漂移。能力更强的模型接手后,几乎会立刻推翻小模型此前笨拙的搜索策略,重写下一条指令;而小模型接手大模型时,往往会在前几个动作里顺应前缀上下文的惯性,随后才逐渐暴露出长程规划能力的不足,滑向不同的动作路径。

胜负反转与回放预测的彻底破产:5 投 0 中的离线基准

动作发散固然显著,但会不会只是“条条大路通罗马”,最终生成的补丁(Patch)和任务通过率并无差异?

实验在终局结果上给出了更为刺眼的答案。受限于单卡 24GB 显存与 28k 上下文的严苛物理预算,基座模型在 SWE-bench Verified 上的基准解题率并不高(在 0% 至 3% 之间徘徊)。在如此受限的成功样本下,研究团队捕捉到了 5 次具有决定性意义的胜负状态反转(Outcome Flips),涉及 3 个具体任务:

这 5 次决定胜负的反转全部发生在模型切换组,而在 359 次同模型对照组中,胜负翻盘的发生率为零。这充分说明任务成功与否是模型切换真实带来的因果效应,绝非运行噪声。

那么,传统基于日志拼接的静态回放评测器,能否预测出这 5 次关键反转?

团队构建了一个与现有基准假设完全对齐的“缝合回放评测器”(Replay-Stitch Evaluator):该评测器通过查阅目标模型在对应任务上的独立历史日志,来推断切换后的输赢。对比结果令人窒息:

在代码补丁层面,静态回放预测生成的 Patch 文本与真实推演产生的 Patch,字符级相似度(SequenceMatcher ratio)仅在 0.00 到 0.11 之间。也就是说,静态评测在底层动作、过程状态、终局补丁和最终成败这四个维度上,全部与真实推演完全脱节。

推理栈噪声与大模型的“深思税”:被忽略的工程暗礁

除了对评测机制本身的颠覆,该论文在深入排查底线噪声时,还记录了两个极具现实启发意义的工程现象。

其一是推理量化栈对确定性的破坏。学术界在设计评测时往往假设解码温度设为 0 即代表严格的确定性输出。但分支对照组数据显示,采用 AWQ 4-bit 量化的 Qwen3-14B 确实高度确定,同模型对照组的动作编辑距离仅为 0.16 至 0.23,半数以上的轨迹全流程无分歧;然而采用 FP8 动态量化的 Qwen3-4B,在完全相同的解码参数与请求环境下,同模型对照组在 90% 到 96% 的分叉上均发生了动作漂移,编辑距离高达 0.49 至 0.67。这表明在高并发批处理与特定量化内核下,底层浮点计算的微小累积误差足以撬动 Agent 做出完全不同的离散动作。评测如果连底层 serving 栈的噪声底线都不予校准,得出的微小指标差异便毫无意义。

其二是令人意外的“深思税”(Thoroughness Tax)。在全难度测试中,设定了 50 步的交互预算上限,直觉上能力更强的大模型应该更高效,但数据呈现出相反的走势:大模型耗尽 50 步预算仍未提交补丁的比例显著高于小模型(大模型 24/30 次耗尽,小模型仅 17/30 次耗尽,双比例检验 $z \approx 2.0$)。深入轨迹排查发现,大模型拥有更强的探索与反复校验动机,倾向于在工作区进行更彻底的测试和排查,这导致它在严苛的步数与上下文约束下更容易被“饿死”。这一发现提醒路由策略的设计者:在多步 Agent 场景下,向上路由不能仅看单步智商,还必须为更聪明模型的“步数胃口”定价。

Agent 动态路由的未来:从离线幻觉走向真实校准

CMU 这项研究所揭示的“回放鸿沟”(The Replay Gap),给当前火热的 Agent 路由研究浇下了一盆及时的冷水。它雄辩地证明,单轮时代的离线打分红利在闭环 Agent 面前已不复存在。

现有的强化学习离线策略评估修正方案(如每决策重要性采样 Importance Sampling 或双重稳健估计 Doubly Robust),在长达数十步的 Agent 轨迹中面临着严重的理论困境:LLM 的动作空间是近乎无限的自然语言文本,行为策略与目标策略的动作概率比在首个动作即刻崩塌,样本有效权重迅速衰减为零。因此,开发出能够在低算力消耗下逼近真实分支推演的全新评估估计器,是 Agent 评测基准走向成熟的必经之路。

而在路由策略本身的设计上,论文也用详实的实验数据描摹出未来动态路由的基本轮廓:

这一成果不仅为大模型路由研究界定出清晰的评测红线,也让所有构建多模型协同系统的开发者看清:在 Agent 的世界里,一步微小的分歧,展开的就是一个截然不同的宇宙。