MARS:用蒙特卡洛树搜索自动修复多智能体,成功率最高提升12.1%
Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search
当多个大语言模型组成多智能体系统(MAS)协同解决复杂任务时,系统崩溃或给出荒谬答案几乎是家常便饭。一个 Agent 误读了工具输出,或者两个 Agent 之间产生了理解偏差,错误就会沿着交互链路层层放大,最终导致整个任务彻底失败。
ArXiv URL:https://arxiv.org/abs/2607.29055
在工业界和开源社区的实际落地中,排查这种故障往往极度依赖工程师的人肉介入:调出厚厚的交互日志,一段一段检查 Agent 到底在哪一步说错了话,再手动修改 Prompt 或上下文让系统重新运行。尽管学术界近期涌现了一批针对错误归因(Failure Attribution)的研究,告诉开发者“谁在什么时候犯了错”,但如何让系统在出错后自主、低成本地原地复活,也就是实现自动化修复(Automated MAS Repair),此前几乎处于空白状态。
近期提出的新框架 MARS(Multi-Agent Repair Search)给出了一个系统性的解法:它不再把错误修复当成单次线性的重试,而是首次将多智能体系统的执行轨迹修复形式化为一个蒙特卡洛树搜索(MCTS)过程。通过部分展开(Partial Rollout)、诊断引导的节点扩展与分类学增强的中间态评估,MARS 在全新构建的大规模可回放基准数据集 StateMAS 上,实现了相对最强基准 3.0% 到 12.1% 的绝对通过率提升,同时将 Token 消耗控制在极具经济性的水平。

线性重试的死穴:为什么现有多智能体无法自我修复?
要理解 MARS 为什么引入树搜索,首先需要看清当前多智能体自我修复机制的瓶颈。
在 MARS 之前,业内唯一真正探索多智能体自动修复的工作是 DoVer。DoVer 的思路偏向线性探索:它根据重规划(re-plan)步骤将多智能体轨迹切分成不同片段,找出可疑步骤后修改中控调度器(Orchestrator)发送给子 Agent 的消息,然后从修改点开始将整个系统一路重新执行到底。
这种经典做法存在两个难以逾越的工程缺陷。其一是探索空间的狭窄与高昂成本的矛盾。由于采用单线性的贪心修复策略,如果第一次给出的修复建议方向偏了,系统很难低成本地回溯并探索另一条路线;而且每次尝试修复都直接重新执行到系统终止(Full Rollout),这会在错误的路径上白白耗费成千上万的 Token。其二是架构适用性的局限。DoVer 的修改逻辑高度绑定在中心调度器上,一旦面对去中心化协作、对等讨论或流水线式的 Agent 拓扑,这种在中控层拦截改写消息的策略就会彻底失效。
至于学术界常见的通用反思机制(如 Reflexion 或 ReAct),在多智能体长程交互中同样水土不服。Reflexion 习惯于在上下文末尾不断追加反思记录,导致上下文窗口迅速膨胀,既容易引发注意力涣散,又导致推理成本几何级上升;而纯 ReAct 循环缺乏对全局状态树的宏观权衡,很容易陷入局部最优甚至死循环。
多智能体系统真正需要的,是一种既能精准回滚到任意历史故障点、又能系统化对比多种修复分支,且不必每次都把整条长链路重跑一遍的决策框架。
将智能体纠错重构为状态树搜索
MARS 的核心突破,在于将多智能体的执行与修复完整映射到了一个四元组状态机空间 $\mathcal{M}=\langle\mathcal{N},\mathcal{S},\mathcal{A},\mathcal{T}\rangle$ 中。其中 $\mathcal{N}$ 是 Agent 集合,$\mathcal{A}$ 是包含自然语言交互和工具调用的联合动作空间,$\mathcal{T}$ 是状态转移函数,而关键就在于全局状态空间 $\mathcal{S}$。
在 MARS 中,搜索树上的每一个节点都代表系统在某一时刻的全局状态快照 $s_t$。这个快照不仅记录了人类可见的对话历史,更固化了恢复系统执行所需的完整运行时信息,包括各 Agent 的激活状态、编排控制变量、独立记忆以及工具调用的原始返回值。有了这套精确的状态快照机制,树搜索才拥有了任意穿梭、分支派生的实体依托。
在算法流程上,MARS 继承了经典 MCTS 的选择(Selection)、扩展(Expansion)、评估(Evaluation)与反向传播(Backpropagation)骨架,使用经典的树上限置信区间(UCT)启发式算法选择节点:
\[\operatorname{UCT}(c)=\frac{Q(c)}{N(c)}+C\sqrt{\frac{\ln N(p)}{N(c)}}\]但面对昂贵且黑盒的大语言模型多智能体调用,标准的 MCTS 无法直接套用。如果按照传统做法,每探索一个节点都通过仿真一路运行到游戏终局,多智能体调用的 Token 消耗和延迟将彻底失控。为此,MARS 在动作空间与展开机制上做出了两个针对性的结构创新。
首先是引入部分展开(Partial Rollout)机制。在 MARS 的搜索空间中,系统从当前选定节点出发,不再盲目执行到任务终局,而是严格限制其仅向前推演 $L$ 个交互步数(论文实验中通常设为 4 到 6 步)。这种设计为轨迹探索套上了成本安全绳,允许算法以可控的代价试探性地向前迈进,如果发现方向正确再继续追加步数,从而逐步构建出完整的正确轨迹。
其次是解耦归因与干预的复合动作空间。当算法决定对一个节点进行展开时,它不再只有粗暴的“重跑”,而是派生出三种明确语义的操作:
-
回滚(Rollback):剥离导致错误的后续尾巴,将系统精准重置到发生致命判断之前的特定历史状态;
-
引导式修复(Guided Repair):由大模型根据先前的失败诊断,生成具体的修正指令 $\phi$(例如纠正某个参数理解或提示遗漏的信息),并注入到回滚后的上下文内,随后触发至多 $L$ 步的部分推演;
-
延续推演(Continuation):如果评估认为当前分支方向健康且潜力巨大,系统不添加任何人为干预,直接在当前状态上自发向前继续推演 $L$ 步,赋予优秀路径平滑推进的空间。
缺失终局答案时,如何给半截轨迹打分?
部分展开虽然卡死了 Token 消耗的上限,却立刻引出了另一个致命难题:如果轨迹只执行了中间的几步,任务根本没有完成,甚至连最终输出的影子都没有,裁判模型该依据什么来判断这个节点是有前途的,还是正在滑向深渊?
传统的终局奖励函数在此完全失效。如果仅仅因为轨迹未完成就打低分,算法就会陷入短视,错杀那些正在进行复杂工具探索的高价值节点。为了破解这一困局,MARS 提出了一套分类学增强的评估与诊断机制(Taxonomy-Augmented Evaluation),通过引入系统性的错误模式库和细粒度梯度评分,使 LLM 裁判能够在没有终局结果的前提下做出高置信度的价值判断。
这套评估体系主要由三道严密的防线构成:
第一道防线是显式错误模式(MAST 分类学)的筛查。MARS 在裁判 Prompt 中硬编码了业界权威的多智能体故障分类标准,划分为三类核心缺陷:
-
Agent 执行问题:例如违背任务约束(Disobey Task Spec)、越权执行职责(Disobey Role Spec)、无意义的步骤循环(Step Repetition)、丢失上下文以及在达成目标后依然无法终止(Unaware of Termination)。
-
智能体间协同失准:包括无故重启对话(Conversation Reset)、遭遇模糊数据时不请求澄清、偏离主线任务(Task Derailment)、扣留关键信息以及推理逻辑与实际动作互相矛盾。
-
校验环节漏洞:例如任务尚未完成就提前交卷(Premature Termination)、浅层检查以及给出虚假的校验通过信号。
裁判模型会逐一对照这组清单扫描当前的交互片段,一旦抓到典型的错误模式,便会立即亮起红灯并生成结构化的诊断描述 $f$。
第二道防线是硬性的证据闭环与独立反向推导机制。大模型智能体最普遍的顽疾在于幻觉和过度自信——明明工具查询返回了空结果或报错,Agent 却顺着直觉编造出一个看似完美的数字交差。MARS 制定了极为严苛的证据要求:只有当工具调用(如网页搜索、文件读取、代码解释器)返回了真实的实体数据,且最终结论直接脱胎于该返回值时,才允许被判定为有效进展。更进一步,裁判模型必须根据工具返回的原始文本,尝试自行推导一遍答案。如果裁判自己推导出的结果与 Agent 声称的结论不符,哪怕 Agent 语言组织得再严密,系统也会毫不犹豫地扣下低分。
第三道防线是阶梯式的连续评分标尺(Granular Scoring Rubric)。MARS 摒弃了非 0 即 1 的离散判定,将中间状态映射到 $[0, 1]$ 的区间内:
-
1.0 分(验证完成):必须同时满足三个硬指标:无任何故障模式、答案由工具证据强力支撑、且裁判独立重推结论完全吻合。
-
0.8–0.9 分(强进展):子目标拆解清晰,动作执行高效且未检测出任何已知故障模式,虽然任务尚在半途,但展现出健康的推进势头。
-
0.5–0.7 分(中度进展):产生了部分有价值的信息,但出现了停滞迹象、存在未解决的关键步骤,或者引用的证据存在模糊性。
-
0.2–0.4 分(受限进展):推进迟缓,或者出现了明确但尚可挽回的低级偏差。
-
0.0–0.1 分(失败与发散):发生严重跑题、无限死循环、不可逆逻辑崩溃或彻底由幻觉捏造的最终结果。
通过将这套标准化标尺产出的数值标量 $r$ 沿树结构向上传播,MARS 成功在缺乏终局反馈的茫茫搜索树中,为 UCT 算法点亮了一盏具备区分度的路标灯。
StateMAS 基准:1,310 条真实失败轨迹的横向对决
过往多智能体评测的一大硬伤在于不可复现与无法交互。诸如 Who&When 等归因基准仅仅提供了静态的文本对话 Log,开发者可以拿它来测试模型能不能猜对“哪一步错了”,却无法以此为跳板重新拉起执行环境进行动态干预。而在真实运行中,由于大模型采样的随机性,哪怕输入相同的 Prompt,重新从头运行也极难复现出原本那条独特的失败路径。
为了让自动修复技术拥有严肃的对照靶场,研究团队基于微软开源的 Microsoft Agentic Framework(MAF)打造了目前规模最大的可回放多智能体修复基准 StateMAS。该基准完整覆盖了 GAIA 和 AssistantBench 两个权威通用智能体评估集,沉淀了 1,584 条执行轨迹。在剔除无需修复即可直接答对的 274 条成功样本后,最终锁定了 1,310 条具有完整系统级状态快照的真实失败轨迹。
StateMAS 的独特价值在于其全维度的矩阵设计:它不仅横跨四大主流开源与闭源 LLM 基座,更原生涵盖了四种截然不同的多智能体协作拓扑结构:中心化调度(Centralized)、去中心化对等协同(Decentralized)、顺序流水线(Sequential)以及并发竞争(Concurrent)。这使得算法评测能够彻底摆脱对单一架构的依赖。
在严苛的对照实验中,研究团队将 MARS 与当前的 SOTA 修复框架 DoVer,以及基于经典 Reflexion 和 ReAct 改编的交互式修复基准进行了全面对比。
实验数据显示,在 GAIA 验证集上,面对四款不同的大语言模型基座,MARS 相对最强 baseline 取得了 8.5% 到 10.3% 的绝对通过率提升;在任务复杂度更高的 AssistantBench 上,MARS 同样斩获了 6.1% 到 12.2% 的绝对增益。以 Nemotron-3-Nano-30B-A3B 模型在 GAIA 上的表现为例,原有的顶尖方法 DoVer 修复后的通过率为 22.4%,而 MARS 直接将其推高至 32.1%;而在 AssistantBench 搭配 Qwen3.5-9B 的场景下,MARS 将修复成功率从基线的 27.3% 刷新至 36.4%。
更值得注意的是泛化能力。此前 DoVer 的机制完全无法脱离中心调度器运行,一旦面对去中心化对等网络或并发架构便束手无策。而 MARS 凭借通用的状态快照与动作抽象,在所有四种多智能体拓扑结构上均表现出高度稳定的修复优势,相较于适用该架构的最优基准,绝对通过率提升幅度稳定落在 3.0% 至 12.1% 的区间内。
更令人惊叹的是其 Token 账单的控制力。很多人直觉上认为引入 MCTS 必然意味着巨大的算力爆炸,但实测数据彻底打破了这一刻板印象。
与惯于不断累加反思上下文的 Reflexion 相比,MARS 凭借果断切除错误分支的 Rollback 动作,平均修复 Token 消耗反而大幅降低了 1.6% 到 54.7%。虽然与结构更简单的 ReAct 相比,MARS 的 Token 开销有 14.0% 至 38.7% 的相对上升,但其带来的修复性能相对增幅却高达 56.2% 到 92.5%;相比于全路径重跑的昂贵基线,MARS 甚至能节省高达 59.1% 的 Token。在工程落地极其敏感的性价比维度上,MARS 展现出了极其优异的斜率。
拆解增益来源:局部展开与分类学的不可替代性
为了验证各个精巧构件究竟在系统中发挥了多大作用,研究人员在 GAIA-Free 任务集上展开了严格的消融实验。
当把树搜索退化为单路径线性探索(即设置分支因子 $K=1$ 时),系统的修复通过率直接从满血版的 30.3% 暴跌至 22.7%。这证明了多智能体的错误修复并非单向度线性问题,单一维度的纠错假设一旦受挫,缺乏跨分支横向对比的能力会让系统陷入死胡同。
更具启发性的是关于展开步数的对照组。如果强行把部分展开(Partial Rollout)替换为传统 MCTS 的完整展开(Full Rollout),系统的修复通过率同样从 30.3% 摔落到了 22.7%,但消耗的平均 Token 量却从 861,915 狂飙到了惊人的 3,140,488——翻了近四倍。数据深刻地揭示了多智能体推演中的“滚雪球效应”:当一个前置节点已经隐伏了逻辑暗病时,硬着头皮一路推演到死,不仅对修复毫无助益,反而白白烧掉海量算力,并让错误信息在上下文中深度污染。
最后,当研发团队将评估 Prompt 中的 MAST 错误分类模式剔除、仅保留纯粹的分数标尺时,系统的通过率同样由 30.3% 显著下滑到 25.8%。没有了具象化的故障解剖清单,LLM 裁判对长链路交互中那些隐蔽的“伪进展”和协同失调变得极其迟钝,最终导致传导给下游修复决策的引导指令变得空洞而低效。
从被动可观测走向自主可修复
MARS 的出现标志着多智能体系统可靠性工程的一道关键分水岭。在此之前,整个社区的技术栈高度偏重于“监控面板”式的事后归因——开发者在后台看着精美的链路图,感叹 Agent 又在某个死循环里迷失了自我,却依然只能靠人工编写补丁。
通过将 MCTS 严密的状态搜索数学框架引入多智能体自愈流程,MARS 证明了即便面对复杂、随机且非确定性的多 Agent 交互网络,系统同样能够以极具性价比的 Token 代价,像 AlphaGo 下围棋一样在错误分支中精准落子、剪枝、回退并最终找到通往正确终局的绿洲。随着未来智能体底层运行时快照机制的标准化,这种诊断驱动、搜索寻优的自愈框架,极有可能成为复杂 Agentic Workflow 迈向工业级高可用不可或缺的底层基础设施。