GRAFT:离线骨架结合推理期局部“嫁接”,智能体工作流反超MaAS 3.85分
Global Optimization and Inference-Time Region Grafting for Agentic Workflows
随着大语言模型从单次提示词工程向复合系统演进,智能体工作流(Agentic Workflow)已经成为解决复杂推理、长链条规划和代码生成等任务的核心基础设施。在这些系统中,推理、检索、规划、反思与代码验证等原子算子被编织成复杂的有向无环图(DAG)。然而,当前的自动化工作流生成方案面临着一个根本性矛盾:像 AFlow、ADAS 这样的离线搜索方法,倾向于在数据集上拟合出一个全局通用的固定工作流;但在推理阶段,输入样本的复杂度千差万别,简单的问题套用繁复的工作流会带来严重的延迟与 Token 浪费,而棘手的边界样例又常因固定结构的表达能力不足而频频报错。
ArXiv URL:https://arxiv.org/abs/2608.02353
如果为了适应样本差异,让大模型在推理阶段针对每个输入从头执行全局工作流搜索,庞大的算力开销和延迟会直接使系统失去实用价值;更致命的是,推理时根本没有标注数据(Ground Truth)来评估生成结构的优劣。近期提出的 MaAS 虽然尝试通过超网(Supernet)采样单样本结构,但其超网依然在离线阶段被冻结,无法结合运行时的反馈调整结构。
针对这一困境,最新研究提出了 GRAFT(Global Optimization and Inference-Time Region Grafting)。该框架打破了“离线固定结构”与“在线全盘重搜”的两极对立,提出了一种非参数训练的自适应范式:系统在离线阶段搜索并保留一个全局任务级工作流作为强先验骨架,在线推理阶段仅对遇到困难或产生局部缺陷的区域进行即时“嫁接”与替换。实验表明,在完全相同的优化器与执行器配置下,GRAFT 在数学推理、代码生成、多跳问答等五大基准上取得了 87.44 的平均分,相比先前的强基线 MaAS 显著提升了 3.85 分。更关键的是,这一工作流无需重新优化,直接替换更强大的底层执行模型即可获得持续的性能收益,证明了模块化自适应工作流作为一种动态执行策略的巨大潜力。
结构解耦与拓扑不变性:SESE 区域的引入
想要在推理期对工作流进行低开销调整,首要解决的是搜索空间的爆炸问题。传统工作流搜索涉及算子类型、参数组合以及依赖拓扑的笛卡尔积,如果在线任意增删节点,整张计算图的连通性与执行顺序极易遭到破坏。

GRAFT 的破局点在于借用了程序分析中的经典概念——单入单出区域(Single-Entry Single-Exit, SESE)。在 GRAFT 的设计中,离线搜索出的全局最优工作流 $W_{c^*}$ 被组织为一系列严格按拓扑排序的 SESE 区域序列 $R = (g_1, g_2, \dots, g_n)$。每个区域在逻辑上扮演固定的职能角色,例如规划(Plan)、证据检索(Evidence)、推理(Reason)、验证(Verify)、反思精炼(Refine)以及格式化输出(Format)。
SESE 结构的精妙之处在于其清晰的边界接口:每个区域内部无论如何变化,其输入边界与输出边界所定义的全局状态字段保持严格一致。在离线阶段,如果某个任务并不需要某些特定角色(如无外部检索依赖的数学题和代码题),系统会为其分配恒等算子(Identity Operator),使该区域处于静默钝化状态。到了在线推理阶段,GRAFT 不去触碰全局的拓扑依赖,而是把搜索空间急剧压缩在特定角色的局部候选库中。这种局部嫁接(Grafting)在结构上是局部的,但在语义上又能通过下游的状态传递对最终输出施加深远影响。
为了进一步控制推理期的搜索开销,GRAFT 采用了分层分级扩展的候选空间策略 $\mathcal{E}_0(g) \subseteq \mathcal{E}_1(g) \subseteq \dots \subseteq \mathcal{E}_J(g)$。在初始状态下,系统优先评估与当前算子相邻、计算成本较低的轻量级替换方案;只有当低成本方案无法达到局部质量阈值时,才会触发包含更高采样数量(如自一致性采样数)或更高探索温度的扩充候选池,避免了算力被盲目挥霍。
无标签局部质量代理与耦合守卫机制
在推理阶段对局部算子进行修改,核心技术瓶颈在于缺乏客观的监督信号。离线评估可以对比标准答案计算 Exact Match 或 F1 分数,但推理期的系统只能面对未知的黑盒输入。如果单纯依赖大模型对自身输出进行无约束的主观自评,往往会导致严重的自圆其说(Hallucination Loop)与置信度偏差。
GRAFT 设计了一套复合型的无标签质量代理(Label-Free Quality Proxy),通过任务特性与角色先验组合多维度的客观代理信号:
-
多链自一致性(Self-Consistency):在推理类角色中,统计多条独立推理路径的结论重合度,将多数投票的一致性比例转化为确定性分数。
- 基于证据的支撑度(Groundedness):在知识密集型与问答任务中,计算局部生成的推理痕迹被前序检索证据直接支撑的比例 $q_{\mathrm{gr}} = \frac{1}{\lvert \mathcal{A} \rvert}\sum_{a\in\mathcal{A}}\mathrm{support}(a,E)$。
- 验证器与测试通过率:在代码任务中,调用生成的轻量断言或单元测试,以执行期抛出的语法及逻辑异常作为惩罚项。
局部算子的质量提升并不等同于全局性能的上升。多智能体系统中最容易出现的系统性失效,正是下游智能体对上游传递的微妙偏移产生放大反应,即跨区域信息错位与误差级联。一个推理算子即使在当前局部获得了很高的自洽性,如果它抛弃了上游给出的前置事实,也会导致最终结果彻底偏航。
为此,GRAFT 提出了严苛的耦合守卫(Coupling Guard)准则。一个候选局部配置 $\phi$ 想要完成最终嫁接,必须同时跨过两道硬门槛:
\[\mathrm{accept}(\phi) \iff Q(\phi) > Q(\phi^{\mathrm{inc}}) \;\wedge\; \mathrm{Coh}(W[g{\leftarrow}\phi], S) \ge \mathrm{Coh}(W, S) - \epsilon\]其中,$Q(\phi)$ 为局部无标签质量得分,要求候选方案必须严格优于现任方案 $\phi^{\mathrm{inc}}$,拒绝平局置换;而 $\mathrm{Coh}$ 则代表边界支撑一致性得分,专门用于监控下游结论对上游证据流的忠实度。一旦替换算子引发的边界漂移超过阈值 $\epsilon$(实验中设为 $0.02$),该嫁接提议将被即刻驳回,原工作流维持原状。这种保守策略极大地遏制了局部贪心搜索带来的负迁移效应。
调度提议器与配置记忆体:让自适应更具成本效益
逐个排查所有 SESE 区域在工程上依然过于沉重。GRAFT 引入了基于上置信界(Upper Confidence Bound, UCB)的提议器(Proposer),以自适应算法决定应当优先激活哪个区域的在线调整:
\[\mathrm{score}(g) = \hat{v}(g) + U(g) + \rho\,\mathrm{Freq}(g)\,\mathrm{Mod}(g)\]优先级的判定综合了三个核心维度:基础估值 $\hat{v}(g)$ 由该区域当前的质量亏损 $1 - Q_g$、历史报错频率 $\mathrm{Fail}(g)$ 以及角色本身的可调空间加权生成;$U(g)$ 赋予低频优化的区域以探索红利;第三项则充当主动先验,重点倾向于那些在历史运行中被频繁证明“一改就灵”的高弹性区域。
此外,由于上游算子变更会引发全局状态字段的更新,下游区域可能需要进行状态重算。GRAFT 没有采用粗暴的无限回溯,而是引入了可配置的最大传递轮次 $P \in {1, 2, 3}$。通过离线验证集确定任务级 $P$ 值,系统在单轮直通与多跳重算之间取得了极好的平衡。
为了彻底摊薄在线搜索的 Token 成本,GRAFT 还配备了配置记忆体(Retrieve-or-Optimize Memory)。该机制基于输入的特征签名,对成功修补并产生正确局部配置的工作流模式进行持久化缓存。当后续遇到类型相似的样本时,系统直接从记忆体检索对应的嫁接方案并实施部署,完全跳过了在线试错的候选评估过程。
实验评测与核心消融分析
GRAFT 在数学推理(GSM8K、MATH、MultiArith)、代码生成(HumanEval、MBPP)、多跳问答(HotpotQA、DROP)以及高难度知识问答(MMLU-Pro、GPQA)等不同复杂度的基准上进行了系统测试。基准对照实验分别在 MaAS 评测协议(统一采用 GPT-4o-mini 作为执行模型)与 BayesFlow 评测协议(采用 Claude 3.5 Sonnet)下展开。
在 MaAS 的评测套件中,GRAFT 斩获了 87.44 的平均分,大幅拉开与先前全自动工作流搜索框架的差距:超越了同生态下的 MaAS(83.59)整整 3.85 分,同时显著优于经典的固定图搜索框架 AFlow(81.56)与 ADAS(78.38)。在 BayesFlow 评测体系下,GRAFT 同样在所有对应基准上刷新了 SOTA,平均得分达到 84.1。
为了明确收益的真正来源,消融实验解构了 GRAFT 的各个组成部件:
-
移除局部嫁接(即退化为完全执行离线固定的 $W_{c^*}$):系统平均表现暴跌 4.10 分。这直接证实了仅靠离线全局搜索无法消除样本异质性带来的天花板,大部分边际增益正是由在线针对性嫁接带来的。
-
随机替换质量代理:若将无标签代理分数替换为随机打分,平均性能下挫 3.48 分,几乎与完全不做嫁接相当。这表明该方案依靠的绝非盲目增加采样的算力红利,而是高质量无监督信号带来的精准引导。
-
剥离耦合守卫:移除守卫会导致平均表现下滑 0.70 分,证明跨区域的干涉抑制在稳定复杂长链条工作流中起着决定性的压舱石作用。
运行时特征、记忆摊薄与跨模型迁移
深入分析 GRAFT 的内部运行状态,可以进一步揭示该框架的运作规律及其边界条件。
论文追踪了无标签代理信号 $Q$ 与真实答案正确性之间的 Spearman 秩相关系数 $\rho$。数据表明,在代码任务与数学任务中,由于存在严格的语法检验、测试用例和闭环逻辑,代理与真实标签的相关系数处在 0.23 至 0.62 的相对高位,系统能够极为敏锐地捕捉到优质局部配置;但在开放式多跳问答及知识型任务中,代理得分与最终对错的相关系数骤降至 0.17 以下。这说明基于语义重合度与证据支撑度的代理,在长文本与模糊语义场景下的甄别力仍有局限,未来需要更为深度的自反思机制来补强。
在配置记忆体的效能方面,实验观察了处理过程中搜索成本与命中率的动态演变。随着处理序列从前 10% 推进至收尾阶段,各基准上单样本的局部搜索成本呈现出断崖式下降,平均降幅达到 50% 左右。在 MBPP 与 DROP 上,平均每个样本可直接复用 0.8 到 1.2 个已验证区域,配置重用率迅速趋向平稳。这意味着随着运行时间的增长,GRAFT 的边际开销会越来越低,兼具在线灵活性与离线部署的成本优势。
更加引人深思的是执行器模型的热插拔实验。研究团队将基于 GPT-4o-mini 离线搜索得到的全局工作流骨架固定,在推理阶段仅将底层执行器替换为能力更强的 Claude 3.5 Haiku 以及 Claude 3.5 Sonnet。实验结果显示,整个系统的推理准确率呈现单调递增,尤其是在 GPQA、MMLU-Pro 和 MATH 这类高认知负荷的基准上,换用强模型带来了极为显著的阶梯式跃升。而在 GSM8K 等早已趋近饱和的任务上,系统也能合理收敛。这从侧面给出了一个关键结论:一个优化良好的模块化工作流并非只适用于特定参数权重的大模型,而是一套通用的逻辑执行策略,当底层大模型的算力与认知能力升级时,这套执行策略能够无缝承接其性能红利。
从静态图纸走向自适应执行体
在真实案例中,以一道多跳问答为例:“《工业分布法》是由哪位首相在任期间签署通过的?”离线固定的工作流虽然成功检索出了正确证据(艾德礼于 1945 至 1951 年任职首相),但同时也引入了干扰事实(《工业分布法》颁布于 1950 年)。固定的单链 CoT 误将法案通过的年份“1950”当成了首相任期年份,由于缺乏回溯修正机制,这一细小错误沿下游拓扑一直传播至最终输出,导致答复被判错。
在 GRAFT 的干预下,系统在执行 Reason 区域时探测到其局部无标签质量得分处于低位。提议器迅速将该区域由原本脆弱的单链推理,局部嫁接扩充为“5 采样多数表决 + 自校验 + 修正”组合算子。五条独立推理链经交互验证后识别出了干扰项,将正确任期“1945 至 1951”确立为多数共识,无标签置信度跃升至满分 $1.00$,下游格式化节点随后顺利输出了正确结论。整个过程无需动摇上下游其他算子的既有部署,精准完成了“外科手术式”的局部纠错。
长期以来,社区在构建复杂智能体应用时,往往在“为所有请求执行固定 DAG”与“完全交给单次端到端规划”之间来回摇摆。前者结构坚固但缺乏弹性,后者极具自适应性但极易失控且成本高昂。GRAFT 的探索指明了一条极具工程价值的第三条道路:将宏观逻辑锁定在全局 SESE 骨架中以保证流程兜底,将微观算子以无参数方式在推理期结合反馈即时替换。这种将工作流视作“可嫁接执行策略”的范式,或将成为未来大规模工业级 Agent 系统走向低成本、高鲁棒性部署的重要参考标杆。