复旦FlowScout:执行反馈驱动图搜索,工具调用正确率提升92.69%
FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows

在大模型技术落地复杂任务的过程中,自主智能体(LLM Agent)的设计范式正在经历一场关键转变。过去,开发者寄希望于单个模型在单次会话内搞定“理解意图—拆解任务—自主调工具—整合结果”的全流程;但在实际生产环境中,大模型内在的随机性与黑盒特性,使得这种端到端的调用链条极不稳定。面对同样的输入,大模型在两次运行中可能会选择截然不同的工具调用顺序,甚至产生幻觉、调用不存在的参数。为了驯服这种随机性,将大模型、外部工具与控制逻辑编排成确定性结构的“Agent 工作流(Agentic Workflows)”迅速成为行业共识。
ArXiv URL:https://arxiv.org/abs/2608.10039v1
现实中的痛点在于,搭建一套工业级可用的工作流极其依赖专业工程师的人工调试与领域知识。尽管学术界近期探索了自动化工作流生成方案,但现存方法(如 AFlow)普遍存在一个隐蔽的硬伤:它们构建的是“以大模型为中心(LLM-centric)”的拓扑结构,真实工具的执行过程在生成阶段被抽象甚至完全由大模型伪造模拟。一旦放到需要严谨调用真实 API 的生产系统中,这些缺乏真实工具交互反馈的工作流就会迅速崩溃。
针对这一核心瓶颈,来自复旦大学的研究团队提出了名为 FlowScout 的自动化生成框架。FlowScout 不再让大模型空想工作流,而是把工作流形式化为兼具语义推理与真实工具调用的有向无环图,并利用真实执行反馈指导蒙特卡洛树搜索(MCTS)进行拓扑变异。实验证明,FlowScout 在金融、体育、旅行和天气四大复杂领域中,将工具调用正确率提升了至少 92.69%,综合执行得分提升了 17.66% 以上,同时显著抑制了多次执行间的方差波动。

将工作流重构为混合计算图:真实工具不能被模拟
要自动生成可靠的工作流,首先必须建立一套能够如实反映生产环境的图结构定义。以往的自动化工作流探索常常把“生成工作流”退化为“生成一串让不同大模型分工的 Prompt”,把工具调用矮化为大模型节点的附带输出。这种假定直接脱离了工具执行会遇到网络超时、参数格式报错、缺失依赖字段等工程现实。
FlowScout 在形式化建模上做出了明确划分,将工具集成型 Agent 工作流定义为一个有向图 $\mathcal{G}=(\mathcal{V},\mathcal{E})$。这里的节点集合 $\mathcal{V}$ 严格区分了两种性质完全不同的计算单元:
-
LLM 节点 $v_l = \langle\delta_{v_l},\rho_{v_l}\rangle$:负责语义层面的模糊推理、上下文理解、意图抽取以及最终的文本汇总,由底层大模型及其对应提示词驱动;
-
工具调用节点(Tool-Calling Node) $v_t = \langle t,\vartheta_t\rangle$:负责触发真实的外部 API 交互,具有明确的输入参数模式与确定的执行边界,绝不由大模型在工作流内部凭空模拟。
连接节点之间的有向边 $\mathcal{E}$ 则携带了明确的依赖语义 $\mu$,细分为“数据依赖”与“控制依赖”。一个完整工作流的执行,始于负责解析用户 Query 的 LLM 节点,沿着图的拓扑顺序经过各工具节点与中间推理节点,最终汇聚至总结性的 LLM 节点输出响应。
定义了图的语法后,整个自动化工作流生成任务就可以严密地转化为一个在合法图空间 $\Omega(\mathcal{T})$ 内的受约束搜索问题。优化的目标函数由两部分紧密结合:一是衡量工具调用序列与标准轨迹最长公共子序列相似度的“工具调用正确性(Tool Invocation Correctness, TC)”,二是评估最终结果在答案完整性与逻辑相关性上的“执行得分(Execution Score, ES)”。通过双重指标约束,研究团队锁定了最终目标:寻找一个既能精准命中所需工具链、又能高质量交付用户任务的最优图拓扑 $\mathcal{G}^*$。
告别随机盲搜:从历史轨迹中挖掘骨架做“暖启动”
在一个庞大且高度离散的图结构空间中直接搜索有效工作流,难度堪比大海捞针。如果直接从空白图或者纯随机变异开始,搜索算法在绝大多数情况下只会撞上无法编译的死循环,或是拼凑出完全违背业务逻辑的无用连接。
为了突破图搜索的冷启动障碍,FlowScout 引入了首个核心模块——工作流挖掘器(Workflow Miner)。该模块的直觉非常清晰:在真实的业务场景中,虽然每个用户的具体需求千差万别,但解决某一类特定业务问题的底层工具协同模式往往高度收敛。例如,查询旅行预算总是先调取天气与交通 API,随后才会调用住宿与景点计价接口。历史成功任务所留下的工具执行日志,早已沉淀了领域内的共性结构。

FlowScout 首先提取历史任务中所有经过验证的工具编排日志,通过频繁序列模式挖掘提炼出跨样本共享的工具协同骨架(Tool Coordination Skeleton)。但这套骨架仅包含真实的工具节点与调用时序,无法独立运转。因此,挖掘器会进一步在工具节点之间注入必要的 LLM 语义节点:在入口处安置查询解析器,在需要工具参数组装的缝隙处插入参数推理节点,并在末端布设结果整合节点。
这一步挖掘操作并非终点,而是为后续的搜索过程提供了一个语义自洽、结构闭环的初始候选图 $\mathcal{G}^{0}$。消融实验证实,仅仅是这个结构化的“暖启动”阶段,就让搜索基线跃升到了可用区间,避免了成千上万次无谓的废图生成。
真实沙箱执行:以执行反馈为罗盘的 MCTS 拓扑演化
有了初始工作流骨架后,接下来的挑战是如何根据任务差异对图结构进行剪裁、增补与拓扑调整。这是 FlowScout 最具技术辨识度的设计所在:它没有采用传统的“让 LLM 一步到位重新写一个完整工作流”的做法,而是将真实环境下的执行反馈作为奖励信号,嵌入到蒙特卡洛树搜索(MCTS)中。
整个优化系统由“工作流执行器”与“工作流优化器”构成闭环联动。执行器将抽象的图结构即时编译为真实的 Python 可执行程序,并放入可观测的运行时沙箱中跑批。在优化集与验证集上跑出的每一条真实报错、每一次工具返回码异常、每一处参数不匹配,以及量化计算出的 $TC$ 和 $ES$ 指标,都会被封装为精细的“执行反馈(Execution Feedback)”。
优化器中的 MCTS 则以此反馈展开四阶段经典迭代:
-
选择(Selection):根据改进的 UCB 算法,平衡那些“历史验证表现高”的高价值图节点,以及“探索次数较少”的边缘变异,避免搜索过早收敛到局部最优。
-
扩展(Expansion):针对选中的父级工作流,不仅依靠大模型进行提示词微调,更对图结构实施原子级的变异操作,包括增删 LLM 语义节点、重构工具节点的数据流输入、修剪冗余依赖边等。扩展过程会显式读取执行器缓存的报错日志,针对性修复历史断点。
-
模拟(Simulation):新生成的候选工作流立刻被抛入执行器,在优化集切片上经历真实数据流的洗礼,直接测量工具调用一致性与最终生成质量,得到标量奖励 $R$。
-
回溯更新(Backpropagation):将真实执行获取的奖励沿着访问路径逆流而上,更新沿途各级图节点的平均得分 $Q$ 与访问计数 $C$。
为了防止离线搜索过程中的过拟合与算力浪费,搜索流程引入了双重终止机制:不仅设定了最大迭代步数,更设置了耐心阈值(Patience)。一旦连续 5 轮迭代未能在验证集上刷新历史最高分,系统立即触发早停,最终返回验证集上表现最为稳健的工作流拓扑。

从验证分数的演进曲线中可以清晰看到,MCTS 能够在短短十数次迭代内迅速引导图结构收敛至极高水平。相较于传统束搜索(Beam Search)极易在离散图变异中陷入停滞,MCTS 展现出了兼顾全局探索与局部深挖的卓越效率。
实验结论:不仅仅是准确率的跃迁
为了全方位检验自动生成工作流的成色,研究人员在 ToolBench 权威基准中选取了金融、体育、旅行和天气四大极具代表性的任务领域,并设计了严苛的对比实验。基线包含了传统的过程挖掘方法 PM4Py、工业界主流的动态单步决策框架 ReAct,以及当前最具代表性的全自动工作流生成方案 AFlow。


实验数据展现出压倒性的优势。在工具调用正确性(TC)指标上,FlowScout 相较于各大基准实现了至少 92.69% 的提升;而在最终任务的综合执行得分(ES)上,实现了 17.66% 以上的稳定增长。统计学检验进一步排除了随机波动的可能:跨领域配对检验显示,经 Holm 校正后的 p 值均小于 0.05,95% 置信区间均显著偏离零点,Cohen’s d 效应量超过 0.63,证明该算法带来了确定性的性能跃迁。
这种跨越式提升背后的原因发人深省:
ReAct 这类动态步进式 Agent,在每一步都需要大模型在极长上下文中重新推演全局逻辑,随着交互轮数增加,误差极易层叠放大;
PM4Py 虽能挖掘过程,却完全缺乏处理非结构化语义数据的 LLM 适配能力;
而 AFlow 由于缺乏真实工具节点的解耦表示,往往在复杂交互中迷失于模型内生的伪造数据中。
FlowScout 则兼具了静态编排的强约束与动态推理的灵活性,使得工具调用的顺序与依赖关系被严格焊死在可靠的图骨架上,语义理解则留给小巧精准的 LLM 节点。
在工业界同样极为关注的“执行稳定性”维度,研究团队对每个领域随机抽取的 50 个高难度长尾查询进行了连续 10 次重复跑批。结果显示,FlowScout 的变异系数(CV)显著低于 ReAct 等动态方案。这意味着,它产出的不是在特定测试集上“碰巧跑通”的脆弱结构,而是一套具备极高工程确定性的标准作业程序。
针对框架内部组件的消融分析则揭示了性能增量的具体来源。如果只进行工作流骨架挖掘而不做 MCTS 优化,虽然也能获得可用的初始图,但其 TC 和 ES 相比最终模型分别落后了 43.17% 和 246.98%。这表明,初始挖掘只能捕捉粗粒度的行业主干,而针对具体边缘异常、参数传递失真、条件分支分流的精细调节,必须由 MCTS 基于执行反馈一锤一凿地修正打磨。更值得关注的是效率对比:MCTS 达到高质收敛所需的搜索耗时,仅仅是传统束搜索的一半左右。
走出象牙塔:不可见工具与异构模型的“零样本”泛化
评估自动化 Agent 框架时,行业往往存在一个隐忧:工作流是不是对当前使用的这套 API 或底层大模型产生了严重的“拓扑过拟合”?一旦真实的业务接口升级,或者为了控制 Token 成本需要将底座从昂贵的商业模型切换到开源模型,精心搜索出的工作流是否会彻底作废?
FlowScout 在设计之初就前置了泛化性验证机制。在数据集构建阶段,研究团队针对每一个“可见工具”,都刻意匹配并预留了一个功能高度相似、但接口签名完全不同的“未见工具(Unseen-Tools)”。在最终测试时,工作流拓扑结构完全冻结,直接将可见工具热替换为未见工具,并测试异构大模型底座的迁移表现。
测试数据显示,部署于未见工具与不同 LLM 底座的环境中时,FlowScout 生成的工作流平均保留了原始状态下 91.37% 的工具调用正确性与执行得分。之所以具备如此强劲的结构迁移能力,核心在于其生成的图结构本质上抽象出了业务领域的“控制流逻辑原型”。当具体的 API 发生更替时,只要节点间的语义承接关系与依赖骨架不变,负责参数转化的 LLM 节点就能够凭借自身的泛化理解能力,无缝抹平不同 API 之间细微的参数命名差异。这为自动化工作流在实际企业微服务演进中的长期服役提供了坚实的依据。
总结与展望
FlowScout 的意义不仅在于刷新了几个基准数据集的百分比指标,更在于它为 Agent 从实验品走向高可用软件工程提供了一条兼顾自动化与鲁棒性的新路径。它证明了一个重要判断:大模型 Agent 的自动化设计,绝不能脱离底层系统的执行反馈;将物理世界中的工具调用强行由大模型在内存中模拟,看似简化了图的表示,实则埋下了致命的不可控隐患。
从人工耗时费力地在低代码平台上拖拽节点,到利用执行反馈在几十分钟内自动探查、挖掘并演化出工业级的工作流拓扑,FlowScout 展现了自进化自动化系统的巨大潜力。尽管离线搜索阶段产生的 Token 开销与沙箱调用成本依然是实际部署前需要权衡的工程代价,但在追求极高可靠性与确定性的垂直企业场景中,这种“离线重度搜索、在线极速稳定交付”的范式,无疑为下一代企业级 Agentic 系统的落地指明了极具说服力的演进方向。