EASy:告别无脑堆算力,莫纳什用强化学习让智能体按预算精明办大事

EASy: Towards Efficient LLM-Based Agentic System

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

EASy:告别无脑堆算力,莫纳什用强化学习让智能体按预算精明办大事 论文图示

在过去一年多的智能体(Agent)演化路径中,大家普遍形成了一种默认的工程共识:遇到复杂问题,就调集最强的旗舰大模型,搭上两三个甚至五六个辅助角色,反复执行“思考-行动-自我反思”的循环,直到把答案砸出来为止。这种暴力堆砌算力的做法虽然在特定高难度基准上刷出了漂亮的成功率,但落地到真实生产环境时,高昂的推理账单和难以忍受的端到端延迟很快就会浇灭开发者的热情。现实业务并不需要一个只懂“不惜一切代价”的孤勇者,而需要一个清楚知道每个工具人几斤几两、明白每一步该花多少算力,甚至能在半路拿到错误反馈时立刻调整策略的精明治理者。

ArXiv URL:https://arxiv.org/abs/2608.04588v1

针对这一长期被忽视的痛点,莫纳什大学(Monash University)的研究团队提出了名为 EASy(Efficient Agentic System)的可训练智能体框架。与以往单纯追求任务成功率或依赖轻量级静态路由器的方案不同,EASy 首次把“执行效率”和“动态演进上下文”放进了强化学习的联合优化目标中。该框架通过一个具备成本与能力感知的协调调度器(Orchestrator),搭配“里程碑-计划-行动”(Milestone-Plan-Act)的工作流,使得大模型不仅学会了把大任务拆碎、多步并行执行,更学会了在遇到简单子任务时主动委派平价模型,关键瓶颈处再调用高阶模型,从而在数学推理、具身交互与深度研究等复杂任务中,以更低的总 Token 开销换取了超越顶尖基线的表现。

同质多智能体系统与异构协调系统对比

为什么现有的智能体编排与路由机制行不通?

要理解 EASy 的设计意图,首先需要审视现有智能体系统的两座“巴别塔”。早期以 AutoGen 或 MetaGPT 为代表的同质或固定角色系统,往往预设了静态的交互管线。当面对动态演化的长程推演任务时,静态管线僵硬脆弱,只要中间某一步调用报错或者陷入幻觉,下游节点就会沿着错误上下文一路狂奔,造成巨大的无效 Token 损耗。

为了摆脱固定管线的束缚,学界近期转向了基于调度器(Orchestrator)的动态异构智能体方案,由中央调度器实时分解子任务并派发给下游执行者(Executor)。但这类方案通常把调度器当作纯粹的“性能最大化工具”,对调用成本缺乏全局感知。而另一条平行的研究路线——大模型路由器(LLM Router),虽然专注于成本与性能的权衡,却几乎全被实现为孤立的分类器或回归小模型。静态路由器的局限性在于,它们只能针对单次请求做浅层特征匹配,根本无法理解智能体在多步交互中累积的动态上下文、工具调用的中间报错反馈以及复杂的任务时序依赖。更致命的是,这类路由器很难泛化到训练集之外的新模型或新工具接口上。

EASy 正是瞄准了这两者的盲区:编排调度不能脱离成本约束,而成本控制绝不能退化为单步静态分类。真正的智能编排,必须把任务规划、依赖图构建、异构执行者分派以及过程性反馈,统一放进序列决策框架内去学习。

EASy 框架与学习算法总览

里程碑、依赖图与动态聚合:EASy 的执行骨架

EASy 的系统架构建立在一组明确的抽象之上。面对一个复杂问题 $q$ 和一组异构执行者构成的工具池 $\mathcal{A} = {a_1, \ldots, a_K}$,每个执行者都携带一份结构化画像 $\phi_k = (\mathbf{c}_k, \kappa_k, \mathcal{T}_k)$。这里的 $\mathbf{c}_k$ 概括了其在代码、数学、检索等维度的能力阶梯,$\kappa_k$ 代表其推理预算或成本开销,$\mathcal{T}_k$ 则界定了其可调用的专属工具库。为了避免大模型调度器直接死记硬背现实中的模型商业品牌,研究团队在输入中对模型标识进行了完全匿名化处理(例如标注为 model_a、model_b),强制调度器根据客观的“能力-成本”阶梯画像来制定策略。

有了执行者池之后,调度器是如何组织任务推进的?如果每一次细微操作都由调度器逐个交互,不仅调度器自身的上下文会迅速被琐碎的中间输出撑爆,高频交互的 Token 损耗也会适得其反。为此,EASy 提出了名为“里程碑-计划-行动”(Milestone-Plan-Act)的分层推进逻辑:

这种设计让决策过程变成了一个有弹性的动态控制环:前期探索若遭遇工具报错或非预期输出,调度器可以在下一个里程碑果断修正路径,而不是任由错误蔓延至全局。

树状展开过程示意

树状推演与多维奖励:如何用强化学习训出“性价比大脑”

设计好工作流之后,最核心的问题来了:如何让调度器真正学会“在保证答对的前提下,能省则省”?传统的强化学习直接在全局轨迹上进行平铺采样,但多智能体系统的下游随机性极大。如果一个分支最终失败了,算法很难分辨究竟是因为最初的里程碑定错了、某个节点的执行模型选弱了,还是仅仅碰上了偶发的生成噪声。

为了给调度器的每一次选择提供坚实的信用分配(Credit Assignment),EASy 引入了树状展开探索机制(Tree-Structured Rollout)。在训练采集阶段,系统先针对问题并行生成多条完整初始轨迹;随后在轨迹的关键决策节点(例如某个里程碑的划分或特定执行者的指派处)进行分叉,保持之前的历史前缀完全一致,强制生成不同的执行分支并向下跑完。通过构建这样一棵推演树,研究人员得以在绝对公平的相同前置状态下,横向对比不同编排策略的优劣。

光有横向比较的树状结构还不够,强化学习的奖励函数必须对“正确性”与“廉价性”建立可信度量。EASy 结合 GRPO(Group Relative Policy Optimization)算法,设计了由三部分构成的多组件奖励机制:

首先是正确性奖励(Correctness Reward)。传统做法直接取多个子分支成功率的经验平均值,但这忽略了样本量不同带来的置信度差异。EASy 将节点成功概率建模为服从 $\operatorname{Beta}$ 分布的随机变量,利用无信息先验结合当前节点观测到的成功数与失败数计算后验分布,再与“全无成功”的基线后验进行积分比对。这种处理让算法对小样本探索保持克制,对高置信度的正确路径赋予更有分量的正向激励。

其次是相对效率奖励(Efficiency Reward)。不同数学题或检索任务的绝对 Token 消耗本就天差地别,直接用绝对开销当惩罚项会严重干扰跨题目的梯度平稳性。借助于树状结构,EASy 可以计算具有相同前置节点的一组兄弟分支的平均消耗与标准差,针对单个分支计算相对节能程度:

\[R_{\mathrm{eff}}(\nu) = \frac{\mu\left(\{C(\nu'):\nu'\in\mathcal{S}(\nu)\}\right) - C(\nu)}{\sigma\left(\{C(\nu'):\nu'\in\mathcal{S}(\nu)\}\right) + \epsilon}\]

如果调度器在当前步骤通过合理指派平价执行者、剥离冗余步骤降低了 Token 用量,且最终没有牺牲正确性,它就能在该局部比较中拿到显著的正向效率优势。

最后是完整性奖励(Completeness Reward)。智能体在长程生成中难免出现输出格式崩溃、DAG 成环、调用了不存在的模型或字段缺失等工程硬伤。完整性奖励作为一个密集验证信号,在每一步对可解析性和图的合法性进行硬性检验,帮助策略网络在训练极早期快速淘汰非法格式,收敛到稳定可执行的决策空间。

实验与实测洞察:省算力并不意味着牺牲上限

在评测基准的选择上,研究团队没有局限于单一任务,而是横跨了三类截然不同的大模型决策场景:包含 AIME24、AIME25 和 MATH500 的复杂数学推理;包含 ALFWorld 与 WebShop 的具身交互与网页多步决策;以及包含 GAIA 和极其严苛的 HLE(Humanity’s Last Exam)的深度研究(Deep Research)任务。

调度器底座采用 Qwen2.5-7B-Instruct,执行者池在训练期由配置了不同最大输出 Token 上限的开源模型充当能力梯度样本,在评测期更加入了未曾见过的 GPT-5-mini 以测试跨模型泛化性。所有基线均在同等骨干模型与标准化工具接口下跑通对比。

实验结果揭示了几个具有启发性的工程结论:

第一,多智能体系统的“军备竞赛”确实存在巨大泡沫。在纯粹由单一大模型执行 ReAct 或在 AutoGen 中进行多轮无节制对话时,系统消耗的 Token 数量往往呈现几何级数上升,但在难题上的实际增益迅速见顶。EASy 相比于单智能体和传统多智能体基准,不仅在综合成功率上保持领先,更将端到端 Token 开销大幅压低。它打破了“想要高准确率就必须忍受天价开销”的刻板印象。

第二,动态分级调度的收益远大于静态路由。与当前的路由基线(如 MasRouter)相比,EASy 在多步深度交互中的优势被进一步放大。静态路由器由于缺乏对中间执行状态的深层理解,经常在任务前期给出激进或保守的误判;而 EASy 的调度器能够感知“上一步已经检索到了什么核心信息”,从而在后续验证阶段果断降级使用轻量执行者,这种细粒度的动态把控是静态分类器无论如何也做不到的。

第三,对模型画像的抽象泛化能力经受住了考验。由于在训练期强制采用了匿名化的能力与成本配置描述,EASy 并没有把“某某模型能力强”沉淀为神经元记忆,而是真正学会了阅读提示词里的能力配置文件。在评估阶段加入全新的外部执行者时,调度器能够迅速根据给定的全新配置表,合理将其插入到执行 DAG 的合适位置上,展现了出色的零样本跨模型适配能力。

走向实用的生产级智能体生态

莫纳什大学的这项研究为正在步入深水区的大模型智能体落地提供了清晰的思路参考。过去的 Agent 研发往往被局限在两条割裂的轨道上:算法研究者沉迷于设计越来越花哨的交互拓扑以刷新 Benchmark,而基础架构与工程团队则苦于算力成本和响应超时迟迟无法将多智能体推向线上。

EASy 表明,通过将任务分解为粗粒度的“里程碑”,并在局部放权给可并行的“执行 DAG”,可以在保持长程规划鲁棒性的同时极大削减调度延迟;更重要的是,利用强化学习对包含成本、效率与格式合法性的复合奖励进行协同优化,能够直接把“成本控制意识”内化到调度大模型的心智中。

当未来的智能体系统不可避免地走向成百上千个领域专属小模型与极少数超强大模型共存的异构格局时,这类懂预算、知进退、能并行的调度中枢,将是决定智能体系统能否走出实验室、真正跑进产业核心系统的胜负手。