EcoAgent-Bench:完成任务不等于懂省钱,大模型Agent经济一致性最高仅7.3%
EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents

在现有的大模型智能体(LLM Agent)评测中,研究人员习惯于将“任务是否最终完成”作为唯一的核心指标,而把消耗的 Token 数量、API 调用花销或工具使用成本,当成评测结束后的附带统计数据。这种评测机制无形中鼓励了一种简单粗暴的策略:智能体可以无节制地调用高昂的复合工具、疯狂发起深度检索,甚至在遇到任何轻微阻碍时直接呼叫人类介入。
ArXiv URL:https://arxiv.org/abs/2608.05519v1
在真实的生产部署环境中,资源从来都不是无限的。面对用户请求,智能体究竟是该用毫秒级、零边际成本的本地文件检索,还是调用昂贵的外部搜索引擎;是靠廉价的小参数模型推理,还是路由给高价的前沿大模型;亦或是在检索证据彻底缺失时果断止损,这些权衡本身就是任务能否合格完成的核心组成部分。
来自 Atlassian 的研究团队在这一背景下推出了 EcoAgent-Bench,这是首个将显式预算约束与明确定价动作内嵌为任务前置条件的 Agent 评测基准。这项研究揭示了一个此前被广泛忽视的严酷现实:智能体能够在预算内碰巧给出一个答案,与智能体具备真正的“经济理性决策能力”,是完全脱节的两回事。在包含 304 个源自真实场景的任务评测中,主流大模型智能体在 Tool-API 设定下的微平均严格成功率仅为 3.9% 至 24.0%,而在兼顾“该省则省”与“该花则花”的经济一致性指标上,最高分甚至只有惨淡的 7.3%。
为什么说传统的 Agent 评测指标在“自欺欺人”?
要理解 EcoAgent-Bench 的必要性,首先要看清传统评价体系的盲区。以往的基准测试,如 GAIA、SWE-bench 或 WebArena,通常关注智能体能否在给定的沙盒或网络环境中拿到正确输出。如果一个 Agent 每次遇到问题都无脑调用最贵的“深度研究(Deep Research)”复合工具,它的微平均准确率(Micro-averaged Accuracy)往往高得惊人。
然而,一旦给每个动作标上价格,这种单边激进策略的劣势便暴露无遗。如果任务本身只需要查询本地文档即可解决,调用高价工具就是在挥霍预算;反之,如果一个智能体极其吝啬,为了节省成本永远只用廉价的本地搜索,那么一旦遇到多跳推理或信息匮乏的复杂场景,它又会因为缺乏关键证据而彻底失败。
传统的微平均统计方法对这种“偏科”现象极度不敏感。为了打破这一评价假象,EcoAgent-Bench 引入了经济一致性得分(Economic-Consistency Score,简称 Econ)。该指标将评测任务划分为“需升级型(Upgrade-oriented)”与“节约型(Save-oriented)”两大阵营,并将智能体的最终经济得分定义为两者准确率的最小值:
\[\text{Econ} = \min(\text{Acc}_{\text{Up}}, \text{Acc}_{\text{Save}})\]如果一个智能体采用“无脑全上顶级工具”的策略,它在需升级任务上虽然能拿高分,但在节约型任务上会因预算超支或浪费而得分趋近于零,其最终的 Econ 得分也会直接归零。只有当智能体在两种截然相反的成本权衡中都能做出自适应选择时,才被认定具备了基础的经济理性。
304 个真实衍生任务与四大经济抉择
EcoAgent-Bench 并非人工捏造成本玩具题,而是严格基于 GAIA、HotpotQA 和 MuSiQue 等真实数据集改造而来,总计构建了 304 个固化评测任务。每一个任务都不仅包含用户的原始指令,还内置了一个对智能体可见的定价工具环境、严格的预算额度 $B$,以及评测器可见的基准真值轨迹。
在形式化定义上,给定任务 $t$ 与预算 $B$,智能体生成的动作轨迹记为 $\pi = (a_1, a_2, \dots, a_k)$,每个动作的成本为 $c(a_i)$,轨迹总花销为 $C(\pi) = \sum_i c(a_i)$。轨迹的效用函数被严格定义为:
\[U(\pi,t) = \begin{cases} R - \lambda \, C(\pi) & \text{若 } \mathbb{1}[\pi \models t]=1 \text{ 且 } C(\pi) \le B \\ -\lambda \, C(\pi) & \text{若 } \mathbb{1}[\pi \models t]=0 \text{ 且 } C(\pi) \le B \\ -\infty & \text{若 } C(\pi) > B \end{cases}\]其中 $R$ 代表回答正确的正向奖励,$\lambda > 0$ 是成本惩罚系数。一旦花销越过预算 $B$,收益直接断崖跌落至负无穷。
为了系统化检验智能体应对该效用函数的能力,EcoAgent-Bench 提炼出了大模型智能体在实际落地中必须面对的四类经济决策:
-
避免不必要升级(Avoiding Unnecessary Escalation):当本地或廉价检索到的证据已经足够回答问题时,严禁调用高成本的复合调研工具。
-
证据不足时果断升级(Escalating When Warranted):在浅层搜索只返回噪声或片面信息时,智能体必须主动识别出证据链断裂,并果断花费预算换取更高阶的工具支持。
-
模型层级路由(Model Tier Selection):根据上下文的推理复杂度,动态决定是将上下文直接交给轻量、低价的模型推理,还是路由给昂贵的高性能前沿模型。
-
无解前提下的止损与弃权(Stop-loss on Unsupported Premises):当外部检索证据表明问题的先验假设根本不成立,或者信息源彻底缺失时,智能体应当收集有限证据后主动声明放弃,而不是反复尝试不同高价工具直至预算耗尽,甚至胡乱编造答案。
为了确保对比的严格性,每个任务在构建时都固化了一条“规范合规轨迹(Canonical Trajectory)”与一条“高后悔轨迹(High-regret Trajectory)”。高后悔轨迹精确映射了上述四种反面行为:要么是明明能一步查出的答案却绕道昂贵工具,要么是廉价工具查不到却拒绝追加投入,导致整个任务在逻辑或预算上宣告破产。
实验真相:主流大模型在 API 设定下的集体溃败
研究团队针对七款主流大模型智能体以及四种脚本控制策略展开了全面评测。评测分为两大主要阵营:通过结构化 Tool-API 进行工具交互的多轮循环模式,以及通过工作区命令行(Workspace CLI)直接操作系统环境的智能体形态。
测试结果呈现出断层式的差距,尤其是代表当下最常见落地方案的 Tool-API 智能体,其表现几乎全线崩溃:
在基础的微平均严格成功率上,主流前沿模型驱动的 Tool-API 智能体得分仅在 3.9% 到 24.0% 之间徘徊;而一旦换算为考察双向平衡能力的经济一致性指标 Econ,表现最佳的智能体也仅拿到了 7.3%,部分模型甚至直接跌到了 3.6% 的冰点。
深入到具体的执行轨迹中,研究者观察到了两个走向极端却同样致命的失败模式:
一方面是以某些强调激进探索的模型为代表的“过度开销型崩溃”。在原本属于低成本的问答任务中,模型反复发起广域检索和高价调用,在廉价任务族中的预算超支率竟高达 74% 乃至 99%。它们完全没有意识到当前上下文已经蕴含了解题线索,如同拿着无限信用卡的采购员,在便利店里买一瓶水也要动用运钞车。
另一方面则是以 GPT-5.4 为代表的“过早放弃与凭空盲猜”。在面对廉价任务时,它虽然维持了极低的花销,但答案的宽松准确率只有区区 25%——它倾向于直接使用模型内部未对齐的先验记忆去“赌”一个答案,而不是调动廉价检索去核实。而在 115 个明确需要调用深度研究工具才能突破的升级型任务中,GPT-5.4 在 45 个任务里草草声明证据不足并退出了流程,且在整整 115 个任务中完全没有调用过一次深度研究工具。
这种行为在单纯的成本统计表中极具欺骗性:该模型的单任务平均成本看起来是所有模型中最低的,显得非常“省钱”;但由于它的成功案例极少,导致其“单次成功所需分摊的平均成本”反而是全场最高。
预算更多,表现反而更差?反直觉的敏感性缺失
最能体现当前大模型 Agent 缺乏经济理性的,是论文中精心设计的跨阈值预算扫描实验(Budget Sweep)。
在合理的经济学假设中,一个具备环境适应能力的智能体,其行为应当随着外部资源约束的变化而发生动态调整。如果给定的预算极度紧张(低于升级工具的调用门槛),智能体理应在廉价工具中尽可能碰运气;而一旦预算提升、越过了高阶工具的门槛,智能体在面临卡点时,应当顺理成章地提高昂贵工具的调用意愿。
然而实验数据狠狠打破了这种预期。研究团队在需要调用深度研究工具的任务集上,将预算从低阈值逐步放宽到高阈值。结果显示,GPT-5.4 对高阶工具的调用率仅仅从 0% 微弱提升到了 0.9% 和 2.6%——换句话说,超过 97% 的任务在拥有充足预算的情况下,依然因为模型的“不作为”而原地卡死。多达 64% 至 79% 的执行轨迹甚至从头到尾连一次工具调用的尝试都没有做出。
而在另一组只需廉价证据即可解决的 72 个任务中,预算被划分为紧缩(90)、中等(240)和宽松(480)三个档位。这一次,模型展现出了对预算的“感知”,但这种感知却完全走错了方向。
随着预算的增加,所有测试模型的单任务平均花销均单调上升。但额外的预算投入并没有带来任何准确率的提升,反而诱发了严重的浪费行为。以 Gemini 2.5 Pro 为例,在紧缩与中等预算下,该模型对深度研究的调用率仅为 1.4%;而一旦将预算放宽到 480,它在这些本就极为简单的任务上,使用深度研究的比例骤增至 19.4%。
这就构成了一个极具讽刺意味的对比现象:在真正需要掏钱买深度线索的关卡上,大模型紧捂钱包、消极罢工;在明明可以用免费或低价线索通关的送分题前,一旦发现预算额度充裕,大模型便开始无节制地挥霍昂贵算力。 这种预算响应不仅极其迟钝,而且方向完全倒错。
为什么提示词里写了预算,Agent 依然不会花钱?
在现有的技术实现中,绝大多数开发者试图通过在 System Prompt 中添加一句话来约束成本,例如“你当前拥有 300 点预算,请合理规划你的工具调用”。EcoAgent-Bench 的消融与轨迹审计证明,这种朴素的 Prompting 机制在复杂的长流程决策中几乎形同虚设。
从认知机理上剖析,当前 Agent 普遍将三个相互交织却逻辑独立的决策维度混为一谈:
-
当前证据的充分性判定:现有搜集到的上下文是否严谨闭环,能够完全推导最终结论?
-
潜在后续动作的边际价值预估:下一步可用的候选动作(本地读文件、全网搜、调复合 Agent、呼叫上级模型)分别能带来多少确定性的信息增益?
-
动作与剩余预算的支付匹配:该动作的标价是否在当前剩余预算的安全边界内?
现有的单体大模型(Monolithic LLM)在以自回归方式生成 Tool Call 时,缺乏专门针对“边际回报率(ROI)”的价值评估机制。当模型在 Prompt 中看到预算数值时,它最多只能将其作为一种被动的词表概率偏置,而无法在动作发射前构建出显式的成本-收益期望树。
这就解释了为什么基于代码工作区环境的系统(如搭载 Opus 4.8 的 Claude Code)能够在本次评测中斩获相对领先的成绩(微平均成功率 65.1%,经济一致性 53.6%)。在完备的工作区中,智能体面对的是具有更高确定性、允许在本地不断试错和查看返回状态的闭环环境,模型更易于感知局部上下文是否完备,进而降低了因盲目猜测或过度发散检索引发的单边偏差。但即便在工作区环境下,距离真正的理性自适应调度依然有相当大的距离。
走向具备 ROI 感知的下一代控制器架构
EcoAgent-Bench 的研究结论为后续智能体架构的演进指明了一个不可回避的方向:不能再将大语言模型当成唯一的执行与调度终极实体。
在未来的生产级 Agent 系统中,必须解耦出一套具备经济理性约束的轻量级“元控制器(Controller)”。在每一次工具调用或推理路由之前,系统应当显式执行边际决策分析:
首先评估当前环境证据是否达到了停止标准;若未达到,则分别估计调用廉价工具与高价工具的成功置信度增益;最后将置信度增益与动作标价、剩余预算进行联立求解,仅在预期边际净收益为正的前提下批准升级调用。
当行业逐步从对基准榜单分数的盲目追逐,转向对真实商业落地 ROI 的严苛审视时,评测指标必须率先完成蜕变。EcoAgent-Bench 证明,一个在传统榜单上跑出高准确率的 Agent,在现实账单面前可能是一个灾难性的亏损源。将成本从后台日志中冰冷的计费数字,转化为智能体内部决策闭环的前置变量,大模型智能体才算真正迈出了走向工业化部署的关键一步。