AgentMercury:从业务场景自生成交互环境,环境构建成功率达83%

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale

AgentMercury:从业务场景自生成交互环境,环境构建成功率达83% 论文图示

在强化学习与智能体(Agent)研究领域,构建高质量、多样化且可交互的真实环境一直是最沉重的工程包袱。无论是经典的机器人仿真,还是如今风头正劲的代码编写与企业运维智能体,训练环境往往都是工程师手动用代码“硬抠”出来的,或者围绕某些固定基准测试集特异性拼装而成。这种“以任务为中心”(Task-centric)的搭建方式带来了一个难以逾越的瓶颈:环境往往被过度裁剪以适配特定任务,无法体现真实工作流的动态演变,更不可能像真实世界那样,让千变万化的业务需求自然涌现。

ArXiv URL:https://arxiv.org/abs/2608.20634v1

由 Meridian Intelligence Global 与麻省大学阿默斯特分校(UMass Amherst)联合提出的 AgentMercury 框架,试图彻底打破这一僵局。该研究跳出传统的任务束缚,提出了“以场景为基底的世界生成”(Scenario-grounded world generation)范式。系统不需要针对具体目标手工写死代码,而是仅凭一段宏观业务场景描述,就能自动化构造包含实体、微服务、工具接口、持久化数据库以及跨服务不变量的完整可执行沙箱。

这项研究不仅自动化生成了跨越 14 个行业、50 个国家、包含 4,783 个可执行业务环境的数据集,更揭示出两个极具冲击力的实验结论:其一,在这些完全脱离评测基准生成的多服务业务环境中进行强化学习训练,模型不仅在企业运维基准上显著提升,其数学推理基准 AIME26 得分竟然从 45.9 提升到 56.0;其二,构建环境这一原本属于人类工程师的元能力,本身也是可以被神经网络学会的——经过构建轨迹微调的模型,在未知业务场景上独立编写可执行世界代码的成功率从基准的 3.3% 飙升至 83.3%。

从“任务外包”到“世界创生”:智能体系统的第三个角色

要理解 AgentMercury 的底层逻辑,首先要审视传统智能体系统中的角色划分。在现有的主流认知中,智能体系统通常被划分为两部分:一是负责决定在当前状态下采取什么行动的策略模型(Policy,通常记为 $\pi$),二是负责预测环境状态在行动后如何演化的世界模型(World Model,通常记为 $W$)。两者互为表里,构成了智能体在环境中试错与规划的闭环。

然而,这一认知暗含了一个默认前提——“世界”必须已经先验地存在。不管是数据库的 Schema、服务的 API 接口,还是底层的状态转移逻辑,以往都是在训练开始前就被人类专家设定好的。这种设计范式将环境与特定任务强行绑定。当我们需要智能体解决报销审批、客户工单流转或 IT 故障排查时,工程师就必须针对每一个任务去写 Mock 接口、搭静态数据库,环境成了任务的附庸。这种做法的致命缺陷在于,增加任务数量并不等同于增加了底层世界的丰富度,智能体见过的软件交互状态依然极端贫瘠。

从业务场景构建世界到智能体交互的全流程架构图

AgentMercury 在策略与世界模型之外,正式确立了第三个核心角色——负责世界创生的“Planet”。如上图所示,整个交互范式被重新拆解为四个清晰解耦的阶段:首先由 Planet 将一段非结构化的高层业务场景 $\sigma$ 编译为可执行世界 $w$;接着由 Task 模块基于该世界派生出具体的任务指令 $u$ 与评分准则 $\rho$;随后智能体策略 $\pi$ 在世界中执行多步工具调用并产生交互轨迹 $\tau$;最后评测模块 Grade 基于状态变化给出确定性奖励 $r$。

这种解耦彻底反转了环境构建的因果链条。真实企业环境之所以复杂,是因为企业本身维持着一套长久运行的业务实体与跨服务约束,而不是因为某天早上有员工下发了一条指令。在 AgentMercury 的设定中,世界只负责“存在”并提供自洽的运转规律,具体任务则是从这个存在的世界中自然截取出来的局部状态变化,从而天然具备了高复用性与高扩展性。

解构 Planet:如何把一段业务场景编译成可执行沙箱?

把一段类似“一家跨国物流公司需要协调海关申报与仓储调度”的宏观场景描述直接变成包含多微服务和数据库的代码沙箱,在工程和逻辑上面临巨大的幻觉与崩溃风险。AgentMercury 将 Planet 的生成过程进行了严格的概率分解:

\[\textsc{Planet}(w\mid\sigma) = p(C\mid\sigma)\,p(G\mid C)\,p(\Sigma\mid G,C)\,p(s_{0}\mid\Sigma)\,p(\mathcal{R}\mid G,\Sigma,s_{0})\]

这个式子展现了世界构建从抽象到具象的递进过程。第一步,$p(C\mid\sigma)$ 负责将高层场景落地为具有具体背景特征的公司实体(Company Identity),包括企业组织架构、所在法域合规要求、运营规模等;第二步,$p(G\mid C)$ 根据公司形态衍生出服务依赖图(Service Graph),决定需要接入哪些 SaaS 软件、数据库或外部接口;第三步,$p(\Sigma\mid G,C)$ 生成这些微服务对应的底层关系型数据库状态模型(State Schema);第四步,$p(s_{0}\mid\Sigma)$ 生成满足业务逻辑的种子初始化数据;最后一步,也是整个框架最具巧思的机制,则是生成跨服务不变量 $\mathcal{R}$(World Invariants)。

在传统的游戏模拟器或 Mock 环境中,如果智能体调用了一个“创建采购单”的接口,往往底层代码会自动将库存扣减、发票草稿同步创建。这种设计其实替智能体承担了系统演进的逻辑责任。而在现实业务中,跨系统的数据一致性往往依赖员工或自动化流程的二次确认。

AgentMercury 在设计上做出了极其清晰的切分:可执行转移函数 $T$ 仅忠实响应智能体的单步原子操作,而跨服务一致性要求 $\mathcal{R}$ 则以确定性 SQL 校验条件的形式独立存在,并不直接内置在执行引擎内部。例如,当智能体在销售系统创建了大宗订单,环境引擎不会自动去仓储系统锁库,智能体必须自行调用仓储系统的工具完成操作。在评测阶段,环境会提取隐藏的规则视图 $\mathcal{R}_{\mathrm{hid}}$ 来校验数据库状态,确保跨服务约束完全达成。这种机制既赋予了环境极高的自由度,又提供了不依赖大模型主观打分的确定性评测信号(Deterministic Grading)。

规模化验证:跨越 14 个行业与 50 个国家的“合成世界”

依托 Planet 的模块化构建能力,研究团队合成了 4,783 个完全可执行的独立企业业务环境,并进一步采样衍生出 43,300 个包含完整评测标准的任务实例。这一数据集的体量和交互深度与以往的 Agent 基准形成了极其鲜明的对比。

现有绝大多数智能体评测环境要么停留在单工具、浅状态的 Toy 级别,要么局限在单一代码仓库(如 SWE-bench)或特定领域的预制系统(如 Tau-bench)。AgentMercury 合成的环境则覆盖了金融、医疗、智能制造、跨国零售等 14 个垂直工业领域,同时遵循了 50 个国家各异的数据与业务合规逻辑。更重要的是,每一个环境内部都运行着真正的关系型数据库表和多个交互微服务,并配备了严格可校验的跨服务约束逻辑。

在这些环境中,智能体观察到的并非全局数据库的直接视图,而是通过调用各微服务 API 获得的局部返回值 $\omega$。这种部分可观测性(POMDP)和长程交互状态依赖,构建起一个极其逼真的企业数字化底座,为后续的强化学习提供了海量的高质量探索空间。

业务场景强化学习带来的域外泛化惊喜

有了可执行的世界与确定性的打分信号,强化学习便能自然介入。研究团队基于 GRPO(群体相对策略优化)以及面向单次采样异步优化的 SAO 算法,利用 Qwen3.5 系列模型作为基座进行了端到端训练。在整个训练过程中,没有任何一条数据是针对后续评测基准专门定制的。

在企业业务场景测试基准 EnterpriseOps-Gym 的直接评测中,经过 AgentMercury 环境强化学习训练的模型展现了全方位的提升。以 Qwen3.5-35B-A3B 为例,在 GRPO 优化下,其跨 8 大企业业务领域(包括 Teams 协作、CSM 客户服务、Email、ITSM 运维、Calendar、HR 人力资源、Drive 云盘及混合场景 Hybrid)的平均综合得分从基座的 24.8 分攀升至 28.1 分,提升了 3.3 个绝对点,相对提升幅度达到 13.3%;使用 SAO 算法时,得分更是稳定提升至 28.3 分。8 个业务子领域的得分全部实现正增长,其中 Teams 协作场景提升幅度最高达到了 5.9 分,云盘协作场景提升了 5.3 分。这证明合成环境提供的交互反馈绝非无效的局部震荡,而是能扎实沉淀出跨系统软件协同的操作经验。

然而,真正令人瞩目的实验现象出现在域外基准(Out-of-Domain)测试中。

当模型在 4,000 多个企业业务沙箱中反复试错、学习如何保持数据库状态一致、如何规划多服务工具调用序列后,这些能力竟然高度迁移到了通用的推理与代码任务中。在极具难度的全美数学邀请赛基准 AIME26 上,仅有 40 亿参数的 Qwen3.5-4B 模型得分从基线的 45.9 飞跃至 56.0,获得了超过 10 个百分点的显著提升。

这一结果在表面上看违背常识:一个每天在处理“采购单核对”、“报销审批流”和“IT工单派发”的环境,怎么能够增强模型解数学竞赛题的能力?

深入分析背后的交互本质便能发现,AgentMercury 的环境交互包含两大核心要素:一是长程工具调用的严密因果逻辑,智能体必须在复杂的系统状态依赖中推导前置与后置条件;二是必须通过确定性的 SQL 规则满足严格约束。这种在具有明确物理限制的世界中进行自我纠错和规划的强化学习信号,在本质上就是在强化模型的系统化推理(Systematic Reasoning)能力。模型学到的不是某一个业务 API 的名字,而是在面对多约束系统时如何进行精确的状态回溯与长程规划。

世界构建能力自身成为可学习的元技能

除了验证生成环境作为训练基底的价值,这项研究的另一个关键突破在于证明了“构建世界”这项能力本身同样可以被参数化学习。

以往我们认为编写环境代码属于人类程序员的高门槛工作,因为环境不仅要有功能,还要保证状态无缝流转且不出运行时异常。AgentMercury 在把业务场景 $\sigma$ 转化为可执行世界 $w$ 的过程中,记录了完整的生成轨迹(Construction Traces),包括实体设计、数据库 DDL 编写、API 逻辑实现、测试用例编写以及不变量规则定义的代码级全流程。

这些由高质量流水线留下的轨迹,构成了监督微调的绝佳语料。研究人员利用这些轨迹对 Qwen3.5-35B-A3B 进行了微调,并在完全未见过的崭新业务场景上测试其独立编写可执行环境的能力。评测标准极其严苛:模型生成的代码必须能够无报错加载、支持动态读写持久化状态,并且必须能够正确执行跨服务的约束校验。

实验结果展现了戏剧性的变化:原始基座模型在面对全新业务场景时,能够写出完整可运行环境代码的成功率仅仅只有可怜的 3.3%,大部分输出在环境加载或初次 API 调用时便直接崩溃;而在吸收了 AgentMercury 的构建轨迹后,该模型在未知场景上的环境构建成功率直接跃升到了 83.3%。

这意味着智能体不再仅仅是沙箱里的被动探索者。随着世界构建能力的习得,未来的智能体系统完全可以自主形成闭环:一个智能体负责根据现实需求“创造新世界”,另一个智能体在其中“演化新技能”,二者相互迭代,从而在数字空间中开启真正的自举式演进。

从静态基准到环境自举的未来图景

AgentMercury 带来的启示远超一篇普通强化学习论文的范畴。长期以来,大模型领域的评测与对齐训练始终受制于固定 Benchmark 的桎梏,不仅存在数据污染的隐忧,更让 Agent 的能力演进陷入了“刷榜即过拟合”的局部最优。

这项工作用详实的实验数据证明了另一种可能性的成立:复杂且严密的业务逻辑本身,就是最高质量的通用推理训练场。通过将高层场景形式化地编译为包含多微服务与跨服务不变量的可执行世界,研究者无需为了追逐某项评测而特异性造题,真实世界软件交互的固有复杂度足以赋予模型强大的泛化能量。

从更宏观的视角来看,当智能体学会了如何为自己搭建可交互、可验证的数字化试炼场,数据匮乏这一制约具身智能与通用数字智能体的最大瓶颈,或将从根本上被撬开一道通向无限规模自举的裂隙。