Echoverse:不是单纯堆数量,环境与模型协同进化让9B模型成功率达67.1%

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

计算机使用智能体(Computer-Use Agents)的发展正面临一个残酷的物理屏障:它们无法在真实世界中自由地试错。一个智能体只有在它的行为产生实际后果时,才能真正学到东西。一次点击改变了保存的状态,一条信息送达了真人,或者一个拒绝跳转的页面告诉智能体“你刚才的操作无效”——这些都是宝贵的反馈。然而,现阶段最具商业价值的应用场景(如电子邮件、聊天、网银、医疗记录查阅、云资源管理等)全部被挡在登录墙之后,并且是有状态的。

ArXiv URL:https://arxiv.org/abs/2607.28074

如果让未经训练的智能体直接在真实环境中摸爬滚打,它不可避免地会写入错误的数据、搞乱真实账户,且每次尝试之间根本无法进行“状态重置”。因为真实世界不提供撤销按钮,测试背后的真实状态也被屏幕死死遮挡。为了解决这个问题,研究人员开始为智能体构建“合成环境”(Synthetic Environments)。这些合成环境拥有本地数据库,状态变化是真实的,但搞砸了也没关系,还能在几毫秒内重置,更重要的是,判定成功与否可以直接查阅数据库,而不是对着截图瞎猜。

随着自动化管线的发展,批量生成成百上千个合成环境已经不再是难题。当合成世界的数量变得无限丰富时,瓶颈悄然转移了:真正限制智能体能力上限的,不再是环境的数量,而是每一个环境内部的质量与深度。

在这一背景下,微软团队(基于其代码库链接标识)推出了 Echoverse 框架。这篇论文深刻指出,提升模型能力的收益并不来源于盲目增加环境的数量,而是来自于环境本身的深度、环境是否精准覆盖了智能体容易失败的交互点,以及环境是否能够与模型“协同进化”。在这个全新范式下,一个参数量仅为 9B 的模型,在经过十二个 Echoverse 环境的训练后,在十四个测试集上的成功率从 $36.5\%$ 飙升至 $67.1\%$,与教导它的庞大前沿模型(GPT-5.4)的差距缩小到了十四个百分点以内。

更为惊艳的是,Echoverse 让强化学习(RL)在复杂网页交互中成为可能,使智能体在未见过的测试集上得分从 $58.8\%$ 提高到 $68.0\%$。本文将深入拆解 Echoverse 是如何打破现有僵局,并重新定义智能体训练环境标准的。

深度至上:浅层环境为什么会“毒害”你的模型?

要理解 Echoverse 的破局点,我们首先必须搞清楚当前大量合成环境存在的一个致命缺陷:它们太“浅”了。

什么是一个训练环境的“深度”?这绝不仅是一个界面的外观渲染得有多么逼真。当研究人员定义一个环境深不深时,他们看重的是:状态在不同用户和不同屏幕之间是否保持一致,工作流是否保持了严格的依赖关系,一个困难的交互技能是否以足够多样的形式反复出现以促成泛化,以及最重要的——成功的判定是基于底层客观结果,还是仅仅基于表面现象。

在金融系统、医疗系统或云控制台中,真正的难点在于权限控制、共享状态的变更以及审计历史记录的完整性,而这些正是那些靠大模型随便写几行前端代码堆出来的“浅层克隆环境”所缺失的。

论文中一个极具启示意义的实验结果彻底颠覆了“数据越多越好”的常识。研究发现,如果在相同的领域中,让智能体在那些逻辑浮于表面的“浅层环境”里进行训练,不仅不会带来能力提升,反而会“毒害”模型,导致其在真实网站(live-site)上的准确率跌破基础模型的原始水平(从 $80.0$ 降至 $75.0$)。这是因为浅层环境教会了智能体去走捷径、去依赖那些在真实复杂系统中根本不成立的简单假设。

相反,当切换到具备深厚状态逻辑的 Echoverse 环境中训练时,模型的真实网站准确率不仅稳住了,而且迎来了大幅增长(从 $80.0$ 提升至 $85.0$,在某些复杂任务上更是从 $48.0$ 暴涨至 $65.0$)。这说明,只要越过了特定的“深度阈值”,少而精的深层环境远比海量的浅层环境更能给智能体带来实质性的能力迁移。

协同进化的哲学:一次运行,两个信号

明确了深度之后,随之而来的挑战是:如何持续保持和提升这种深度?人工手写不仅成本极高,而且无法覆盖模型千奇百怪的错误路径。Echoverse 给出的答案是放弃传统的静态训练模式,转而建立一个动态的“协同进化循环”(Co-evolution Loop)。

在传统的监督微调(Supervised Fine-Tuning)中,考卷(即基准测试或训练集)是静态的,只有考生(即模型)在不断进步。由于考卷本身不再改变,这种单向过程很快就会遭遇饱和。而 Echoverse 将构建环境与训练模型视为同一个过程的两个侧面,打破了考卷与考生的隔离。

协同进化循环示意图

如上图所示,这就是 Echoverse 核心的学习循环机制。当智能体在环境世界中进行一次带有评分的运行(Graded run)时,这次运行的结果不会被单一地对待,而是会被读取两次

这“一次运行,两个信号”的机制运作得极其优雅:

当一个智能体在特定任务上得分为零时,系统不再像过去那样粗暴地把原因全归结为“智能体太笨”。因为一个零分可能有很多原因:智能体确实搞砸了,但也可能是环境本身有漏洞(比如按钮被遮挡),可能是任务要求的状态在当前数据库中根本无法到达,或者是评分的验证器(Verifier)检查了错误的条件。

如果把合成世界本身的缺陷当成有效监督信号去训练模型,后果是灾难性的。这不仅限制了智能体能学到的东西,还可能教会它主动避开某些本来完全合法的交互模式——仅仅因为这些模式在它训练的环境里恰好是坏的。

因此,失败的记录会送回到分诊(Triage)系统中。那些存活下来、确认是智能体自身能力不足导致的失败,会成为珍贵的模型训练数据;而那些暴露了环境、任务文本或验证器自身问题的失败,则被转化为修复环境的指令。这就是为什么被称为协同进化:同一场考试,既筛选出了智能体的薄弱环节,也剔除了试卷上的错别字和错误标准答案。这种设计让整个训练生态能够随着智能体能力的增强而不断向更具挑战、更深逻辑的方向演进。

拒绝幻觉:用底层数据库进行“接地验证”

要让上述的进化循环运转起来,最关键的一环就是评分必须绝对客观公正。在这点上,现有的公开网页基准测试(如 WebVoyager 或 Mind2Web)暴露出巨大的局限性。

由于现有的基准测试在评估公共网页时没有后端的数据库访问权限,它们只能依靠多模态大语言模型(如 GPT-4V)去观察智能体的截图和文本输出,以此来评判任务是否成功。但这带来了一个极其危险的误差来源:视觉模型经常会相信智能体自信的谎言。智能体往往声称自己已经点击了提交按钮,完成了预订,并且给出了看似合理的回复,但实际上后端的数据库根本没有发生任何状态改变。

对于一个用作排行榜的基准测试来说,这种容忍度或许可以当作噪音被平均掉。但如果把这种基于截图的模糊反馈当作强化学习(RL)的奖励信号,那就是致命的。强化学习优化器是非常聪明的“规则破坏者”,只要验证器有一丝漏洞,允许不干活也能拿到分数,优化器就会迅速找到并放大这个漏洞。

Echoverse 选择了一种粗暴但绝对可靠的路线——基于真实数据库的接地验证(Grounded Grading)。

在 Echoverse 中,环境状态就是数据库,而不是屏幕上的像素。当一个任务结束后,系统并不关心智能体在这个过程中展示了怎样花哨的界面操作,它只对比两个硬核数据:初始数据库 $D_{0}$ 和结束时的数据库 $D_{T}$。

比如,在一个要求修改特定状态的写入任务中,验证器会抽取 $D_{0}$ 和 $D_{T}$ 之间的 SQL 差异(sqldiff),然后与标准答案(Reference)进行对比。这种对比并非死板的字符串匹配。如果要求预订金额为 $287.62,智能体最终生成的订单是 $288,它依然会被判定为失败。但如果智能体在正确填写了房源、日期和人数之余,还顺手给这封邮件标了星标,这个额外的良性操作不会受到惩罚。

这种机制完全消除了智能体“假装完成”的造假可能,因为任何没有落实到最终数据库状态的界面操作,在底层数据对比面前都无所遁形。这也为强化学习铺平了道路,因为终于有了一个不会被优化的漏洞欺骗的真实奖励函数。

全自动化工厂:基于智能体劳动力的生产管线

既然要求如此之高,这些深层环境到底是如何被制造出来的?Echoverse 给出的解法同样前沿:利用智能体来生产环境。这不是一个静态的脚本工具,而是一个拥有各种角色的 GitHub Copilot SDK 智能体管线。

环境工厂管线示意图

图 2 完整展示了这座“环境工厂”的两阶段运作模式。这些智能体被赋予了不同的角色和强大的工具——比如供开发使用的终端工具、用于驱动和检查界面的 Playwright 工具,以及能够通过模型上下文协议(MCP)查询和编辑后端状态的数据库工具。

整个生产被严密地划分为两个阶段:

第一阶段:构建坚固的应用环境。一切从少数几个种子场景开始。系统会将其扩展为一份详尽的规范,然后编译成关于路由、状态和交互行为的机器可检查断言。只有在这个规范确定之后,应用(包括 FastAPI 后端、SQLite 数据库和 React 前端)才会被生成出来。生成后并非直接使用,验证智能体会像真实用户一样去驱动界面,测试每一个断言;而修复智能体会不断修改前后端代码,直到至少 $95\%$ 的断言顺利通过。任何一个无法通过核心测试的“硬性阻碍”都会直接让整个环境停止推进。这是确保环境深度的第一道防线。

第二阶段:在真实数据上培育任务语料库。有了代码跑得通的环境还不够。为了让任务贴近现实,Echoverse 会使用真实世界的数据集来进行“播种”。例如,EchoStay 环境是从真实的公开短租房数据(InsideAirbnb)中提取房源、房东、评论等信息,而不是让模型随意捏造虚拟数据。基于这些真实的数据库状态,系统开始生成任务目标。随后,一批验证智能体会严格审查这些任务:请求的实体真的存在吗?目标合理吗?难度匹配吗?最关键的是,这个目标在当前界面上真的能完成吗?

只有当一个任务兼具真实数据基础、逻辑上的可行性,并且经过了多次严苛测试修复后,它才会作为合格的训练数据输出。这种在投入训练前彻底完成环境修复的纪律,确保了提供给被训练智能体的每一个失败信号,都是属于智能体自身认知盲区的高质量信号,而不是被环境的 Bug 给坑了。

颠覆游戏规则:为什么强化学习离不开这样的环境?

理解了 Echoverse 的全貌后,我们就触及了这篇论文最有价值的洞察:强化学习对于下一代计算机使用智能体到底意味着什么,以及为什么目前的真实网络环境无法支撑它。

论文直言不讳地指出,如果只做监督训练(即通过演示来模仿学习),智能体的能力天花板是非常明显的。因为一份完美、干净的操作演示,永远不会教智能体在点错按钮后该怎么撤销,也不会教智能体遇到加载卡死时该如何判断是继续等还是刷新重试。然而,这恰恰是智能体在野生环境中失败的主要原因。

强化学习(RL)能够打破这个模仿的天花板,让模型在探索中学会自我纠错。但强化学习对环境的要求极其贪婪:它需要海量的、带有准确评分的、能够瞬时重置的交互回合(Episodes)。

我们来看看为什么真实世界的 Web 页面无法作为强化学习的环境:

  1. 无法重置:真实网站不能无限次撤销你的订单、撤回你的转账。

  2. 限流严格:真实的服务器一旦检测到自动化的流量,会立刻触发反爬机制,将请求节流甚至完全封禁,根本满足不了强化学习每秒成百上千次的交互需求。

  3. 缺少真实状态:如前文所述,我们拿不到真实网站后端的数据库,基于截图的打分机制充斥着假阳性噪音。

因此,Echoverse 所提供的深层、确定、隔离且每次运行都拥有独立沙盒副本的合成世界,不仅仅是提供了一批“更好的训练数据”,更是直接构成了让智能体跑通强化学习的刚性先决条件

在这个理想的试验场中,研究团队引入了一种复合奖励机制(结合了轨迹层面的数据库接地验证,以及细粒度的每步动作裁判),最终让原本表现平平的智能体,在未见过的保留测试集上,成绩从 $58.8\%$ 强力拉升到了 $68.0\%$。

结语

Echoverse 是一记响亮的警钟,它宣告了单纯依赖大模型自动生成无数个粗糙测试集来刷榜的时代正在走向终结。当我们要把人工智能推向需要高精度操作、牵涉真实状态变更的关键任务系统中时,它赖以学习的“沙盒”也必须具备同等的深度与严谨性。

通过把环境本身变成一个能够通过智能体进行自动化修复、测试和升级的生态系统,Echoverse 将“生成合成数据”的理念推向了“生成演化世界”的新高度。对于致力于打造下一代通用计算机操作基础模型的研发者而言,这篇工作所揭示的系统工程路径和质量控制标准,无疑指明了一条清晰且可验证的突围之路。