EchoPath:告别重复规划,执行级重放让GUI Agent的Token骤降90%
EchoPath: Execution-Level Replayable Memory for GUI Agents

在大模型接管操作系统的竞逐中,图形用户界面(GUI)一直是检验智能体真实执行力的高地。无论是在浏览器中录入采购申请、在办公套件中核对账目,还是跨越桌面软件导出分析报表,人类员工每天有大量时间耗费在高度重复的业务流程中。然而,当前业界主流的 Computer-Use 智能体在面对这些场景时,表现得更像一个每次上班都会“失忆”的新手:无论这个表单此前已经成功填写过多少次,智能体依然要启动一套完整的“观察—规划—定位—执行”(Observe-Plan-Ground-Act)闭环,逐屏截取图片、反复调用视觉语言大模型(VLM)判断像素坐标。
ArXiv URL:https://arxiv.org/abs/2609.16635
这种每步重推的模式不仅导致响应极其迟缓,更带来了惊人的运行成本。来自亚马逊(Amazon)与约翰斯·霍普金斯大学(Johns Hopkins University)的研究团队在一篇最新工作中指出,对于企业内高频、确定的常规工作,智能体反复进行感知与规划是极大的资源浪费。但如果退回到传统的自动化脚本或录制回放(Record-and-Replay),又会因为窗口移动、系统分辨率切换、界面微小更新而频繁崩溃。
针对这一困境,研究团队提出了 EchoPath——一种模型无关且环境无关的执行级可重放记忆框架。它不再将历史经验作为冗长的 Prompt 上下文喂回大模型,而是将经过终局验证的 GUI 执行轨迹提炼为标准化的“可调用资产”(类似 MCP 风格的确定性工具)。配合基于图像的目标重瞄算法(Image-Based Target-Reaiming,简称 IBTR),智能体在重放时无需模型重新定位坐标,直接在本地完成像素级校准与参数重绑。实验结果显示,在标准的操作系统任务测试中,EchoPath 在保持高成功率的前提下,使中位数 Token 消耗直降超过 90%,任务执行时间缩短约 60%。
为什么提示词记忆与传统录制都走不通?
在 EchoPath 出现之前,让 GUI 智能体“记住过去”通常有两条主流路径,但两条路线在企业级生产环境中都面临严重的结构性缺陷。
第一条路径是基于上下文的经验检索(Prompt-based Memory)。例如像 Synapse 等工作,智能体在处理新任务时,检索出相似的历史轨迹、反思总结或拆解步骤,作为 Few-shot 示例拼接在 Prompt 中。这种做法虽然保留了大模型应对动态环境的灵活性,但并没有真正解决效率痛点。智能体即便知晓“下一步要点提交按钮”,依然要把当前屏幕截图送进多模态大模型,消耗数百甚至上千 Token 去重新预测点击坐标(Grounding)。当单次任务包含十几个步骤时,多次模型推理带来的延迟往往长达数分钟,不仅成本居高不下,而且每次视觉定位都存在概率性的漂移失误。
第二条路径是经典坐标录制或依赖可访问性树(Accessibility Tree)的自动化脚本。这类工具直接按录制顺序下发点击与输入指令,完全跳过了模型调用,执行速度极快。然而,GUI 界面的脆弱性是工程师们挥之不去的噩梦:只要操作系统分辨率发生微小改变、应用窗口挪动了位置,或者 UI 元素因为滚动条出现而轻微偏移,固定的绝对屏幕坐标就会击中空白区域甚至引发误操作;而如果转向依赖底层的可访问性树,又经常会遇到第三方桌面应用未向操作系统暴露元素节点、或者 Canvas 绘图控件无法解析其内部结构的技术死局。

EchoPath 的核心设计理念恰恰处于这两者之间:它既不盲目信任固定坐标,也不让大模型在每一步都重新动用昂贵的视觉推理,而是将一次成功的任务执行,固化为带有前置检查、动态变量插槽和视觉锚点的“微型程序”。
将操作轨迹打包为可调用的标准化记忆
为了让执行经验真正变成一种可审计、可重用的系统级资产,EchoPath 构建了五阶段控制环路:任务解析、检索与门控、规划或重放决策、执行、以及工件评估。整套系统由专用的底层交互边界 ActionLens 驱动,无论处于自由探索还是确定性重放状态,所有键盘、鼠标、等待和滚动等基础动作都被统一规约在标准化的动作空间内。
在 EchoPath 的定义下,一条可重放的记忆不再是杂乱的日志,而是一个严密的结构体。每个记忆单元包含明确的任务意图键值,用于在面对新输入时完成高精度的匹配;它还包含前置条件契约,比如目标软件是否打开、初始界面是否就绪;在具体的操作节点上,系统会显式声明可变参数路径,界定哪些字段是允许根据新任务动态变更的(例如表单里的姓名、邮箱或查询起止时间),哪些是绝对固定的结构性操作(如点击展开菜单、快捷键保存、翻页)。
更为关键的是,每个鼠标指针动作并不直接依赖绝对坐标 $(x, y)$,而是将当时截取的目标局部图像块(Target Crop)及其周边的坐标上下文作为视觉证据打包存储。与此同时,记忆单元还带有生命周期元数据,记录该动作序列由哪一次真实任务的成功工件(Artifact)所验证,并在后续运行中持续记录其版本演进、修复分支、甚至故障隔离状态。
通过这种方式,智能体宿主面对新任务时,第一反应不是从头规划,而是像查询本地工具库一样发起调用。只有当任务意图匹配、当前桌面状态满足前置契约时,记忆重放引擎才会被激活;一旦发现关键界面不匹配或涉及非法字段篡改,系统会立刻拒绝直接重放,优雅降级回常规的模型单步规划流程。
IBTR 算法:跳过模型推理的视觉自适应重瞄
在实际操作中,阻碍轨迹直接复现的最大绊脚石就是 UI 坐标漂移。如果不能调用昂贵的多模态大模型逐帧寻找按钮,又该如何保证鼠标精准点中目标?EchoPath 给出的解法是基于图像的目标重瞄算法(IBTR)。

IBTR 的本质是将存储的历史坐标降级为“先验视觉线索”,而不是直接的执行目标。在重放某一指针步骤时,系统并不盲目下发历史坐标,而是调出该步骤保存的视觉证据小图,并在当前界面的截图对应区域及邻域展开高效的图像匹配定位。算法会评估匹配结果的置信度与唯一性:
如果在当前画面中找到了极高置信度且无歧义的最佳匹配区域,IBTR 会迅速计算出该元素在当前屏幕坐标系中的真实中心点,输出校正后的执行坐标,整个过程耗时仅为毫秒级,且完全发生在本地,无需消耗任何 Token。
反之,如果界面发生了大幅度改版、目标图标消失,或者页面中出现了多个视觉上难以区分的重复项导致歧义裕度超出安全阈值,IBTR 则会坚决拒绝盲目点击。此时,系统会将控制权交还给轻量级的局部 Grounding 修复模块,或者直接触发中断,回退到普通智能体的自主规划中。这种“能重瞄则重瞄、有歧义即止损”的防御性设计,让 EchoPath 彻底摆脱了传统录制重放脚本脆弱、容易盲目乱点的致命缺陷。
与目标重瞄相配合的,是严格的灵活输入重绑机制。企业日常业务经常是“动作骨架相同,但输入数值不同”。在重放时,大模型或规则引擎仅允许将新任务中的实体信息绑定到已声明的参数插槽内(如修改搜索框文本或替换文件保存路径)。如果重放过程中检测到任何针对固定骨架动作(例如试图修改一个非灵活字段、跳过确认窗口)的异常篡改,重放引擎会判定契约违规并终止执行。这为企业运行自动化任务提供了极高的安全防线与可审计性。
严苛测试:故意改变分辨率下的稳定性验证
为了验证 EchoPath 究竟是真正具备泛化校准能力,还是仅仅碰巧记住了屏幕像素,研究团队在标准操作系统评测集 OSWorld-Verified 上设计了一套极具说服力的“双遍(Two-Pass)”对比实验。
在第一遍阶段,智能体使用原生动作空间自主摸索并完成任务,经由外部工件校验器验证成功的轨迹,被压缩提炼为 159 个可执行记忆单元。在这个阶段,单任务执行往往需要 4 到 13 个操作步骤,Token 消耗中位数高达 57.2 万,单次任务中位耗时约 4.5 分钟。

到了第二遍重放测试,研究团队特意设置了一个极具挑战性的“反作弊”对抗条件:将整个运行环境的分辨率从第一遍录制时的 1920×1080 强制降低到了 1600×900。
在这样的分辨率突变下,任何简单复制历史坐标的传统脚本都会全军覆没。如果智能体能够直接重放成功,证明其内部的 IBTR 重瞄算法与状态门控确实在起作用。实验测试了涵盖 Codex、Claude Code 以及 Kimi Code 在内的多种底层模型,并与基于 Prompt 记忆增强的基线方法 Synapse 进行了全面对比。
测试结果呈现出极其显著的性能分水岭:
-
任务成功率保持高位:在 1600×900 的降分辨率环境下,基于 Codex 的 EchoPath 取得了 91.2%(145/159)的重放成功率,与需要全程调用大模型重新感知推理的 Synapse(91.8%)几乎完全持平。
-
Token 消耗出现断崖式下降:Synapse 由于每一步都要把屏幕和上下文塞给模型进行规划,完成任务的 Token 消耗中位数为 586,386;而 EchoPath 在执行过程中大部分步骤直接调用本地校验过的记忆重放,Token 消耗中位数骤降至 20,370,降幅超过 96%。
-
执行耗时大幅压缩:由于免去了大部分多模态推理等待,任务执行时间的中位数从基线的 315.7 秒大幅缩短至 127.5 秒,提速约 60%。
在多模态 Agent 领域,能在保持 90% 以上高成功率的同时,削减一个数量级的 Token 消耗并成倍压缩时间,这一数据足以证明“执行级记忆”相比“提示词经验库”在工程落地上的压倒性优势。
模块消融:抗干扰检索、高精度对齐与超低存储
除了核心任务的端到端比对,论文还对系统关键组件的边界性能进行了拆解测试,进一步揭示了这套记忆体系的可靠性支撑:
在记忆检索抗干扰测试中,研究人员向包含 159 条有效记忆的库中,人为注入了从 50 到 500 条来自真实任务的非目标活跃轨迹作为混淆项。即便干扰项堆叠至库容的数倍,EchoPath 的意图检索模块依然维持了 100% 的准确召回率,没有发生一次错误匹配或漏召;检索延迟仅从 200 毫秒左右微增至约 600 毫秒,证明其意图路由在企业积累大量工作流时具备优异的扩展能力。
在IBTR 视觉重瞄离线评测中,研究人员抽样了 200 个带视觉证据的指针操作案例。在未经缩放的原始截屏中,算法接受了 95.5% 的案例,且所有接受项的预测坐标偏差均为 0 像素;而在加入 0.6 至 1.6 倍随机尺度缩放的严苛对抗测试下,算法仍然准确识别并接受了 95.0% 的目标,其中接受项的位移偏差中位数依然牢牢锁定在 0 像素(97.5% 分位数偏差仅在 1.41 像素以内)。少数被算法主动拒绝的案例,全部集中在具有高重复度、缺乏局部独特特征的极度相似控件上,体现了该机制面对潜在错误时的克制性。
在状态门控与参数重绑方面,前置状态门对合法初始状态的接受率达到了 98%,而对跨应用的非法启动状态给出了 78% 的精准拦截;而在灵活输入测试中,50 组声明字段的替换全部成功生效,50 组针对固定骨架动作的非法越权篡改被系统 100% 拦截并驳回。
最后,就工程维护成本而言,得益于结构化的提取与局部视觉切片存储,单条完整任务记忆的本地物理占用极小。即使是包含近 30 个复杂操作的长链路任务,整条轨迹的资产包体积也普遍控制在 1 MB 以内。这意味着在本地磁盘构建包含成千上万个日常操作流程的企业级记忆库,存储开销也微乎其微。
从一次性探索到企业级自动化资产
回顾 Computer-Use 智能体在近两年的演进路线,学界与业界往往将关注点过分倾斜于提升基础大模型的单步视觉定位(Grounding)与逻辑推理极限。这固然为解决开放领域的长尾未知任务拓宽了可能,但在真实的企业生产环境中,无休止地让昂贵的模型在固定的业务界面上“重新思考”每一个像素,不仅在经济上难以持续,在稳定性与确定性上也无法满足严肃业务的审计要求。
EchoPath 的技术探索提供了一条极为务实的新思路:大模型的长处在于“开荒”,而一旦某条路径被真实的任务产物(如成功生成的报表、被正确保存的记录)所证实,系统就应当迅速将其沉淀为“资产”,转入低能耗、高确定的重放轨道。通过将轨迹编译为参数化的工具,配合轻量级图像重瞄跳过单步推理,智能体在处理高频重复工作时终于展现出了如同专用自动化工具般的敏捷与低廉。
对于后续的 GUI Agent 开发而言,这种设计正在推动交互范式从脆弱的端到端即兴发挥,走向模块化、可复用、可审计的系统工程。当大模型逐步接管复杂的现代桌面,如何安全地固化已习得的经验并低成本复现,或许正是智能体真正走出评测基准、大规模进驻企业生产后台的关键分水岭。