GUI Agent最新综述!南大等剖析336篇文献:从单步模型到闭环软件工程
Software Engineering for and with GUI Agent

在多模态大模型的驱动下,图形用户界面智能体(GUI Agent)已经成为当下最受瞩目的研究方向之一。从能够自动点按手机屏幕的手机助手,到在浏览器中跨页面比价下单的 Web Agent,再到直接接管鼠标键盘、操作复杂办公软件的桌面系统,研究界在短短两三年内交出了密集的答卷。
ArXiv URL:https://arxiv.org/abs/2608.09278v1
但繁荣的表象之下潜藏着巨大的工程脱节。绝大多数在学术基准(Benchmark)上表现惊艳的 GUI Agent,一旦脱离预设测试集进入复杂的真实环境,就会立刻表现得极其脆弱:页面渲染慢了两秒导致点击落空、弹出一个未预料到的免责声明窗口导致流程锁死、遭遇连续误操作后缺乏状态回滚手段,甚至在没有安全边界的情况下误删核心数据。
来自南京大学与慕尼黑工业大学的研究团队在一篇系统综述中给出了关键判断:GUI Agent 已经不再是一个孤立的多模态感知或单步动作预测模型,而是演变成了一个耦合了环境感知、时序推理、执行反馈、错误恢复与人工干预的“闭环交互软件系统”。
该研究全面复盘了 2018 年 1 月至 2026 年 4 月期间的 336 篇相关文献。作者指出,整个领域目前过度痴迷于通过增大模型尺寸或堆叠 Prompt 来刷高任务成功率,却严重缺乏经典软件工程(Software Engineering, SE)维度的审视。缺乏明确的接口契约、缺少运行时的容错与回滚设计、忽视部署后的可观测性与隐私安全,是阻碍 GUI Agent 从“炫酷 Demo”跨入“生产级可用”的真正瓶颈。

爆发背后的结构性失衡:336篇论文背后的研究版图
要理解当前 GUI Agent 的技术断层,首先必须厘清过去几年该领域的演化轨迹。文献统计显示,GUI Agent 研究呈现出极端的爆发式增长特征:在全部 336 篇论文中,2024 年之前发表的仅有 19 篇,而 2024 年至 2026 年初短短两年多时间里,文献数量激增至 317 篇,仅 2024 与 2025 年合计便贡献了 286 篇。这种急剧加速主要得益于两项技术催化剂:一是 CogAgent、SeeClick 等专有界面对齐模型与通用多模态大模型的成熟;二是 WebArena、AndroidWorld、OSWorld 等交互式全流程评测基准的建立。

从落地平台来看,研究分布呈现出明显的移动端和 Web 端倾斜。统计显示,移动端相关研究占据 186 篇,Web 端占据 158 篇,而桌面环境的研究仅有 92 篇。这种偏好在工程上很容易解释:移动端 App 的动作空间相对规整,且存在较为标准化的视图层级(View Hierarchy);Web 环境则有 DOM 树与成熟的浏览器自动化协议(如 Playwright、Puppeteer)支撑,开发者极易搭建低成本的受控沙盒。
桌面系统虽然更加贴近真正的全功能计算机使用(General Computer Use),但由于其状态分散于不同窗口、多进程、本地文件系统及底层操作系统调用中,难以建立统一的抽象契约,研发难度最高。然而,真正的生产力场景几乎都无法绕开桌面端这种复杂跨应用流转的环境,这种平台偏置反映了学术界当下更倾向于在“易于形式化”的环境中寻找突破口。
在界面的输入模态方面,“纯视觉化”正成为绝对的主流。全库中有 277 篇论文依赖屏幕截图进行环境感知,其中 148 篇论文甚至将纯截图作为唯一的输入源。依靠视觉感知能够赋予 Agent 极高的平台通用性,使其免于依赖不同操作系统参差不齐的可访问性接口(Accessibility API)。但从系统工程角度看,纯像素输入将极大地增加状态重构的不确定性,丢掉了原本在底层结构化数据中清晰可见的元素禁用状态、链接目标和语义层级,迫使下游推理引擎在一个信息被严重压缩且包含视觉噪点的空间内进行盲猜。
运行时架构的脆弱真相:缺失的自愈与防线
当研究者声称“构建了一个 GUI Agent 架构”时,他们究竟交付了什么?该综述深入拆解了论文集中的 145 个具体框架,揭示出现有架构在工程完整度上的严重倾斜。

在典型的模块划分中,感知(Perception)、决策(Decision)和执行(Execution)构成了几乎所有系统都有的基础闭环骨架:
-
感知层构建状态:通过视觉模型定位图标、借助 OCR 识别文字、融合视图树以提取候选交互元素;
-
决策层下发意图:大模型根据用户初始 Prompt 和当前步的界面表征,生成诸如“点击坐标 $(x, y)$”或“在输入框键入文本”的单步指令;
-
执行层驱动外设:调用系统底层驱动或注入事件触发鼠标和键盘操作。
然而,一旦任务拉长为几十步甚至上百步的“长程任务(Long-horizon Task)”,仅靠这三步骨架就会迅速崩溃。为了应对复杂目标,部分进阶框架开始引入规划(79 个框架)、外部记忆检索(88 个框架)以及自我反思(61 个框架)。但这种“高级认知功能”的加入,并未弥合运行时底层的工程裂痕。
综述特别强调,当前大部分框架在软件工程的核心防护体系上几乎处于“裸奔”状态:
首先是异常恢复(Recovery)机制极度匮乏。在实际使用中,网络延迟抖动、广告弹窗拦截、异步加载失败是界面交互的常态。传统软件工程依赖严密的超时重试、异常捕获、状态快照与回滚事务(Rollback Transaction)。但在当前的 Agent 框架中,一旦动作执行后界面未发生预期改变,系统往往只会将其当成“感知错误”,任由大模型反复发起相同的无效操作,最终耗尽 Token 额度并宣告崩溃。系统缺乏对“动作可逆性”的判断,无法在执行不可逆的写操作之前建立检查点。
其次是人工介入(Human Escalation / Handoff)通道的闭塞。现存大多数 Agent 都被假定为“全自动执行者”,缺乏在关键决策点主动向用户求助、请求凭证授权或请求纠偏的机制。面对关键分歧或低置信度状态,Agent 要么选择硬着头皮盲猜,要么直接抛出未捕获的系统异常彻底退出。一套健全的系统应当能够明确识别自身能力的边界,在必要时刻低成本地退让为半自主或受监督协同模式。
最后是审计与安全执行机制的缺位。目前鲜有框架实现系统级的操作日志追踪链与细粒度权限沙盒。当 Agent 具备截屏与键鼠控制权后,它同时暴露在间接提示词注入(Indirect Prompt Injection)与敏感数据外泄的双重威胁之下。恶意网页上的一行隐藏文本,就可能诱骗 Agent 将用户的本地敏感文档上传至第三方服务,而当前的 Agent 运行时既没有策略隔离层去拦截异常网络流量,也没有行为合规引擎去审查危险系统调用。
评测的“虚高幻觉”与生命周期盲区
软件工程的核心基石之一是“可重复、可比拟的验证与测试”。这篇综述对当前 GUI Agent 的评测生态提出了极其犀利的批评:当前的论文看起来指标飞涨,但测试结论往往无法转化为真实可用性。
最核心的问题在于评测指标过度聚焦于单一的“任务成功率”(Task Success Rate)。在多数基准测试中,评估器只检查最终结果是否吻合,例如某个表单是否提交、指定目录是否存在某个生成文件。这种唯结果论的评测体系忽略了极其致命的过程成本:Agent 究竟花费了多少次试错?是否在后台留下了大量未清理的脏数据?更关键的是,许多基准测试在每步操作后会给予极强的理想化环境反馈,甚至直接重置环境状态,掩盖了模型在缺乏环境重置权限时的雪崩效应。
此外,不同研究团队在评测协议上的随意性,导致成果之间几乎无法横向复现与比较。同样是 60% 的成功率,团队 A 可能使用了精心优化的结构化元素字典与限制型动作空间,而团队 B 则是直接在原生桌面全分辨率无约束环境下运行;有的研究允许模型在单步执行中重试 5 次,有的则严格限制单步超时。由于缺乏标准化的环境测试夹具(Test Fixtures)与统一的成本敏感型指标(考虑时延、Token 消耗、不可逆误操作代价),排行榜上的高分往往充斥着评测协议特异性带来的虚高。
如果将视野拉大到整个软件生命周期(Software Lifecycle),这种脱节更加明显。现阶段的研究几乎完全停留在“研发阶段的模型调优与基准打榜”,对生命周期中的其他阶段闭口不提:
-
缺乏基准之外的自动化变异测试(Mutation Testing):界面微调(例如按钮颜色微调、布局向右偏移 10 像素、应用由英文切换为中文)是否会导致整个推理链完全瘫痪?
-
缺乏部署后的可维护性考量:底层支撑大模型更换版本后,原本提示词中构建的脆弱假设如何平滑迁移?
-
缺乏运行时的可观测性工程(Observability):当线上系统发生故障时,开发者是否能够根据可审计的日志回放当时界面的状态切片与注意力分布,快速定位是感知模块对齐失败、规划器逻辑死锁、还是底层环境驱动崩溃?
走向工程化的闭环:GUI Agent 的突围路径
针对上述系统性缺陷,综述在最后梳理出了一套面向未来的软件工程研究议程。GUI Agent 若要真正走向可信赖、可维护、安全且可部署的生产系统,研究范式必须从“模型单兵突击”转向“系统工程协同治理”。
第一,构建具备契约与容错能力的可靠执行机制。 未来的 GUI Agent 架构需要引入传统分布式系统中的鲁棒性原则。必须为 Agent 与界面之间建立清晰的“接口契约”,显式区分幂等操作与非幂等操作(如“只读滚动”与“确认支付”)。系统需要构建内置的状态快照与补偿机制(Compensating Actions),在出现操作偏移时能够自动执行逆向操作返回上一确定状态,而非仅仅依赖模型自身的自省纠错。
第二,实现神经推理与确定性控制的解耦协同。 将所有决策完全托管给端到端的大模型既不经济,也不可靠。成熟的 GUI 运行时应该是一个混合架构:底层依托确定性的系统挂钩、布局解析引擎和硬编码安全策略过滤器;顶层大模型仅负责高维语义意图解析与动态任务分解。凡是能用确定性脚本、API 或本地规则高效稳定解决的操作,都不应当消耗非确定性的神经模型调用。
第三,引入生命周期中心化测试与深度可观测性。 测试不能仅仅依赖公开的静态基准集。研究界与工业界需要借鉴模糊测试(Fuzzing)理念,引入针对界面的自动化对抗测试工具,动态生成扰动窗口、界面抖动、网络异常和恶意提示注入样本,系统性评估 Agent 系统的崩溃边界。在系统部署层面,必须建立原生的可观测性标准,将截屏感知流、规划决策树、底层调用事件与用户反馈结构化对齐,为后续审计、模型迭代与离线回归测试提供确定性数据资产。
第四,探索成本与风险敏感的人机共生治理。 摆脱“全自动等同于高级”的执念。工程落地的 GUI Agent 应当具备自我置信度评估能力,结合操作的潜在风险等级(例如涉及财务支付、系统配置重置或隐私凭据暴露),动态调整自主度阶梯。通过设计低认知负担、高交互效率的人机交接界面,让用户在关键路径上保留最终的仲裁权与控制权。
南京大学与慕尼黑工业大学的这项研究为过热的 Agent 赛道注入了一剂清醒剂。它清晰地表明,打造一个真正可用的 GUI Agent,从来都不是一个单纯靠把基础模型刷大、把多模态基准跑满就能自然解决的问题。只有当计算机科学界重新捡起严谨的软件工程工具箱,将架构容错、生命周期测试、安全沙盒与可观测性深植于每一次点击与输入之中,GUI Agent 才能真正从学术圈的演示原型,蜕变为改变人机交互范式的生产力基石。