AppSim-Bench:告别真机随机噪音,19个手机Agent最高成功率仅50.27%

APPSim-Bench: Bridging Real-world Apps and Reproducible Evaluation for Mobile GUI Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

AppSim-Bench:告别真机随机噪音,19个手机Agent最高成功率仅50.27% 论文图示

在多模态大模型与具身交互的交叉演进中,让 AI 自主操作智能手机正成为智能体(Agent)研究最具落地潜力的方向之一。从订外卖、打车到跨应用检索信息,手机移动端图形用户界面(Mobile GUI)涵盖了现代人最高频的数字生活场景。然而,如何客观、可复现地衡量手机端 GUI Agent 的真实能力,长期以来横亘着一道难以逾越的鸿沟:采用简化或开源的玩具应用做评测,无法反映真实商业软件的复杂排版与多层级交互;直接在真实商业 App 上动态评测,又会被个性化推荐、开屏广告、账号状态以及服务端动态数据彻底打乱评测基准的一致性。

ArXiv URL:https://arxiv.org/abs/2609.07712v1

由来自华中师范大学以及 Acrab AI、Agentic Labs 等机构的研究团队近期发布了评估框架 AppSim-Bench。该基准针对真实移动生态中“高拟真度”与“可复现性”不可兼得的死结,给出了全新解答。研究团队通过“代码生成智能体辅助构建 + 人工多轮校验”的工作流,重构了涵盖微信、京东、高德地图、Amazon、Uber Eats 等 17 款中英文主流高频应用的交互沙箱,并构建了包含 557 个复杂任务的评测集。AppSim-Bench 既精准复刻了真实移动软件的核心业务逻辑与界面层次,又实现了后端数据和初始状态的完全确定与重置,将评测范式彻底推进到无噪音的结果级验证。

在评测涵盖 Claude-Opus-4.7、GPT-5.5、Gemini-3-Pro 等前沿通用大模型及多款 GUI 专用微调模型的 19 个 Agent 之后,这项研究揭示出一个严峻的现状:移动端自主交互任务距离真正可用依然非常遥远。评测中表现最好的模型最终任务完成率也仅达到 50.27%,且有多达 28.55% 的任务在所有模型面前全军覆没。随着任务步数拉长、引入多步数值推理或遇到复杂的界面分支,即便是最顶尖的商业模型也会迅速陷入动作臃肿、原地打转乃至步数耗尽的困境。

AppSim-Bench 的设计动机与整体架构

为什么现有手机 Agent 评测总是“测不准”?

评估一个智能体是否会用手机,直觉上似乎只需给出一句自然语言指令(例如“在京东上帮我找一款 300 元以内评价最高的降噪耳机加入购物车”),然后观察其能否完成。但在实际评测工程中,这一过程始终饱受两类技术路线的局限。

早期的静态评测方法主要依赖预先录制的屏幕截图序列和人类标注的操作路径。这种“动作轨迹匹配(Trace-based Verification)”存在致命的“多路径缺陷”:在移动应用中,达成同一目标通常有多种合理路线。比如添加商品至购物车,用户可以先进入商详页再点击购买,也可以在列表页直接通过快捷加购按钮完成。如果 Agent 走了一条完全正确但未经标注者走过的路径,静态评估器就会直接判错。此外,静态截图无法动态响应 Agent 的任意点击输入,Agent 一旦走错一步便无法尝试自主纠错。

为此,以 AndroidWorld 为代表的动态交互式基准逐渐占据主流,将评测重心转向根据系统底层或数据库状态变化的“结果验证(Outcome Verification)”。但这一代基准往往又走向两个极端:要么基于极度简化的开源甚至自制系统应用,界面简单、层级单一,与现代商业软件极其复杂的 UI 设计相去甚远;要么直接在连网的物理真机上运行真实的商业 App。

在联网真实 App 上评测,带来了无法控制的“环境随机性(Environmental Stochasticity)”。如上方架构图左侧所示,即便是同一个用户在不同时间或不同设备上搜索,推荐算法吐出的联想词和瀑布流排版截然不同;电商应用的库存状态、活动浮窗、个性化优惠券,甚至是社交软件的动态消息流都在实时变化。前一个模型测试时商品尚有库存,后一个模型测试时该商品可能已售罄下架,这从根本上违背了基准评测“对照实验、环境确定”的基本原则,导致不同模型横向对比的公信力大打折扣。

AppSim-Bench 的破局思路:可控模拟沙箱与三类确定性验证

AppSim-Bench 的核心机制在于:既不退回到简陋的玩具 App,也不屈服于真实云端服务的动态噪音,而是打造任务相关的可控模拟应用(Controllable Simulated Apps)。

在生态覆盖上,该基准横跨中文与英文两大高频应用生态,共挑选了 17 款日常使用率最高、交互逻辑极其复杂的代表性产品:

  1. 中文生态(9款):微信(WeChat)、京东(JD)、小红书(RedNote)、腾讯会议(Tencent Meeting)、高德地图(Amap)、携程(Ctrip)、哔哩哔哩(Bilibili)、饿了么(Ele.me)、网易云音乐(NetEase Cloud Music)。

  2. 英文生态(8款):Amazon、Booking.com、Instagram、Spotify、Uber Eats、WhatsApp、YouTube、Zoom。

这些应用覆盖了社交即时通信、电商导购、酒旅出行、外卖配送、地图导航、音视频流媒体和协同办公等移动端核心领域。为了支撑兼具深度与复杂度的评测,研究团队设计了 557 个具有代表性的自然语言任务。其中中文生态包含 283 个任务,英文生态包含 274 个任务,两类语言生态的体量相当。

构建如此规模且贴近原版商业 App 的交互沙箱,代码量和还原成本极高。研究团队采用了一种人机协同的敏捷构建机制:首先由人类开发者划定测试任务边界,定义完整的后端数据结构模型(Schema)、页面层级关系以及核心业务流路径的真实截图;随后利用 Coding Agent 在这些结构化约束下自动生成前端视图组件、数据绑定与页面跳转逻辑;最后由人类工程师介入进行代码执行与多轮交互修正。这种闭环确保了生成的模拟 App 既完整继承了真实应用的交互手感和组件布局,又将所有数据后端牢牢锚定在本地。每次评测启动前,沙箱能够一键清空并重置为绝对一致的初始状态。

在视觉逼真度上,该方案经受住了严格的人类双盲测试。7 位标注人员在 11 轮测试中,对比了真实 App 资产与模拟 App 资产在静态单截图与连续交互序列下的视觉表现。统计结果显示,在做出明确二选一判断的样本中,受试者将模拟 App 误判为真实应用的比例均在 50% 上下徘徊,且存在相当高比例的“无法判定(Undecided)”。这从侧面证明了 AppSim-Bench 在视觉和排版层次上达到了足以欺骗人眼的工业级保真度,消除了 Agent 因界面失真而产生的域偏移。

在评测判定环节,AppSim-Bench 彻底规避了路径束缚,全面采用基于结果的自动化确定性验证。研究团队将 557 个任务抽象为三类明确的判定协议:

19 款 Agent 全景摸底:顶尖模型依然频频“触顶”

为了全面摸清当前大语言模型与多模态智能体在移动 GUI 交互上的真实水位,研究团队选取了 19 款代表性 Agent 展开全面横评。评测矩阵既包括来自五大模型家族的 15 款通用前沿模型(GPT 系列、Claude 系列、Gemini 系列、通义千问 Qwen 系列、豆包 Doubao 系列),也包括 4 款专门针对 GUI 操作后训练(Post-trained)的专用 Agent(MobileAgent-v3.5、UI-TARS-1.5-7B、AgentCPM-GUI 以及 V-Droid)。

所有模型均在标准的 Android 13 仿真环境、统一的 1080×1920 分辨率下进行零温(Temperature=0)测试,单任务交互上限截断为 50 步。

评测结果给出了一个异常清醒的信号:自主移动操作对目前最聪明的大模型而言,依旧是一块难啃的硬骨头。

在整体准确率层面,位列第一梯队的 Claude-Opus-4.7 取得了全场最高的准确率,但也仅达到 50.27%,勉强迈过及格线的一半;Gemini-3-Pro(49.73%)、GPT-5.5(48.65%)和 Gemini-3.1-Pro(48.47%)紧随其后,均徘徊在 48% 到 50% 之间。这说明即便是当前全球最强大的多模态通用底座,在面对日常手机复合任务时,也有约一半的场景无法稳定闭环。

通用模型呈现出清晰的能力断层。GPT-5 的成功率降至 33.39%,而稍早一代的 Gemini-2.5-Pro 则直接滑落到 17.24%。这印证了 AppSim-Bench 具有极高的区分度,不仅能辨别顶级模型之间的微小演进,也能迅速击穿基础能力不足的模型。

一个更值得学术界与工业界警惕的现象来自 GUI 专用模型的表现。理论上,经过大量 GUI 轨迹与界面定位专项微调(SFT/DPO)的模型,应当在手机界面上如鱼得水。但在 AppSim-Bench 这种要求端到端解决实际问题的严谨评测中,GUI 专用模型并未展现出预期中的优势。专用阵营中最强的多智能体系统 MobileAgent-v3.5 最终准确率仅为 31.42%,而开源社区广受关注的 UI-TARS-1.5-7B、AgentCPM-GUI 和 V-Droid 均低于 23%。这表明,单凭对手机界面组件的坐标微调或机械模仿标注轨迹,根本无法支撑在复杂业务流中的动态决策与逻辑长链条推导。限制移动端智能体的核心瓶颈,依旧是底层基础模型的通用视觉推理与规划能力。

从任务覆盖率的深层分布看,共有 28.55% 的任务在参与测试的全部模型中没有任何一个能够解出;与此同时,能被所有模型共同完成的任务比例极其严苛,仅有 0.36%。这说明当前的手机 Agent 并非在个别任务上偶发失误,而是在面临特定类型的移动端操作时,存在结构性、系统性的共性短板。

此外,应用生态的语言特征也带来了显著的性能落差。主流顶级模型在中文 App 上的表现普遍好于英文 App,领先模型在中文任务上的准确率大多在 59% 至 60% 之间,而在英文应用上却只有 39% 至 41%。在单语言场景下的良好表现,并不能直接迁移泛化至另一个软件生态中。

为什么会失败?长程上下文与数值推理的双重阻击

为了进一步定位 Agent 在真实操作中的薄弱环节,研究团队从任务长度、推理维度和执行效率三个层面进行了细颗粒度的错误解构。

首先是交互步数对 Agent 规划能力的极端考验。AppSim-Bench 将任务按照人类参考执行步数分为三档:短任务($\leq 5$ 步)、中等任务(6–10 步)和长任务($\geq 11$ 步)。评测显示,随着任务所需交互步数的增加,所有模型的准确率均呈现出毫无例外的单调递减趋势。

在 $\leq 5$ 步的短程任务中,顶尖模型的准确率普遍能够维持在 60% 左右(如 GPT-5.5 达到 63.83%)。但一旦任务长度扩展到 6–10 步,模型性能开始剧烈下滑;而到了 $\geq 11$ 步的长链条任务中,即便是综合表现最佳的 Gemini-3-Pro 也只能维持 33.33% 的成功率,其余所有前沿模型全部被压缩至 20% 以下。GUI 专用模型在这类长程任务上更是出现了灾难性的崩溃:AgentCPM-GUI 与 V-Droid 在长任务上的完成率直接跌落至 0.00% 和 0.74%。

长程任务之所以成为所有 Agent 的“百慕大三角”,是因为 Agent 不仅要保证每一步的屏幕元素定位准确,还必须在滚屏、多级页面穿梭、弹窗阻断的过程中持续追踪已完成的中间状态,并将当前屏幕画面与初始的用户长目标对齐。任何一步的中间动作偏移或界面认知偏差,都会像雪崩一样层层累积,最终导致整条交互路径彻底偏航。

其次是复杂的数值推理任务让界面交互难度成倍放大。AppSim-Bench 专门设计了 183 个包含数值推理属性的子任务,涵盖四类具体操作:

实验表明,不同模型在这些细分能力上展现出了高度分化的特征。Claude-Opus-4.7 在计数和阈值过滤类任务中保持领先,而 GPT-5.5 则在复杂的算术计算操作上占据上风。弱一些的模型在阈值过滤子项上甚至出现了跌至 4.76% 或 9.52% 的惨烈状况。

极具启发性的是人工错误归因分析:研究人员对数值推理任务中失败的 1,287 个交互步骤进行了逐帧排查,发现由视觉感知错误(如无法识别界面上的价格数字、OCR 识别错位等)导致的失败仅仅只有 1 例,其余所有的失败全部发生在决策推理阶段。换言之,大模型并不是“看不清”屏幕上的数字,而是在动态操作界面时,无法在多步交互中稳定维护数学约束、比较逻辑与记忆状态。

动作开销与死循环:Agent 效率的隐形黑洞

除了最终是否“成功做完”,执行过程中的资源消耗与动作效率同样是衡量 GUI Agent 能否真正落地的关键标尺。研究团队引入了动作开销(Action Overhead, 记为 ActOH)指标,即在所有成功的任务轨迹中,模型实际花费的有效动作数与人类标注参考步数的比值。

数据分析展现出一个反直觉的现状:当前 Agent 的操作路径极其冗余。即便是被判定为成功的任务,领先模型所消耗的操作步数通常也是人类专家的 1.5 到 2 倍左右。而在未成功的任务中,大量的交互轨迹直接触发了 50 步的上限预算耗尽(Budget Exhaustion)。

更严重的问题是“原地打转”的交互死循环。统计表明,在全部耗尽 50 步预算的失败轨迹中,有高达 1,690 次交互记录包含了至少连续 3 次完全相同的规范化动作;更有 1,347 次交互包含了至少连续 5 次的重复动作。许多性能落后的 Agent 在遇到界面没有预期响应、或者弹出意料之外的系统提示时,缺乏有效的错误恢复与反思机制,往往会机械地在同一坐标反复点击,或是陷入毫无意义的上下疯狂滑动,直至步数完全耗尽。这种在动态环境中缺乏自愈(Self-healing)与回溯(Backtracking)机制的现状,构成了现阶段智能体落地工程中最致命的隐患。

迈向可靠交互:AppSim-Bench 带来的行业启示

从评测框架的设计哲学来看,AppSim-Bench 的价值不仅在于指出了当前多模态模型的不足,更在于确立了移动端 GUI 评测的新标准。它证明了评测环境无需在“玩具化的开源应用”与“不可控的云端真实 App”之间做极端取舍。借助现代软件工程与代码 Agent 的力量,在完全受控的本地沙箱中高度还原真实商业应用的交互逻辑与视觉形态,不仅是完全可行的,也是实现公平可复现评估的必由之路。

这项研究对未来移动端智能体的发展给出了极具针对性的演进方向:

  1. 摆脱单纯的界面定位微调:单纯追求在单张截图中框准按钮或文本框已经不再是决定性瓶颈,未来必须将重点转向交互过程中的长程状态记忆、动态任务规划以及应对突发异常的鲁棒恢复策略;

  2. 强化移动交互场景下的量化推理:Agent 需要学会在滑动翻页中动态汇总数据,克服在操作过程中丢失数值约束的通病;

  3. 提升动作执行效率:建立主动终止和反思机制,杜绝盲目重复点击导致的步数耗尽,避免将计算资源挥霍在无效轨迹中。

当学术界与工业界不再被波动剧烈的在线测试环境所误导,能够在一个确定、严密、高保真的数字化沙箱中审视每一次失败点击时,那个真正替人类自如操作手机的个人 AI 助理,才算真正迈出了稳健的第一步。