GMA:评测8大前沿模型,真实手机工作流成功率为何全线跌破20%?
Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

让大模型接管智能手机,替人类处理各类日常琐事,一直是具身与数字智能体领域最具吸引力的愿景之一。然而,现实与预期之间始终存在一道宽阔的鸿沟:现有的手机智能体往往能在单页面查找商品或发送单条信息等“原子操作”上展现出惊人的熟练度,但只要面对跨越多个应用、存在依赖关系且要求动态适应真实环境的完整工作流,系统的表现就会急剧崩塌。
ArXiv URL:https://arxiv.org/abs/2608.27477
为了精准刻画并探究这一瓶颈,阿里巴巴集团联合清华大学提出了面向通用移动智能体的高难度基准 GMA(General Mobile Assistants)。这项研究不仅构建了一个包含 7 款深度定制开源应用的多样化 Android 仿真生态,还设计了横跨四个难度层级的 300 项真实评估任务。在对包括 GPT、Claude、Qwen 系列在内的 8 款前沿大模型进行系统评测后,研究揭示了一个严峻的现状:在最贴近真实用户需求的复合型长链条工作流中,没有任何一款前沿模型的任务成功率能够达到 20%,表现最好的模型在该层级的平均得分也仅有 45.27 分。

更为关键的是,研究团队并没有将问题完全归咎于底层基础模型的能力上限,而是通过严格的受控消融实验证明:外围脚手架系统(Agent Harness)对上下文留存的策略以及对显式执行状态的追踪,在长轨迹任务中直接决定了智能体的表现下限。手机智能体想要在复杂场景中真正可用,仅靠堆叠模型参数远远不够,系统工程层面的交互治理同样至关重要。
打破玩具环境:7 款自研应用重构移动交互生态
过去几年中,AndroidWorld 与 MobileWorld 等基准为 Android 环境下的智能体评测奠定了坚实的基础,通过容器化模拟器与状态校验确立了可复现的实验范式。然而,这类基准受制于应用数量与功能广度,往往只能覆盖有限的日常工具或特定开源平台,难以还原当代移动操作系统庞杂、异构且相互割裂的真实生态。当智能体只需要在两三个界面风格高度统一的工具中跳转时,评测往往无法暴露其在面对动态复杂布局、多种交互模式以及真实网络服务延迟时的脆弱性。
GMA 在环境层面的突破,首先在于其深度自研并引入了 7 款基于开源项目重构的移动应用。这 7 款应用并不是简易的 Demo,而是完整模拟了移动互联网中最典型、高频的业务形态,涵盖即时通讯、本地音乐库、生活方式分享、周边探索/本地生活、外卖即时配送、综合电商以及旅行规划。

结合 Android 系统底层的短信、相册、日历等原生服务,以及此前基准中成熟的企业协作平台 Mattermost 和去中心化社交平台 Mastodon,GMA 组成了一个功能高度互补的移动应用集群。这种广阔的生态覆盖,使得构建多步骤、高内聚且跨业务域的真实用户工作流成为可能。例如,用户可以要求智能体根据即时通讯中收到的聚会提议,先去生活方式社区检索餐厅评价,再通过外卖或本地生活应用核对营业状态与配送范围,最后将关键日程写入日历并向好友回复确认。这种需求在日常生活中随处可见,但对智能体而言,每一个应用跳转都意味着交互界面的彻底切换与状态上下文的剧烈重构。
为了保证庞大应用生态在评测过程中的确定性与可复现性,GMA 在系统架构上提出了一套统一的声明式资产抽象机制(Declarative Asset Abstraction)。在传统的评测中,后端数据库的变化往往难以与前端界面快照完全同步,容易导致评测漂移。GMA 将用户联系人、聊天记录、日历日程、社媒动态、电商订单乃至差旅行程等异构数据,统一定义为强类型的资产单元(Asset)。
每一个测试任务的初始环境,均由这些资产的集合声明式定义,并通过应用专属的适配器(State Adapter)在容器重置后动态实例化。当任务需要恢复状态时,系统不仅会还原 Android 模拟器的快照,还会同步清空后端缓存、使过期会话失效,并确定性地注入预设资产。在结果校验阶段,框架直接比对底层资产的存在性、属性变更或删除状态,并结合任务提示中明确规定的严格文本约束进行确定性校验,彻底摒弃了易受不可控方差干扰的“大模型裁判”(LLM-as-a-Judge),确保了评测结果的严谨与可比性。
阶梯式能力剖析:从单点触控到现实复杂流
移动场景下的交互能力不是非黑即白的单点指标,而是一个高度分层的能力谱系。GMA 将设计的 300 个评测任务严格划分为四个逐级递进的难度层级,从而精准定位基础模型在哪个推理阶段开始出现能力衰退:
-
原子任务(Atomic,73 项):局限于单一界面或单一应用内的简单直接操作,例如在音乐库中暂停当前播放、在日历中查看明日安排,重点检验智能体对视觉 UI 元素的定位精度与基础指令的执行能力。
-
复合任务(Compositional,129 项):虽仍在单一应用内展开,但要求完成包含多个步骤的前后依赖序列,例如在电商平台中根据价格与销量筛选商品、添加购物车并填写指定收货地址,检验智能体在中短轨迹内的规划与执行一致性。
-
跨应用任务(Cross-Application,78 项):必须跨越两个或两个以上的功能域,涉及多应用间的上下文跳转与信息中继,例如提取即时通讯中他人发送的地址并在地图或外卖应用中检索相关服务。
-
现实任务(Realistic,20 项):直接还原现实生活中边界模糊、长步长、多约束的复合型需求,涵盖长程规划、动态信息检索、多条件约束满足与容错恢复,操作步数往往极长且依赖复杂的推理与多端状态协调。
所有任务均引入了双标注员的交叉质量复核,确保提示词语义明晰、难度标记准确,并严格核对预期目标与底层程序化验证逻辑的对应关系。在交互动作空间上,GMA 继承了标准 GUI 点击、滑动、输入等原生操作,并额外开放了 call_user(当指令参数缺失或产生二义性时向模拟用户反向提问)与 answer(显式提交特定格式的最终文本交付物)机制,逼真模拟了人类助理在面对不完整信息时的决策闭环。
评测深渊:前沿模型为何在真实工作流中集体失守?
研究团队在 GMA 基准上全面测试了 8 款具有代表性的前沿大模型,包括 Doubao-Seed-2.1-pro、Qwen3.7-Plus、Qwen3.8-Max、Gemini 3.5 Flash、GPT-5.5、GPT-5.6 Sol、Claude Sonnet 4.6 以及 Claude Opus 4.7。评测同时记录严格的任务完全成功率(Success Rate)以及反映部分完成进度的子任务平均得分(Average Score)。
评测数据展现出一条极其陡峭的能力滑坡曲线。在原子任务层级,各家前沿模型均展现出可圈可点的掌控力,部分顶级模型能够轻松达成高成功率;但在复合任务与跨应用任务中,成功率开始呈现阶梯式下滑;而到了最高难度的现实任务(Realistic)层级,整个评测格局发生了戏剧性的分化:没有一款前沿模型能够在现实任务上取得超过 20% 的任务成功率,即便加上未完全成功但达成部分子目标的折算,最高平均分也仅仅停留在 45.27 分。
更耐人寻味的是,简单场景下的王者在复杂场景下并不一定能够保持统治地位。评测显示,Qwen3.8-Max 在前三个相对规范、步骤较为明确的难度层级中均处于绝对领跑位置,但在最为棘手的现实任务层级,其绝对优势出现了明显收缩。相反,Doubao-Seed-2.1-pro 在现实任务层级斩获了全场最高的成功率,而 Claude Opus 4.7 则在现实任务中拿下了最高的平均得分(45.27 分),尽管这两款模型在前置的总体均分上并不是最拔尖的。
这一现象深刻揭示了当前移动智能体的发展痛点:基于静态感知与局部指令调优获得的高分,并不能无缝平移至长程开放的真实手机操作中。 真实场景充斥着跨应用的信息流转、突发的界面弹窗、动态渲染的列表加载以及多目标相互交织的逻辑约束,只要智能体在长轨迹的某一步骤发生幻觉或动作漂移,整条执行链条就会瞬间断裂。
此外,当研究团队按应用类别拆解智能体的平均表现时,发现模型在 GMA 新增的 7 款应用上的得分普遍显著低于常见的系统工具应用。在生活分享、本地探索、即时配送等重度依赖动态内容聚合与非标准瀑布流布局的应用中,智能体的感知理解与探索效率遭遇了断崖式下跌。这表明当前模型在常见基准上展现的“高智能”,在很大程度上依赖于对少数特定 UI 范式的过拟合,面对真实多元的应用生态时,其通用泛化能力依然极度欠缺。
决定成败的暗线:Agent Harness 的工程重构与消融
面对复杂长程任务的失利,单纯等待更大规模的基础模型预训练并不是唯一的解法。在软件工程等领域,围绕模型构建的外部交互支架(Agent Harness)已被证明能够数倍释放模型潜力。GMA 的核心贡献之一,便是在完全受控的环境与同一模型基准下,系统化消融了 Agent Harness 的关键组件,探究上下文留存策略与显式状态追踪对长程移动任务的重塑作用。
1. 上下文留存:视觉记忆与思考痕迹的边界
移动智能体在逐步操作时,屏幕界面在不断刷新,早期的信息会迅速滑出视口。为了探寻多模态视觉上下文的最优留存边界,研究人员基于 Qwen3.7-Plus 评估了保留不同数量历史屏幕截图对性能的影响。
实验数据显示,将保留的截图数量从 1 张增加到 8 张时,智能体的总体成功率从 43.33 稳步提升至 52.00,在现实任务上的平均得分更是从 9.97 显著增加到 21.44。然而,视觉窗口的收益存在明显的边际递减效应:当进一步将历史截图堆叠到 16 张时,整体平均分不升反降。盲目塞入过多未经提炼的高分辨率历史图像,不仅会加剧长上下文注意力分散,还会引入大量过期的视觉噪声。
与此同时,研究团队测试了去除“历史思考痕迹(Previous Thoughts)”的极端情况。在保留 2 张截图的基线中,一旦移除了过往步骤的推理过程,智能体的现实任务平均分直接从 11.00 跌落至 6.89。这一剧烈下滑说明,在视觉信息受限的情况下,语言形式的历史反思与推理链条是维系任务长期目标的唯一纽带。
更具实用启发的是“图像转摘要(Captions)”策略:当淘汰掉旧截图时,系统并不直接将其丢弃,而是将其转化为紧凑的文本描述予以留存。在同样的双图设定下,引入文本摘要后,智能体在现实任务上的平均得分从 11.00 飞跃至 34.60。这证明将高密度的视觉历史压缩为轻量化的符号语义,是在长程交互中避免灾难性遗忘的极高性价比方案。
2. 显式状态追踪:对抗长程遗忘的认知锚点
除了被动留存历史对话,智能体能否像人类一样,主动维护一张动态的“工作记忆看板”?GMA 借鉴任务状态表征(Task-State Representation)机制,在 Harness 中构建了显式状态追踪模块,强制智能体在每一步更新全局需求清单、子目标完成进度以及当前执行状态。
![]()
实验对比清晰地揭示了状态追踪与视觉上下文之间的互补关系。在原子、复合与跨应用等前三个层级中,随着上下文允许保留的截图数量增加,显式状态追踪带来的边际提升逐渐缩小,说明丰富的视觉回溯已经可以部分替代显式记录的作用。
然而,在最具挑战性的现实任务中,局势发生了根本性逆转。即便在视觉上下文极为充裕、保留了整整 16 张历史截图的高配设定下,加入显式状态追踪依然能够将现实任务的平均得分从 23.81 推高至 37.72,带来高达 13.91 分的强劲净收益。这一结果表明,对于逻辑深度极高的复合长任务,即便所有历史像素都清晰可见,模型依然难以仅凭隐式自注意力理清错综复杂的跨步骤依赖。显式、结构化的状态看板,充当了模型在复杂探索过程中的认知锚点,防止其在冗长的调用链条中迷失核心方向。
3. 模态适配的异构性:没有放之四海皆准的脚手架
Harness 的机制设计是否能够直接跨模型无感迁移?GMA 给出了否定的答案。在对比 Qwen3.7-Plus 与 GPT-5.6 Sol 的实验中,研究团队测试了两种不同的状态追踪范式:一种是无拘无束的自由文本状态维护(Free-form),另一种是强制遵循严格字段模板的结构化状态更新(Structured)。
实验发现,底座模型的特异性极大程度地左右了 Harness 的生效方式。对于指令遵循极其严格、但在泛化联想上相对拘谨的模型,强制性的字段结构反而成了多余的推理束缚,自由格式的草稿本往往能取得更出色的任务流转效率;而对于在发散探索中容易偏离轨道的模型,结构化的严密约束则是保障其执行不脱轨的最佳护栏。这一发现打破了业内对“通用 Agent 架构”的盲目预设,警示研究者在未来设计移动端系统时,必须针对底层基座的认知偏置与推理特性进行深度定制化的 Harness 协同设计。
移动 Agent 走向实用的深水区
GMA 的提出不仅为学术界与工业界提供了一套高度拟真、严密可复现的评测基础设施,更用扎实的实验数据为当前移动端智能体的演进路线敲响了警钟。
从评估维度来看,评测基准必须跳出对单点点击成功率的盲目追求。原子操作的高分极易制造智能体已经“足以上岗”的虚假繁荣,只有将模型投掷于应用边界模糊、信息碎片化分布、容错空间极小的真实多步骤工作流中,才能暴露其在长期规划与环境适应上的深层短板。
从技术路径来看,GMA 的消融结论明确昭示:大模型时代的移动助理,其本质是一个软硬件与算法紧密耦合的系统工程。在底层模型的多模态感知与复杂推理持续迭代的同时,上层的上下文路由、历史状态摘要压缩、显式任务看板构建以及与特定底座相适配的交互治理支架,构成了决定智能体能否跨越商用门槛的核心拼图。在通往真正能够替人类打理日常琐事的手机超级助理之路上,这场深入系统工程腹地的攻坚才刚刚拉开序幕。