哈工大提出KnowAct-GUIClaw:自进化记忆框架,MobileWorld胜率达64.1%!
KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

随着大语言模型能力的飞跃,智能代理(Agent)正在经历从一次性问答机器人向状态持久、可长期运行的个人桌面和手机助手的关键转型。然而,真实的设备生态往往不提供完美结构化的 API 接口,很多高价值任务要求系统直接在图形用户界面(GUI)上进行复杂交互。无论是跨应用的数据迁移,还是处理随机弹出的权限对话框,都要求系统具备类似人类的视觉定位能力和时序决策能力。
ArXiv URL:https://arxiv.org/abs/2607.12625v2
现有的智能代理框架(例如 OpenClaw 等)在处理此类需求时暴露出严重的瓶颈。它们不仅缺乏跨平台 GUI 交互的深度支持,更致命的是,这些系统“没有记忆”——每次执行任务时都在重复试错,无法从过往的交互经验中自我进化。为了打破这一僵局,哈尔滨工业大学(Harbin Institute of Technology)主导的研究团队提出了一种全新的代理设计范式:“深度认知,完美执行(Know Deeply, Act Perfectly)”。
基于该理念,团队构建了 KnowAct-GUIClaw 框架。这并非又一个简单套壳的屏幕点击器,而是一个具备自进化记忆系统和技能库的双层协同框架。它通过宿主代理(Host Agent)进行高层认知和调度,通过 GUI 子代理负责底层的精准操作。实验数据证明了这种架构的统治力:在长周期、跨应用为主的 MobileWorld 基准测试中,结合开源 Kimi-2.6 模型的 KnowAct-GUIClaw 实现了 64.1% 的压倒性胜率,不仅远超基础大模型,更击败了 GPT-5.5 和 Seed-2.0-Pro 等闭源系统。

将 GUI 操作视为一场盲人摸象的决策
要理解 KnowAct-GUIClaw 为什么要采用如此复杂的双层结构和记忆系统,首先需要认清目前纯视觉 GUI Agent 面临的现实困境。当前业界有一种简单的直觉做法:直接把一个能够识别屏幕截图的视觉模型塞进代理框架中,让它看着屏幕一步步点。但研究团队指出,这种做法在长线任务中极其脆弱,效率也极低。
这种脆弱性源于四个底层缺陷。第一,模糊的用户指令往往跨越多个独立的应用程序,单一的视觉模型很难在漫长的跳转中记住中间抓取的数据,甚至会凭空捏造目标应用的名称。第二,GUI 观察在本质上是不完整的。模型看到的每一帧截图、获取的每一个可访问性树(Accessibility Tree),仅仅是设备底层状态的一个切片。系统其实是在一个部分可观测马尔可夫决策过程(POMDP)中挣扎。第三,过去的框架是“失忆”的。哪怕代理在某个 App 的隐藏菜单里摸爬滚打了上百次才找到入口,一旦任务结束,这些宝贵的成功或失败轨迹就被丢弃,下次还得从头开始瞎蒙。第四,纯视觉点击完全忽视了现代操作系统的“快车道”,例如安卓的深层链接(Deeplink)或系统意图(Intent),这让本可以一秒直达的操作变成了冗长的逐屏寻找。
双层协同与 Know-Route-Act-Reflect 架构
针对上述问题,KnowAct-GUIClaw 重新定义了系统分工。它将 GUI 自动化看作是一个强大“宿主(Host)”与一个轻量级“执行器(Executor)”之间的协同作战。宿主代理掌握全局:它维护对话上下文、用户画像、工作区记忆,并决定“要做什么”;而 GUI 执行器则只负责屏幕级的感知、动作标准化和轨迹记录,决定“怎么做”。这种解耦意味着系统只有在真正需要视觉交互时才会启动庞大的多模态感知模块,而在能够使用底层接口或已知技能时,则直接走捷径。
为了将这种协同具象化,作者设计了一条被称为 Know-Route-Act-Reflect 的闭环执行栈,将静态的视觉理解转变为动态的经验利用。

在任务下达后的第一阶段(Know,知识检索),系统在产生任何物理点击之前,会优先通过语义相似度从记忆库中唤醒与当前任务相关的应用候选、历史工具和操作策略。值得注意的是,这些被唤醒的记忆扮演的是“顾问”角色,它们以策略注入的方式引导宿主代理,而不是直接强硬地覆盖当前的新指令。这种设计既保证了经验的复用,又避免了刻舟求剑的死板。
紧接着进入拆解阶段(Route,任务分解)。为了解决跨应用数据丢失的顽疾,KnowAct-GUIClaw 的路由策略不是去预测具体的屏幕点击序列,而是将复杂需求拆解为一个个带有明确契约的子任务。对于每一个子任务,路由器都会显式定义它所需的“输入数据”和应该返回的“输出数据”。例如,从邮箱提取验证码然后填入注册页,前一个子任务必须将验证码数值挂载到系统共享的数据板上,后一个子任务必须声明需要调用该数值。如果在任何一环发现输入或输出缺失,工作流会立即触发熔断并报告异常,而不是带着错误的状态继续往下瞎走,这极大提升了跨应用调度的严谨性。

在具体的执行阶段(Act,混合动作),GUI 子代理所面对的不再是单一的“点击/滑动”动作空间,而是一个高度复合的工具箱。这个动作空间融合了传统的多模态视觉操作、由历史成功经验蒸馏出的复合技能,以及系统原生的快捷命令(如安卓的 Intent)。但在调用那些看似高效的捷径之前,子代理必须基于当前的实时屏幕状态进行严苛的页面验证。这种设计巧妙平衡了效率与可靠性,既保证了在已知路径上的狂飙突进,又防止了因为环境微小变化而导致的满盘皆输。
自进化机制:从操作轨迹中提炼肌肉记忆
如果说前三个阶段决定了 KnowAct-GUIClaw 当前的战斗力,那么最后的反思阶段(Reflect,轨迹蒸馏)则决定了它的长期成长上限。这也是该研究最具价值的贡献之一。
过去的系统在任务成功或失败后通常就直接停止,而 KnowAct-GUIClaw 会在任务终结时启动轨迹后处理。它不会将长篇累牍的屏幕截图直接塞进数据库,而是将执行轨迹压缩为精炼的操作摘要。对于未完成的任务,它会将当前状态固化为一个检查点(Checkpoint),方便宿主代理稍后重新介入,避免重头再来的算力浪费。
更深层次的进化体现在对经验和技能的分类存储上。研究团队借鉴了将经验转化为资产的思路,设计了独立的成功提示词和失败提示词来诱导模型提炼教训。对于那些反复出现的成功操作序列(比如固定的登录流程),系统会将其提炼并参数化,转化为可复用的“技能(Skill)”固化下来。而对于那些失败的尝试(例如在某个 App 里误入了不支持所需功能的页面),系统则会将其提炼为文本形式的“经验记忆(Experience Memory)”。

作者通过一个极其直观的案例证明了这种自进化记忆的威力。在操作 Mastodon(长毛象)应用的场景中,如果系统没有先前的经验记忆,它会凭借常识在手机 App 的设置里来回翻找“生成邀请链接”的选项,最终一无所获地卡死在无效路径上。然而,当系统接入了经过蒸馏的经验记忆后,宿主代理在任务一开始就会被明确告知:高级邀请链接功能在移动端 App 是缺失的,必须跳转至 Web 端管理面板。于是,执行器直接放弃在 App 内的盲目探索,调起浏览器并直达目标页面。这种能力的质变,完全不需要对底层大模型进行任何参数微调,纯粹依靠框架本身的记忆反刍机制就实现了降维打击。
实验结论:断层式的跨模型提升
为了严谨地验证这套架构的普适性,研究团队不仅在单一模型上进行测试,更考察了 KnowAct-GUIClaw 框架在不同基础模型上的迁移效果。在主战场 MobileWorld 评测集(包含 20 个应用的 117 个纯 GUI 任务)中,实验数据呈现出明显的梯度飞跃。
当仅仅使用一个基础的视觉模型(如 Qwen3.5-35B-A3B)作为裸奔的 GUI 执行器时,由于缺乏长线规划,其任务成功率仅有 24.8%。然而,仅仅是给这个 35B 模型套上 KnowAct-GUIClaw 的宿主代理和经验记忆系统,胜率就瞬间提升到了 34.5%;进一步开启技能库机制后,胜率更是达到 37.9%。
更惊人的是这套记忆系统的“可继承性”。研究团队尝试将利用高参数模型(Kimi-K2.6)跑出来的历史轨迹,蒸馏成记忆和技能,然后硬塞给那个较弱的 35B 模型使用。结果显示,吸收了“高人经验”的 35B 模型胜率跃升至 41.0%,相比初始状态实现了 16.2 个百分点的绝对增长。这确凿地证明了,该框架所产出的并不是与特定模型绑定的黑盒特征,而是真正具有普适指导意义的通用知识。
当框架的底层驱动引擎更换为能力更强的 Kimi-2.6 时,整个系统的潜力被完全释放。在经验记忆和技能库的双重加持下,模型在 MobileWorld 上的胜率达到了创纪录的 64.1%。这一成绩不仅远超公开排行榜上的那些专精于端到端界面点击的特殊模型,甚至将包含 GPT-5.5 在内的众多闭源重型框架甩在了身后。
除了胜率的狂飙,这套框架在资源消耗上的收敛同样值得关注。剥离实验(Ablation)清楚地指出,因为有了事前经验的指导和快捷技能的调用,模型在界面上进行无效滑动的次数大幅下降。系统将原本消耗在逐帧截图识别上的昂贵算力,转移到了更轻量、更高层的宿主代理路由决策上,使得总体任务推进的节奏更加稳健和高效。
KnowAct-GUIClaw 的提出,为 AI 代理的演进指明了一条极具现实意义的路线:在复杂的现实计算设备中,仅仅提升多模态模型的“视力”是不够的。真正的突破在于赋予代理管理过往经验的机制,让它们能够像人类一样,将新奇的探索固化为习惯,将失败的教训转化为避坑指南。这套将认知、路由、执行与反思深度融合的体系,或许正是个人 AI 助手真正走向实用化和全天候陪伴的基石。