爆降51% Token消耗!清华北大开源AOHP:重构Agent原生安卓系统
AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction
如今的AI智能体能陪你聊天、帮你写代码。 但如果你让它在手机上跨App比价并买杯咖啡,它往往会笨手笨脚,甚至频繁出错。 为什么?因为现有的智能手机操作系统,是为“人类点击”设计的,而不是为“代码调用”准备的。
ArXiv URL:http://arxiv.org/abs/2606.23449v1

论文原图:用于辅助理解核心方法或实验结果。
传统的操作系统界面是由开发者固定的,GUI的渲染是为了人类视觉,而非机器逻辑。 这种架构级的错位,不仅限制了智能体的落地,更带来了极高的执行开销与严重的隐私风险。
为了彻底解决这一根本性问题,清华大学、北京大学与香港大学的研究团队联手破局。 该研究提出了安卓开放安全套件(Android Open Harness Project, AOHP)。 这不仅是一个简单的插件,而是直接基于安卓开源项目(Android Open Source Project, AOSP)进行的底层OS重构。
实验结果极为耀眼:在复杂移动端任务中,AOHP将任务完成率提升了21.12%。 同时,得益于底层接口的优化,大型语言模型的Token消耗暴降了51.55%! 本文将带你深度拆解这一Agent原生操作系统的核心技术机制。
架构级错位重构:从应用中心到服务组合
要理解AOHP的颠覆性,我们需要先看清传统OS的局限。 在传统安卓系统中,应用(App)是绝对的中心,信息被封闭在一个个孤岛中。
人类用户只能被动地适应App定义的菜单和跳转逻辑。 但对于AI智能体而言,这种“看屏幕-找按钮-模拟点击”的过程,就像是让一个程序员通过看实体菜单来点菜。 这既低效,又容易因为界面UI的微小变化而彻底崩溃。
AOHP的核心设计原则,是将Agent提升为操作系统的“一等公民”。 系统不再强迫Agent去适应僵化的App,而是主动围绕用户的意图生成自适应用户界面(Adaptive User Interfaces)。
在架构上,AOHP分为垂直的四个层次: 最底层保留了成熟的安卓软硬件生态,确保兼容性。 第二层是统一交互接口(Unified Interaction Interface),将传统UI和新型接口规范化。 第三层是能力层,将系统内存、UI工具和技能进行重组。 最顶层则是AOHP的杀手锏:个性化服务组合(Personalized Service Composition)。
你可以这样理解:当你想购物时,AOHP不会让Agent去逐个打开不同的电商App。 相反,操作系统会在底层提取各个电商的搜索、比价、支付等服务能力(API、CLI或结构化GUI)。 然后,系统当场“组装”出一个只针对你当前购物意图的专属服务入口。 Agent直接与这个高层语义入口交互,绕过了繁琐的跨App切换,真正实现了“意图驱动”。
交互接口降维打击:并行执行与事件流抽象
为什么AOHP能让Token消耗暴降一半以上?秘密隐藏在其打造的高效智能体接口(Efficient Agent Interfaces)中。
在传统的视觉流Agent方案中,模型需要不断地截图、解析屏幕、推理坐标。 这意味着上下文窗口中塞满了冗长且重复的视觉或布局Token。 且一旦遇到应用加载转圈,Agent就得傻傻等待,极度浪费算力。
AOHP为Agent量身定制了一套“数字API菜单”,彻底改变了交互方式:
-
并行后台交互: 系统将执行与物理屏幕解耦,通过轻量级虚拟显示器,允许Agent在后台并行处理多个耗时任务。 这就避免了抢占用户当前正在使用的前台界面。
-
Agent感知UI增强: 系统将复杂的GUI抽象为结构化表达。 剔除了对机器毫无意义的渲染细节,保留了纯粹的语义信息,极大压缩了状态空间的复杂度。
-
事件流抽象(Event Stream Abstraction): 系统级通知(如Toast弹窗)往往转瞬即逝,传统Agent通过轮询很难抓取。 AOHP引入了发布-订阅机制,Agent可以订阅动态通知捕获和传感器数据流。 只要数据更新,系统直接推送给Agent,彻底消灭了无效的重复询问。
-
统一文件快捷方式: 在跨App协作中,文件共享往往是最容易断裂的环节。 AOHP将文件作为OS边界的一等任务对象,提供统一的数据面。 无论是GUI操作产生的文件,还是程序化接口消费的文件,都能被系统级追踪和顺滑交接。
通过这些机制,Agent的操作步数被大幅削减。 根据公式推演,大模型调用的总成本 $Cost$ 往往与交互步数 $N$ 以及上下文长度 $L$ 呈正相关。 AOHP同时降低了这两个变量,从而实现了执行效率的几何级跃升。
细粒度信息流管控:隐私数据的沙箱化脱敏
让Agent在操作系统内拥有最高权限,听起来就像是把保险箱密码交给了陌生人。 传统的App权限模型(如“是否允许访问通讯录”)防得住App,却防不住跨应用流窜的Agent。 如果Agent读取了你的银行卡号,并在后续任务中不慎将其作为参数传给了外部网页,后果不堪设想。
AOHP通过安全信息流(Secure Information Flow)机制,重构了系统的信任边界。
它的核心思想非常巧妙,我们可以将其称为“信封策略”: 默认情况下,敏感的明文数据(信件)绝对不会直接暴露给Agent的上下文。 在敏感数据进入Agent视野之前,AOHP的底层机制会对其进行源头清洗(Source Sanitization)。
系统会将真实的银行卡号替换为一个强类型的占位符,例如 <payment-card:uuid>(装入密封信封)。 Agent在进行逻辑推理和跨步传递时,处理的始终是这个占位符。
当真正需要执行支付等关键动作时,Agent将占位符提交给可信保险柜执行器(Trusted Vault Executor)。 此时,只有处于安全沙箱中的操作系统底层,才有资格拆开信封,还原真实数据并执行底层调用。 如果操作触及敏感边界,系统会精准拦截,并向用户发起目的明确的授权请求。
此外,AOHP还实现了系统级的污点追踪(Taint Tracking)。 无论这个占位符被复制、组合还是传递了多少次,系统都能完整追踪其来源与去向。 这确保了Agent的高级能力不会沦为数据泄露的温床。
性能验证:完成率与成本的双重跃升
为了验证AOHP的实际威力,研究团队在真实的移动应用环境中进行了严苛的基准测试。 他们采用了OpenClaw智能体,分别在原生安卓(基线)和AOHP环境中执行了30个复杂的跨应用任务。
实验数据展示了堪称降维打击的效果:
-
任务完成率大幅领先: 在原生安卓上,Agent的平均完成率仅为54.44%。 而在AOHP的加持下,这一数字飙升至75.56%(提升21.12%)。 AOHP多完美解决了7个传统Agent根本无法跨越的复杂任务。
-
执行成本断崖式下跌: 在两者均能完成的子集任务中,AOHP展现了恐怖的效率。 工具调用次数(Tool Calls)下降了44.64%(从233次降至129次)。 任务总耗时缩短了44.21%(从约34分钟降至近19分钟)。 最关键的是,LLM的Token总消耗锐减了51.55%(从7.10M降至3.44M)。
在安全测试环节,AOHP同样表现完美。 面对特制的支付应用测试,系统成功将账户、卡号等字段显示为保险柜引用。 在未授权的情况下,系统坚决实行“失败关闭”策略,彻底阻断了隐蔽的数据外泄。
工程启示与原生生态的未来演进
AOHP为整个AI硬件与系统生态指明了一条极具潜力的演进路径。 目前的“屏幕解析+模拟点击”流派,本质上是在为陈旧的OS架构打补丁。 真正通向AGI的操作系统,必须在底层为Agent提供原生语义接口与严格的信息流沙箱。
当然,该研究也坦诚了当前版本的局限性。 最大的挑战在于兼容性覆盖与能力自动发现。 对于那些采用了自定义渲染引擎(如游戏引擎)、具有反自动化逻辑或未提供标准侧面接口的顽固App,AOHP依然需要依赖更强大的视觉理解模型进行兜底。 此外,未来还需要系统具备更强的自动化能力推断机制,以减少开发者手动标注接口的负担。
但毋庸置疑的是,AOHP迈出了Agent-Native OS极为坚实的一步。 当操作系统不再局限于“应用容器”,而是进化为“意图引擎”时,人机交互的范式将被彻底改写。