告别坐标幻觉!北大提出无回归GUI定位,ScreenSpot-Pro提升超20%

Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

图形用户界面智能体(GUI Agent)正在经历一场底层技术栈的代际迁移。过去依赖 HTML DOM 树或 Android View Hierarchy 等系统元数据的方案,在沙箱运行、跨平台应用以及安全隔离环境中屡屡受挫。业界随之将目光投向以纯视觉输入为核心的多模态大语言模型(MLLM),希望让智能体像人类一样仅通过屏幕截图就能完成所有点击与导航。然而,端到端多模态大模型在落地到真实操作时,暴露出一个致命缺陷:坐标幻觉(Coordinate Hallucination)。

ArXiv URL:https://arxiv.org/abs/2608.09654v1

当用户发出“关闭所有未保存窗口”这类指令时,界面上可能并存着多个外观极度相似的关闭图标,分别属于资源管理器、浏览器和文本编辑器。人类能凭借窗口标题与右上角图标的相对几何关系瞬间完成关联,而端到端 MLLM 往往会在这一步迷失方向——模型在视觉编码时缺乏对界面规则布局的归纳偏置,直接输出的连续数值坐标常常落在目标像素之外数个像素甚至完全偏离。如果回退到传统的开集目标检测模型,虽然定位精准,但这类模型又完全看不懂长链条、带空间限定的复杂语义。

针对这一长期困扰界面的双重瓶颈,北京大学的研究团队提出了一种解耦的无回归布局感知匹配框架。该方法的核心思想非常明确:大模型负责把复杂的自然语言指令“翻译”成富有界面布局细节的视觉描述,而精确定位则交给一个专用的轻量定位模块通过跨模态匹配完成,全程不学习任何坐标回归参数。在专业级评测基准 ScreenSpot-Pro 上,该方案相比端到端主流系统取得了超过 20% 的准确率提升;在复杂网页多步交互基准 Mind2Web 上,成功率与元素选择率同样跃升了 15% 以上。这一成果证明,彻底摒弃坐标回归,才是让视觉 GUI Agent 摆脱幻觉的破局路径。

整体框架概览

坐标幻觉的病灶:为什么端到端回归在界面场景会失效?

要理解这项研究的精妙之处,首先要看清当前端到端多模态大模型在 GUI 交互中的本质矛盾。常规的视觉基座模型(如 CLIP、ViT)多在自然图像上进行预训练,其注意力机制关注的是物体的整体轮廓、颜色纹理与宏观语义。然而,操作系统和移动设备的图形界面本质上是由网格、边框、对齐线和高密度符号高度规则化排列而成的离散几何世界。

在端到端 MLLM 中,模型通常将预测目标抽象为连续的归一化数值坐标 $(x, y)$,或者将其量化为预定义的坐标 Token。这一机制在自然图像里定位一只猫或一辆车时尚能容忍一定容差,但在 GUI 环境下,一个关键按钮的有效点击区域可能只有 $16 \times 16$ 像素。当提示词中包含“在‘文件资源管理器’窗口右上角的关闭按钮”这类带有层级依附和空间修饰的复合指令时,大模型既难以从大尺寸全局图像中提取极其微小的局部特征,又无法在其参数化的生成概率中对像素级别的相对偏移做出刚性约束,几何上看似合理、实则点偏的“坐标幻觉”因此高频爆发。

以往研究尝试通过大规模标注数据对大模型进行微调,但这不仅需要极其昂贵的高精度框坐标标注,还容易让大模型丧失通用的推理逻辑。另一条路线是引入传统视觉定位(Visual Grounding)模型,但像 Grounding DINO 这类模型在设计之初就不是为了理解复杂的界面排版服务的,面对包含相对位置、父子容器关系的操作指令,单纯依靠文本到区域的简单匹配往往束手无策。

北大团队提出的解题逻辑彻底打碎了“端到端一步到位”的执念。既然语言模型的强项在于常识推断和语义展开,而强项不在像素网格的精细几何拟合,那么就应该彻底剥离大模型的坐标生成职责,让其退回纯粹的语义理解阶段;同时重塑下游定位机制,将其从“无中生有”的坐标预测转换为“基于界面骨架的候选匹配”。

指令具象化:让冻结大模型只充当“界面解说员”

在这套两阶段框架的起点,研究团队部署了一个完全冻结参数的多模态大模型(如 Qwen2.5-VL-72B 或 GPT-4V),作为意图解析器(Intent Parser)。

真实用户的交互指令通常是高度抽象的功能诉求,例如“点击登录”或者“前往个人资料设置”。如果直接将这类指令送入定位模块,下游检测器根本无从得知目标元素具体长什么样、在界面的什么位置。北大团队通过精细设计的上下文提示工程,促使多模态大模型结合当前截图对用户指令进行“具象化扩展”,生成包含视觉表象和空间线索的结构化描述 $Q$。

例如,简单的“点击登录按钮”会被大模型转译为“位于页面中央、带有白色‘登录’文本的蓝色矩形按钮”。在这个过程中,大模型不更新任何参数权重,既避免了全参数微调带来的高额算力支出,又消除了灾难性遗忘的风险。更重要的是,大模型在没有任何坐标生成压力的情况下,将其强大的上下文理解与图文推理能力发挥到极致,向下游输送了信息密度极高的高质量多模态 Query。

模型详细架构设计

布局先验生成:仅凭“文字/图标”二分类感知界面骨架

得到富含排版线索的描述 $Q$ 之后,接下来的核心挑战是如何在截图中锁定具体目标,同时绝不重新跌入坐标回归的陷阱。该研究构建了一个专用的布局感知 GUI 定位模型(Layout-Aware GUI Grounding Model),其第一步是生成高质量的候选区域。

研究团队洞察到,任何现代图形界面的基础视觉基元都可以高度提炼为两类元素:文本块(Text)图标块(Icon)。传统通用检测器之所以在界面上表现不佳,是因为试图让它们直接识别千奇百怪的应用专有组件。对此,作者团队对 DINO 检测器进行了 GUI 领域的轻量自适应微调,而关键在于其监督信号只包含“Text”和“Icon”这两个基础类型,完全不涉及任何具体的应用语义。

通过这种极简的二元先验,检测器迅速建立起了对界面布局规律的归纳偏置。它能准确切分出密密麻麻的文字段落与功能符号,并输出对应的视觉嵌入 $\mathbf{v}_i \in \mathbb{R}^d$。与此同时,定位模块会显式抽取每个候选区域的归一化几何特征向量:

\[\mathbf{g}_i = \left[x_c,\ y_c,\ w,\ h,\ \frac{w}{h},\ w \cdot h\right]\]

其中 $(x_c, y_c)$ 表示候选框中心点的相对坐标,$(w, h)$ 代表归一化的宽度和高度。宽高比与面积的引入,为区分扁平的文本栏、正方形的功能按钮提供了坚实的低维几何指纹。

无回归跨模态匹配与轻量几何注入

在锁定了一系列界面候选框后,系统没有像传统检测器那样添加任何用于微调边界的回归头,而是采用了完全冻结的 CLIP(ViT-B/32)作为特征匹配骨架,从机制上杜绝了回归越界产生的坐标幻觉。

对于每一个候选区域 $r_i$,模型直接在截图中进行局部裁剪并送入 CLIP 图像编码器,得到视觉表征 $\mathbf{f}_i \in \mathbb{R}^{d_c}$;此前由冻结 MLLM 生成的结构化描述 $Q$,则被送入 CLIP 文本编码器获得文本表征 $\mathbf{t} \in \mathbb{R}^{d_c}$。如果在常规特征上直接做余弦相似度计算,对于“左上角”或“右侧第二个”这类依赖相对空间修饰的指令,纯视觉外貌匹配极易出现多个相同图标混淆的情况。

为了解决这一难题且不破坏冻结特征的通用泛化性,作者引入了一个参数量极小的几何投影层:

\[\mathbf{h}_i = \mathbf{W}_g \mathbf{g}_i + \mathbf{b}_g\] \[\tilde{\mathbf{f}}_i = \mathbf{f}_i + \mathbf{h}_i\]

利用一个极轻量的线性变换矩阵 $\mathbf{W}_g$ 和偏置 $\mathbf{b}_g$,将此前提取的 6 维几何特征映射至与 CLIP 视觉表征相同的维度,并以残差相加的形式融合为增强特征 $\tilde{\mathbf{f}}_i$。最终候选框的打分由归一化后的余弦相似度决定:

\[s_i = \frac{\tilde{\mathbf{f}}_i \cdot \mathbf{t}}{\|\tilde{\mathbf{f}}_i\|\|\mathbf{t}\|}\]

这种加法残差设计具有极高的工程智慧。在面对不包含空间方位的纯外观指令时,几何偏置能够自然学出接近零的偏移量,使系统回退到鲁棒的原始 CLIP 匹配能力;而一旦文本描述中明确包含了“右上角”、“靠近底部”等空间修饰,几何特征就会为特定空间分布的候选区域提供精准的相似度增益,引导最终的峰值落向符合空间预期的目标。整个过程完全不需要庞大的空间位置编码网络,仅仅靠极少数带空间标记的样本就能完成训练。

训练数据构建流水线

数据引擎:以极低标注成本撬动强大感知

大模型时代的另一项关键制约是高质量标注数据的匮乏。传统的端到端训练需要海量带有精确边界框和多轮会话标注的数据集,成本高昂且难以覆盖专业级桌面软件。

该研究设计了一套高度自动化的弱监督数据构建流水线。如上图所示,团队从开源的通用 GUI 数据集中采样了约 20 万张截图,首先通过自动化解析工具批量抽取出所有文本块与图标区域,无需人工介入标注语义;接着,将这些局部切片直接送入 Qwen-VL 等开源多模态模型,让其逆向生成对应的精细视觉描述,自动构建出海量的“区域-文本”配对样本。

在训练阶段:

这种训练策略将绝大部分计算负担与过拟合风险隔绝在外,使得整个模型可以用极度轻量的算力预算在专业软件界面之间完成高效迁移。

定性案例与匹配流程展示

实验评测:专业级与复杂环境下的全面突围

为了验证该框架能否在真实多变的环境中立足,研究团队将其置于当前极具挑战性的两个专业评测基准之下:涵盖移动、桌面与 Web 平台的单步操作基准 ScreenSpot,以及专门收录了 AutoCAD、复杂 Office 套件等极端高密度界面的 ScreenSpot-Pro。

在 ScreenSpot-Pro 的严格评测中,端到端直接预测坐标的模型(包括各路顶尖开源与闭源视觉模型)因专业软件图标密集、排版微小而频繁失手。而北大提出的这套框架,凭借布局先验检测将搜索空间有效离散化至精准候选框,配合无回归的跨模态打分,在定位准确率(Grounding Accuracy)上直接超越了既有端到端模型 20% 以上。定性可视化结果展示了其强大的鉴别力:无论是 CAD 软件中仅仅相差几像素的一排工程辅助绘图小图标,还是多窗口堆叠下的特定关闭入口,系统均能零偏差命中。

在下游智能体任务的综合评估中,研究团队进一步引入了包含 71.5 万条真实操作轨迹的移动端基准 AITW,以及覆盖 137 个真实网站、31 个领域的复杂网页任务基准 Mind2Web。在 Mind2Web 这种具有动态嵌套布局、跨页面交互的复杂场景下,该方案将整体交互成功率(Success Rate)和关键元素选择率(Element Selection Rate)同时拉升了 15% 以上。这表明,解决坐标幻觉不仅是一个单点定位指标的提升,更直接扫清了长链条多步智能体因某一步“点歪”而全盘崩溃的系统性风险。

范式转换带来的延伸思考

从端到端直接拟合一切,到重回模块化、解耦化的工程哲学,本篇论文展示了一种极具实用价值的技术反思。

近两年来,多模态领域充斥着“端到端大一统”的声音,许多尝试试图通过将连续坐标直接转化为文本 Token 来完成界面控制。然而计算机界面的底层运行逻辑本就是离散、结构化且具备确定性规则的。让通用大模型去强行学习像素网格的绝对定位,不仅在数学上与连续坐标回归的容错分布相违背,在计算效率上也极度不经济。

这项研究的价值在于建立了一种新的协同范式:

  1. 大模型向上走:保留其作为“大脑”的抽象规划、复杂长文本理解以及语境推断能力,把模糊意图转变为清晰的视觉感知需求;

  2. 轻量模型向下扎:在底层利用极低成本的二分类先验划定操作区域边界,将定位问题退化为离散候选集的高维特征检索;

  3. 拒绝中间层回归:在像素定位的最后一步彻底移除参数化回归,借助预训练跨模态表征空间的余弦度量,为系统赋予天然的抗幻觉屏障。

在实际落地层面,这种架构对资源受限的边缘设备或企业内网私有化部署展现了极高的友好度。智能体开发者无需再花费数月时间去收集标注昂贵的点击数据集,也不必承担对千亿参数模型进行下游全微调的巨大成本,只需结合冻结的通用大模型底座与小巧的布局对齐头,就能迅速构建出具备高确定性、高精度的专业级 GUI 交互助手。视觉驱动的智能体要真正走进生产环境,这种对模型能力边界的主动取舍,或许比一味追求全链路端到端来得更加务实与坚固。