GUI Agent最新综述!南大等剖析336篇文献:从单步模型到闭环软件工程
这篇综述对当前 GUI Agent 的评测生态提出了极其犀利的批评:当前的论文看起来指标飞涨,但测试结论往往无法转化为真实可用性。最核心的问题在于 评测指标过度聚焦于单一的“任务成功率”(Task Success Rate) 。
这篇综述对当前 GUI Agent 的评测生态提出了极其犀利的批评:当前的论文看起来指标飞涨,但测试结论往往无法转化为真实可用性。最核心的问题在于 评测指标过度聚焦于单一的“任务成功率”(Task Success Rate) 。
华为技术有限公司联合北京大学、东南大学提出了端到端智能体应急响应规划框架 STAIR(State-driven, Stage-specialized, and Experience-supported Incident Response)。
西北工业大学与清华大学的研究团队提出了 Act2Intention 框架,首次系统性地构建了覆盖“意图理解(Understanding) 意图预测(Prediction) 经验执行(Execution)”全链路的主动式移动智能体体系。
来自耶鲁大学(Yale University)与 Sea12 Technologies 的研究团队在一篇最新论文中提出了基准测试 AlloBench ,首次系统评估了大语言模型在严格资源预算约束下的在线工具投资分配能力。
来自清华大学、北京大学、华中科技大学、美团、MBZUAI、上海交通大学和香港中文大学等机构的研究团队提出了 AutoDesign 框架。这项工作跳出了“微调底层多模态模型权重”的传统路径,而是引入了 元脚手架优化(Meta-Harness Optimization) 机制。
为了搞清楚研发过程中的增益与损失发生在何处,研究团队将 Agent 的研发闭环显式拆解为三大正交的能力维度: 1. 方案构想(Solution Framing, C1) :衡量模型在最开始能否提出合理、有潜力的优化假设。
为了全面覆盖机械工程设计流程,CADWorld 系统梳理了机械设计与制造领域的系统知识,构建了涵盖 11 个工作流类别的任务分类学(Taxonomy)。基准包含的 200 个任务覆盖了 183 个具体机械知识点。
为此,研究团队提出了一种全新的系统级防御框架 FlowSeal。它不再指望大模型在同一个对话窗口里“既当裁判又当选手”,而是跳出模型上下文,在工具调用层构筑起基于数据溯源和信息流控制(Information Flow Control, IFC)的强制拦截器。
针对这一困境,研究团队提出了 EchoPath ——一种模型无关且环境无关的执行级可重放记忆框架。它不再将历史经验作为冗长的 Prompt 上下文喂回大模型,而是将经过终局验证的 GUI 执行轨迹提炼为标准化的“可调用资产”(类似 MCP 风格的确定性工具)。
论文通过一个直观的例子揭示了这一机制如何瓦解系统的安全性:在一个自动化部署脚本中,包含一段用于清理构建残留的清理逻辑,其指令预设会根据环境变量 GITHUB WORKSPACE 理所当然地存在并指向代码仓库路径;然而在智能体运行的实际开发机环境中,该环境变量并未定义。
针对这一长期困扰智能体进化的瓶颈,福州大学、香港理工大学、MemTensor、中国科学技术大学与西安交通大学等机构的研究人员提出了一种免训练的记忆与技能共进化治理框架——MSCE(Memory-Skill Co-Evolution)。
从技术实现与应用落地来看,K-Bench 的结论向所有试图构建垂直科研智能体的从业者发出了一条清晰信号:当前通用大模型的基础底座,在面对非结构化现实需求时,依然缺乏严谨的自省与工程化定力。要在科研领域真正替代繁杂的体力劳动,仅仅让模型学会利用工具编写文字报告是远远不够的。
由北京交通大学、北京天坛医院、首都医科大学、西湖大学等机构联合提出的 MedClaw ,尝试通过一种完全不同的范式打破这一死锁。该系统提出了一个完全无需调整模型权重的 Agent 框架(Agent Harness),在架构上严格解耦了“时序规划推理”与“底层视觉感知”。
针对这一长期被忽视的痛点,来自中国科学院(CAS)、Memorax AI 等机构的研究团队提出了 MemChain 。这项工作颠覆了“检索后直接喂给模型”的粗放模式,首次在检索与回答生成之间引入了一个独立的可训练“检索后记忆策略”(Post-Retrieval Memory Policy)。
我们往往在对方话音未落时就已经开始在大脑中构建回应,在开口陈述当前句子的同时构思下一句表达,即使中途被打断也能迅速吸收新信息并调整思路。然而,当下绝大多数基于大语言模型(LLM)构建的语音智能体(Voice Agents)却表现得格外机械:它们严格遵循着“听完语音输入 沉默思考 开口输出语音”...
来自清华大学、中国科学院、Shopee、北京工业大学和东南大学等机构的研究团队,将这种认知直觉转化为一种原生的后训练框架,提出了 OmniReasoner 。该工作不再执着于通过无限扩展上下文窗口去强行“硬吞”全部音视频信号,而是通过监督微调(SFT)与强化学习(RL)。
针对这一隐蔽威胁,研究团队同时提出了一种无需调用大模型、零推理开销的输入端防御策略——显著性归一化(Salience Normalization),成功将攻击率压制至 15.3%。传统 RAG 系统在处理知识密集型问答时,通常依赖单次检索匹配。
针对这一瓶颈,中国科学院与中国科学院大学的研究团队提出了 SciDSK(Scientific Data Skill,科学数据技能) 框架。这项工作的核心构想十分巧妙:不再试图去重构现有的底层数据仓储,也不把数据集当作笨拙的外部检索对象,而是将特定数据集的科学背景、文件层级语义、前置校验规则与端...
针对这一瓶颈,腾讯与复旦大学的研究人员在论文《Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards》中提出了 Search-G1 。
TimeSage-EV:目前大模型社区在时序理解上的评测,大多遵循类似 ChatTime-TSQA 或 TSRBench 的思路:给定一段历史数值曲线,向模型提出几个关于极大值、极小值、平均趋势或简单周期的定点问题。另一些通用智能体基准虽然引入了代码执行、网页检索和工具调用,却很少将时间演进作...
凭借这一范式与多项系统级协同设计,ZGCM-1-7B 在 16K 预训练中实现了约 4.2 倍的训练效率提升(Time-to-loss),支持原生 256K 上下文,并在数学推理与复杂 Agent 搜索基准上。
来自香港城市大学与香港宇唯科技的研究团队近日提出了 AgenticCANN 框架。这项工作并非简单地将提示工程搬运到国产硬件上,而是直击非 CUDA 架构低语料环境下的核心症结。
来自安徽大学、海南大学、香港理工大学、香港大学和浙江大学的研究团队提出了一套名为 AgentSnare 的轨迹自适应欺骗系统。该系统彻底颠覆了“预先埋伏静态诱饵”的传统思路,转向“沿着攻击者的交互轨迹动态展开事实自洽的诱饵环境”。
为了拆开这个黑盒,全新基准测试 ClawTrack 提出了一套“双轨评估”(Dual-assessment)框架:不仅看智能体达成了什么(Task Score,任务分),更要逐轮打分衡量它是如何达成的(Process Score,过程分)。