AI Agent 第14页

检索越多反而错得越多?11种Agent记忆底座横评揭示注意力分流机制

研究团队在系统梳理了 2023 至 2026 年间 52 个代表性记忆增强智能体系统后,指出了当前评测的三大结构性缺陷。超过六成的评测指标被完全集中在 LoCoMo 和 LongMemEval 等纯对话问答基准上,而真正考察工具调用、环境交互与顺序决策的智能体任务却长期缺席。

CAP:跨108个网站实测!顶尖浏览器Agent最高成功率仅8.0%

来自清华大学、爱丁堡大学、澳门科技大学、东南大学等机构的研究团队联合提出了全新基准 CAP (Cross-site, complex Actions, and Perception),针对跨网站工作流、复杂 UI 操作以及动态视觉感知三大核心瓶颈展开全面评测。

Daydreaming:无需套取提示词,32次黑盒交互窃取86.8%隐藏Agent技能

研究团队提出了名为 Daydreaming 的黑盒执行重构攻击。该攻击彻底绕过了传统的越狱或信息刺探手段,在整个交互过程中不向目标 Agent 询问任何系统提示词,也不要求对方评价或校准生成的代码,而是将其建模为一个纯粹的黑盒系统辨识问题。

FlashRT:引导Coding Agent重写多模态部署,延迟最高降低70倍

卡耐基梅隆大学(CMU)、超威半导体(AMD)与纽约州立大学布法罗分校的研究团队提出了一套全新系统 FlashRT。该方案打破了“为人手写调度器”或“用规则编译器解决一切”的传统思路,转而将系统级优化任务交给大模型编码智能体(Coding Agent)。

HyperSkill:用超图重构智能体记忆,复杂任务最高提升11.5分

针对这一瓶颈,来自西北大学、伊利诺伊大学芝加哥分校与南加州大学的研究团队提出了 HyperSkill 。该框架将智能体的经验记忆形式化为一个 超图(Hypergraph) ,用超边把单次轨迹中的子任务序列、可复用技能与反思教训强绑定在一起,并通过子任务与轨迹级双路检索及基于高阶拓扑的记忆演化。