Evo-Harness:把单次失败编译成复用技能,终端基准准确率提升超10%
由 UIUC、亚马逊、宾夕法尼亚州立大学、埃默里大学等机构联合提出的 Evo-Harness 框架,正是为了击破这一瓶颈。该研究重新定义了“在线脚手架学习”(Online Harness Learning)范式,不再把经验视为被动检索的案例库。
由 UIUC、亚马逊、宾夕法尼亚州立大学、埃默里大学等机构联合提出的 Evo-Harness 框架,正是为了击破这一瓶颈。该研究重新定义了“在线脚手架学习”(Online Harness Learning)范式,不再把经验视为被动检索的案例库。
研究团队在系统梳理了 2023 至 2026 年间 52 个代表性记忆增强智能体系统后,指出了当前评测的三大结构性缺陷。超过六成的评测指标被完全集中在 LoCoMo 和 LongMemEval 等纯对话问答基准上,而真正考察工具调用、环境交互与顺序决策的智能体任务却长期缺席。
来自斯坦福大学(Stanford University)、Prentis AI 以及 Titan Holdings 的联合研究团队在最新工作中提出了 AutoResearchEval 评测基准与实证失效分类法 ARFT (AutoResearch Failure Taxonomy)。
为了打破这种“单兵死磕”的局部最优困境,来自 IMEC 与 AILabs 的研究团队提出了名为 KernelArc 的多 Agent GPU 内核协同优化架构。
哈佛大学、斯坦福大学、华盛顿大学与 Raycaster AI 等机构的研究团队近期联合提出了 StagedWorkspace ,首次将工作区状态明确确立为知识工作 Agent 的核心实验变量,并引入了“工作区状态契约”(Workspace-State Contract)。
StartupBench 提出了一套基于细粒度规则的自动化评测机制。平均每个任务包含 25.3 条 相互独立的评测规则,跨越格式规范性、结构完整性、计算与逻辑正确性、领域专业事实深度等 6 个维度,并划分为 3 种重要性级别。
Terminal:该工作首次从工作负载级边界出发,明确将终端 Agent 界定为“任务核心推进闭环依赖于命令行执行、文本反馈与有状态环境交互”的智能系统,并提出了覆盖执行全生命周期的七维终端能力画像(Competence Profile)。
为了彻底复原这种复杂性,VAKRA 基于 BIRD-SQL 衍生出的真实数据库生态,构建了覆盖金融、医疗、供应链等 62 个领域的 8000 余个可执行 API。
来自 UC Berkeley、Stanford、Caltech、AWS 等机构的研究团队提出了 Vero ,这是业内首个面向真实仓库级(Repository-scale)、要求智能体联合合成“代码实现与机器可检查证明”的形式化验证基准。
Microsoft:为此,AdsWorldEngine 提出了中枢与工具的迭代联合优化范式(Iterative Actor-Tool Optimization)。这一循环由两个交替演进的飞轮组成: 第一个飞轮是 中枢策略对工具特性的自适应 。
除了单机调试,AgentDebugX 还针对企业落地和开源协作设计了两个工程构件: 其一是 故障中心(Error Hub) 。智能体在生产环境中遇到的长尾 Bug,往往很难在开发沙盒中复现。AgentDebugX 允许将“轨迹-诊断-修复方案”打包为脱敏资产包(Bundle)。
这项研究提出了名为 QCR (Query-Conditioned Reuse,查询条件化重用)的范式,并搭建了严格控制变量的评测框架。在涵盖 WebArena、WorkArena 和 AppWorld 三大主流环境的 2,391 个长流程任务实例评测中,QCR 在消耗在线 Token 减少 4...
来自清华大学、爱丁堡大学、澳门科技大学、东南大学等机构的研究团队联合提出了全新基准 CAP (Cross-site, complex Actions, and Perception),针对跨网站工作流、复杂 UI 操作以及动态视觉感知三大核心瓶颈展开全面评测。
研究团队提出了名为 Daydreaming 的黑盒执行重构攻击。该攻击彻底绕过了传统的越狱或信息刺探手段,在整个交互过程中不向目标 Agent 询问任何系统提示词,也不要求对方评价或校准生成的代码,而是将其建模为一个纯粹的黑盒系统辨识问题。
针对这一长期被忽视的痛点,莫纳什大学(Monash University)的研究团队提出了名为 EASy (Efficient Agentic System)的可训练智能体框架。
针对这一脱节现象,NVIDIA 团队提出了名为 ACES(Agentic Continuous Evaluation of Skills)的持续评估框架,并在开源工具 NVIDIA SkillEvaluator 中实现了该方法。
为此,团队提出了名为 FailForge 的智能体自愈蒸馏框架,将原本注定被丢弃的失败样本重新激活为高价值训练数据。实验表明,FailForge 成功挽回了超过 26% 连试数次均彻底失败的难题。
卡耐基梅隆大学(CMU)、超威半导体(AMD)与纽约州立大学布法罗分校的研究团队提出了一套全新系统 FlashRT。该方案打破了“为人手写调度器”或“用规则编译器解决一切”的传统思路,转而将系统级优化任务交给大模型编码智能体(Coding Agent)。
针对这一瓶颈,来自西北大学、伊利诺伊大学芝加哥分校与南加州大学的研究团队提出了 HyperSkill 。该框架将智能体的经验记忆形式化为一个 超图(Hypergraph) ,用超边把单次轨迹中的子任务序列、可复用技能与反思教训强绑定在一起,并通过子任务与轨迹级双路检索及基于高阶拓扑的记忆演化。
IssueTrojanBench:分析得出的结论对当前 Agent 框架的架构设计者提出了直接警示: 在这 1,400 次拦截中, 82.9% 的拒绝行为完全来源于底层大模型自身的显式安全推理 ,模型在思考链中识别出指令存在风险并主动拒绝执行。
针对这一隐蔽且危险的操作风险,研究团队提出了名为 OBLIVION 的基准与防御框架,首次系统性地将“操作型技能遗忘”(Operational Skill Unlearning)形式化为一个源到汇(Source-to-Sink)的工作流安全问题。
由 IBM 与伊利诺伊大学厄巴纳-香槟分校(UIUC)联合团队提出的 LivePlan 框架,换了一种更务实的解题思路: 将运行时的“漂移裁决”与“纠偏建议”彻底解耦 。
由 Scale AI、加州大学圣克鲁兹分校(UC Santa Cruz)与范德堡大学医学中心(Vanderbilt University Medical Center)联合提出的 READY (Reliable Enterprise Agent Deployment)框架,正是为了破解这个断层。
作者团队在涵盖 LangGraph、AutoGen 以及自研框架,横跨 Qwen-2.5-7B/3B、Llama-3.1-8B 以及商用 Gemini-2.5-flash API 的 2823 个真实智能体轨迹上,构建了一套两阶段防护系统。