AI Agent 第6页

Scale AI最新研究:Agent报错不该只怪模型!41种失败模式与根因定位框架

Scale AI 提出的这套以交互为中心的归因体系,其终极价值在于将智能体系统的迭代从盲目调优拉回到精准工程。在未来的智能体流水线中,自动化链路追踪工具可以在执行中断的瞬间,自动抓取交互边状态并运行根因分析:如果责任侧在模型,自动化数据飞轮便精准捕获该样本作为下一代后训练的失败用例;如果责任侧...

MT-Web2Code:从单轮整页生成走向多轮局部迭代修复

针对这一长期被基准评测忽视的现实需求,来自哈尔滨工业大学、美团与鹏城实验室的研究团队提出了 MT-Web2Code 。这是首个专注于多轮宏观区域重构(Macro-Level Regional Reconstruction)与微观局部微调(Micro-Level Localized Modifi...

OneDayAgent:日常长程任务新SOTA达到0.821!任务拆解+记忆压缩+验证修复三合一框架

实验结果显示,以 GLM-5.2 作为驱动底座的 OneDayAgent 取得了 0.821 的综合得分,显著超越基准官方测试的各类通用智能体方案。在遵循指令、事实准确性、逻辑完备性等维度,以及无论是否携带多模态附件的测试组中,该方案均取得了全面领先。消融实验进一步证实了各个模块的必要性。

不是盲猜而是看懂后果:GHD用下一张截图后视蒸馏突破手机Agent

研究团队据此提出了 门控后视蒸馏(Gated Hindsight Distillation, 简称 GHD) 。该方法在训练时引入一个参数完全共享的“教师视角”,让它额外观察到下一帧真实截图,从而利用事后诸葛亮式的后验视角为推理与动作重新打分;同时设计了严格的门控机制。

ExpG:以经验沉淀定义工具边界,阿里等让小模型调用反超大模型

为此,研究团队提出了名为 ExpG (Experience-Driven adaptive Guidance)的自适应引导机制。该方法不再把工具调用视为孤立、静态黑盒事件,而是将其转化为可归因、可沉淀、可复用的结构化经验池。通过动态构建每个工具的能力边界与最佳实践,ExpG 实现了全链路的稳健调用。

SCHEMA:用知识拓扑揪出科研Agent幻觉,终局正确率与推理过程严重脱钩

通过这种方式,SCHEMA 提出了 拓扑加权幻觉严重性指标 ( )。借助自动化的知识图谱构建流程,SCHEMA 涵盖了从分子机制(蛋白质域)到复杂病理交互(PathVQA-Enhanced)的不同复杂度基准,并基于图谱节点度数将概念划分为核心层(Core)、外围层(Peri.)和图外层(Off)。

Video-DeepResearch:解耦感知与检索,开源35B超越Claude-4.5

针对这一困境,研究团队提出了首个面向连续视频流的深度研究智能体框架 Video-DeepResearch (简称 Video-DR )。该工作打破了传统智能体自由调用工具的既定思维,提出了一种“感知与探索解耦”的分阶段工具解锁机制,强迫模型在跨帧完成穷尽的时空视觉定位之后,才被允许访问外部网络检索。

微软238万次评测:跨语言Agent看似答对,背后动作策略为何只保留72%?

然而实验结果显示,模型的指令遵循率不足 1%。即便面临违规惩罚,大模型依然顽固地使用英语枢纽来拆解任务。这解释了那近 30% 的策略丢失从何而来:非英语语种被迫引入的翻译转换步骤、由翻译不准确诱发的二次重试、以及从非英语跨越到英语所导致的 Token 消耗与推理路径扭曲。

复旦FlowScout:执行反馈驱动图搜索,工具调用正确率提升92.69%

针对这一核心瓶颈,来自复旦大学的研究团队提出了名为 FlowScout 的自动化生成框架。FlowScout 不再让大模型空想工作流,而是把工作流形式化为兼具语义推理与真实工具调用的有向无环图,并利用真实执行反馈指导蒙特卡洛树搜索(MCTS)进行拓扑变异。

ForestBench:告别裁判大模型,用参考森林实现多智能体毫秒级评测

来自中国科学院、西南大学和腾讯的研究团队在论文中提出了全新评测基准 ForestBench 。该方案跳出了大模型主观判分的窠臼,将异构的多智能体原生执行轨迹映射到统一的有向无环协作图(DAG)空间中,并提出了“参考森林”(Reference Forest)的概念。

华为提出MindMemOS:从静态存储走向自演化记忆,LOCOMO准确率达到94%

MindMemOS 从根本上重构了记忆的表征形态,提出“实体–属性–时间”三维组织图谱,并配套开发了一套能够主动演化的算法引擎:在线通过紧凑检索与动态图融合吸收上下文,离线通过类似人类睡眠的“做梦(Dreaming)”机制合并冗余与化解冲突;同时,它利用用户的隐式纠错信号完成校准。

Meta发布OmnilingualGAIA2:前沿Agent非英语能力全线暴跌8.8至18.4分

为了彻底厘清这一因果关系,Meta 团队提出了一套分层错误归因体系,结合自动化分类与人工语言学家的双重验证,对出现跨语言落差的场景样本进行了严格拆解。归因结果显示,这并非评测噪音主导的假象: - 55% 归因于纯粹的模型能力缺陷 :在这些场景中,翻译文本完全通顺无误,判官判定也公正无私。