FinPerMA:阿里提出个性化记忆基准,大模型全上下文准确率不足47%
FinPerMA:这项研究不仅揭开了大模型在“动态偏好演化”上的认知短板,也对 Agent 记忆系统的工程设计提出了深刻反思。要衡量一个 Agent 是否真正具备个性化能力,金融咨询是一个绝佳的试验场。
FinPerMA:这项研究不仅揭开了大模型在“动态偏好演化”上的认知短板,也对 Agent 记忆系统的工程设计提出了深刻反思。要衡量一个 Agent 是否真正具备个性化能力,金融咨询是一个绝佳的试验场。
近期提出的 MaAS 虽然尝试通过超网(Supernet)采样单样本结构,但其超网依然在离线阶段被冻结,无法结合运行时的反馈调整结构。针对这一困境,最新研究提出了 GRAFT (Global Optimization and Inference-Time Region Grafting)。
FutureBridge-OPD:来自美团等机构的研究者在论文《Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation》...
Scale AI 提出的这套以交互为中心的归因体系,其终极价值在于将智能体系统的迭代从盲目调优拉回到精准工程。在未来的智能体流水线中,自动化链路追踪工具可以在执行中断的瞬间,自动抓取交互边状态并运行根因分析:如果责任侧在模型,自动化数据飞轮便精准捕获该样本作为下一代后训练的失败用例;如果责任侧...
针对这一长期被基准评测忽视的现实需求,来自哈尔滨工业大学、美团与鹏城实验室的研究团队提出了 MT-Web2Code 。这是首个专注于多轮宏观区域重构(Macro-Level Regional Reconstruction)与微观局部微调(Micro-Level Localized Modifi...
实验结果显示,以 GLM-5.2 作为驱动底座的 OneDayAgent 取得了 0.821 的综合得分,显著超越基准官方测试的各类通用智能体方案。在遵循指令、事实准确性、逻辑完备性等维度,以及无论是否携带多模态附件的测试组中,该方案均取得了全面领先。消融实验进一步证实了各个模块的必要性。
为了破解这一难题,研究团队提出了 RecHarness 。这项工作并未试图训练一个无所不能的端到端超大模型,而是退后一步,为大模型 Agent 建立了一套结合统计决策与程序生成的双层分流驾驭架构(Harness)。
研究团队据此提出了 门控后视蒸馏(Gated Hindsight Distillation, 简称 GHD) 。该方法在训练时引入一个参数完全共享的“教师视角”,让它额外观察到下一帧真实截图,从而利用事后诸葛亮式的后验视角为推理与动作重新打分;同时设计了严格的门控机制。
为此,研究团队提出了名为 ExpG (Experience-Driven adaptive Guidance)的自适应引导机制。该方法不再把工具调用视为孤立、静态黑盒事件,而是将其转化为可归因、可沉淀、可复用的结构化经验池。通过动态构建每个工具的能力边界与最佳实践,ExpG 实现了全链路的稳健调用。
通过这种方式,SCHEMA 提出了 拓扑加权幻觉严重性指标 ( )。借助自动化的知识图谱构建流程,SCHEMA 涵盖了从分子机制(蛋白质域)到复杂病理交互(PathVQA-Enhanced)的不同复杂度基准,并基于图谱节点度数将概念划分为核心层(Core)、外围层(Peri.)和图外层(Off)。
针对这一困境,研究团队提出了首个面向连续视频流的深度研究智能体框架 Video-DeepResearch (简称 Video-DR )。该工作打破了传统智能体自由调用工具的既定思维,提出了一种“感知与探索解耦”的分阶段工具解锁机制,强迫模型在跨帧完成穷尽的时空视觉定位之后,才被允许访问外部网络检索。
AntiSkillBench:研究者构建了 50 个背景高度丰富、具有不同大五人格(Big Five)特征及沟通风格的虚拟用户画像,设计了涵盖通用助理、数学计算、工具调用等多场景的 2,500 条对话轨迹。
破局的关键,在于提出了类似网络协议分层思想的 Agent Task Protocol(ATP)。在 Task Layer 中,ATP 抽象出了四类核心标准对象:TaskInput、AgentBinding、AgentRunner 以及 TaskTrace。
针对这一核心痛点,Samsung Research America 的研究团队提出了 Latent Critic 架构。该方案并没有引入庞大的外部检查模型,而是通过一个与冻结基座模型并行推理的轻量级低秩适配器(LoRA)。
然而实验结果显示,模型的指令遵循率不足 1%。即便面临违规惩罚,大模型依然顽固地使用英语枢纽来拆解任务。这解释了那近 30% 的策略丢失从何而来:非英语语种被迫引入的翻译转换步骤、由翻译不准确诱发的二次重试、以及从非英语跨越到英语所导致的 Token 消耗与推理路径扭曲。
来自蚂蚁集团、普林斯顿大学与斯坦福大学的研究团队在最新论文中给出了截然不同的解法,他们提出了名为 AQuA (Recursively Self-Improving Quantitative Trading Research Agents)的量化投研系统。
针对这一困境,来自蚂蚁集团、清华大学、明尼苏达大学和浙江大学的研究团队提出了一套名为 HARD (Harness-based Autonomous Runtime Defense Evolution)的自演化运行时防御框架。
卡耐基梅隆大学(Carnegie Mellon University, CMU)机器人研究所的研究团队针对这一系列瓶颈,推出了全新的协同多智能体闭环评测基准 CMU-Drive ,并提出了首个将协同感知、语言推理与动作规划集于一体的基础模型 V2V-VLA 。
针对这一核心瓶颈,来自复旦大学的研究团队提出了名为 FlowScout 的自动化生成框架。FlowScout 不再让大模型空想工作流,而是把工作流形式化为兼具语义推理与真实工具调用的有向无环图,并利用真实执行反馈指导蒙特卡洛树搜索(MCTS)进行拓扑变异。
来自中国科学院、西南大学和腾讯的研究团队在论文中提出了全新评测基准 ForestBench 。该方案跳出了大模型主观判分的窠臼,将异构的多智能体原生执行轨迹映射到统一的有向无环协作图(DAG)空间中,并提出了“参考森林”(Reference Forest)的概念。
FrontierFinance:他们提出了“细粒度、源头可归因准则”(Source-Attributed Rubrics)评分机制。每一个复杂查询都被专业金融专家拆解为数个到数十个必须满足的事实判断准则,总计构成了 11,543 条二元判据。
MindMemOS 从根本上重构了记忆的表征形态,提出“实体–属性–时间”三维组织图谱,并配套开发了一套能够主动演化的算法引擎:在线通过紧凑检索与动态图融合吸收上下文,离线通过类似人类睡眠的“做梦(Dreaming)”机制合并冗余与化解冲突;同时,它利用用户的隐式纠错信号完成校准。
为了彻底厘清这一因果关系,Meta 团队提出了一套分层错误归因体系,结合自动化分类与人工语言学家的双重验证,对出现跨语言落差的场景样本进行了严格拆解。归因结果显示,这并非评测噪音主导的假象: - 55% 归因于纯粹的模型能力缺陷 :在这些场景中,翻译文本完全通顺无误,判官判定也公正无私。
针对这一瓶颈,OPPO 联合深圳河套研究院、中山大学及香港中文大学(深圳)的研究团队提出了名为 SCOUT (Self-Checking Chain-Of-Tool-thought)的具备恢复感知能力的智能体框架。