WikiLoop:让检索反馈反哺知识库构建,多文档问答提升 6.3 分
腾讯的研究团队在论文中提出了名为 WikiLoop 的反馈耦合框架,尝试打破这一长期存在的单向壁垒。该方案的核心思路在于:构建一套专为智能体机器导航设计的原生维基知识库(Agent-Native Wiki),并将知识库构建者(Builder)与检索导航者(Navigator)的策略整合进同一个...
腾讯的研究团队在论文中提出了名为 WikiLoop 的反馈耦合框架,尝试打破这一长期存在的单向壁垒。该方案的核心思路在于:构建一套专为智能体机器导航设计的原生维基知识库(Agent-Native Wiki),并将知识库构建者(Builder)与检索导航者(Navigator)的策略整合进同一个...
为了攻克这一难题,来自韩国科学技术院(KAIST)与 DeepAuto.ai 的研究团队提出了一种无需重新训练参数的全新框架:Agent Memory Distillation(AMD,智能体记忆蒸馏)。
来自范德堡大学(Vanderbilt University)的研究团队提出了名为 PMCoder 的软件修复智能体,核心机制在于将分层阶段规划器(Hierarchical Phase Planner)与情境记忆(Episodic Memory)进行深度双向耦合。
针对这种“高开销”与“信息丢失”的死锁,合肥工业大学的研究团队提出了轻量级长期记忆框架 LeanMem。该方案的核心洞察在于: 人类对话产生的信息天然具有异构性,试图用单一、均匀的“摘要-检索”流水线去处理所有对话历史,在底层逻辑上就是行不通的。
由北京邮电大学、复旦大学、南洋理工大学、北京大学、上海交通大学等多所高校联合提出的最新研究 MemPrism ,指出了一个长期被忽视的底层瓶颈: 检索后表征失配(Post-retrieval Representation Mismatch) 。
针对这一痛点,来自南洋理工大学、中山大学与腾讯的研究团队提出了统一记忆管理框架 VerMem (Verifiable Memory)。该工作打破了长短期记忆的割裂设计,通过一个统一的策略网络调度 7 种原子级记忆操作。
然而,伊利诺伊大学厄巴纳-香槟分校(UIUC)的最新研究提出了一个截然相反且直击痛点的论断: Agent 在长程交互中犯错,往往不是因为“找不到事实”,而是因为“记错了版本”。随着交互时间推移,现实世界中的事实、用户约束、项目决策都在不断被修改、推翻或重新计算。
基于这些长周期数据,EgoMonth 提出了一个受到认知心理学与工作记忆理论启发的 14 任务评估体系,将其清晰地划分为由浅入深的三个认知层级: 1. 图式巩固(Schema Consolidation) :评估模型从长时间高度冗余的生活记录中提取稳定行为模式与统计规律的能力。
来自深圳国际工业与应用数学中心、中大深圳、深数院以及中山大学等机构的研究团队提出了 ERSkill(Evolving Retrieval Skill) 框架。这项工作跳出了“只优化记忆构建或推理引导”的旧范式,首次将 记忆检索行为本身 抽象为可执行、可组合的原语序列。
研究团队在系统梳理了 2023 至 2026 年间 52 个代表性记忆增强智能体系统后,指出了当前评测的三大结构性缺陷。超过六成的评测指标被完全集中在 LoCoMo 和 LongMemEval 等纯对话问答基准上,而真正考察工具调用、环境交互与顺序决策的智能体任务却长期缺席。
为了系统性测量并攻克这一难题,研究团队构建了包含 3,000 道审计评测的高难度长基准 SCALE-QA ,并提出了 时序-语义交错记忆重构 (Temporal-Semantic Interleaved Memory Reconstruction, TSIM )框架。
针对这一瓶颈,来自西北大学、伊利诺伊大学芝加哥分校与南加州大学的研究团队提出了 HyperSkill 。该框架将智能体的经验记忆形式化为一个 超图(Hypergraph) ,用超边把单次轨迹中的子任务序列、可复用技能与反思教训强绑定在一起,并通过子任务与轨迹级双路检索及基于高阶拓扑的记忆演化。
赋予大语言模型(LLM)长久记忆,曾被视为智能体(Agent)迈向自主工作的关键一步。从项目代码、用户日常偏好到复杂的跨系统业务流程,记忆模块让智能体告别了“单次对话清零”的局限。
前沿大语言模型已经能够在单次前向传播中解决极其复杂的推理问题,其表现足以媲美数年前的独立学术成果。然而,一旦将同一个模型置入智能体(Agent)循环中,要求它独立处理耗时数小时的软件工程或数据分析任务,系统往往会暴露出截然不同的脆弱性:遗忘数步之前的关键决策、在代码只修了一半时便草草宣称任务完...
要让大语言模型(LLM)从只会单轮对话的聊天机器人,蜕变为能长期伴随用户的智能体,外部记忆系统不可或缺。然而,当前主流智能体记忆系统的运行逻辑存在一个隐形却极其昂贵的代价:每产生一轮对话,系统就急于调用一次LLM去抽取实体、总结事实并更新记忆库。
在具身智能、机器人规划和多模态助手的技术演进中,空间智能(SpatialIntelligence)正被视为大模型迈向物理世界的核心基石。然而,即便是当前顶尖的视觉语言模型(VLM),在面对三维空间关系推理、遮挡判断、坐标定位和深度估计时,依然暴露出明显的脆弱性。
硬件算子(HardwareKernel)的优化一直是一项高度依赖专家经验的密集型工程。为了充分榨取硬件性能,工程师需要综合考虑目标设备的内存层次结构、数据搬移策略、并行执行机制以及特定的硬件约束。每一次优化尝试,都必须经历编译、正确性测试、性能剖析(Profiling)和代码修订的漫长循环。
在过去几年中,大语言模型的能力边界得到了极大的拓展,但当我们将这些模型构建为复杂的AIAgent时,一个核心瓶颈始终存在:模型本身是没有记忆的。为了解决这个问题,当前的行业标准做法是依赖检索增强生成(RAG)等外部记忆模块,将历史信息转化为文本片段塞入模型的上下文窗口中。
在长期运行的AIAgent应用中,随着上下文历史不断积累,系统不可避免地会触发记忆压缩机制以适应大语言模型的Token预算限制。然而,现有的工业界压缩策略往往忽视了一个致命问题:一条生死攸关的安全规则和一行无关痛痒的系统执行日志,在Token预算溢出时,正以相同的概率遭到删改。
随着大语言模型(LLM)Agent部署场景的复杂化,其工作周期早已突破了单一上下文窗口的限制。为了在跨越数月的回话或代码维护中保持一致性,持久化的外部记忆成为了核心设计。
当前,大语言模型的应用范式正在从单次对话向终身学习智能体(LifelongAgents)快速演进。为了应对复杂任务,这类智能体需要记住用户的偏好、迭代行动计划、积累工具使用经验,并在长周期的交互中保持敏捷的响应。然而,现有的基础设施在这方面正面临一个隐蔽却致命的瓶颈。
随着大语言模型基础能力的飞跃,当前的AI智能体已经能够处理极长的上下文,熟练调用外部工具,并执行跨度极长的复杂任务。然而,当这些智能体被部署在真实的长期交互场景中时,它们不可避免地会遇到一个核心瓶颈:如何有效地记住并利用历史经验。
当前的大语言模型智能体(LanguageAgents)普遍遵循着“观察-推理-行动”的经典循环,但它们所依赖的外部记忆,往往被隔离在这个核心循环之外。在现有的主流架构中,外部记忆通常被当作一个独立的数据库,智能体在每个对话轮次(Turn)开始时最多只查询一次。
当前,大语言模型(LLM)本身是无状态的。如果希望一个AI智能体(Agent)能在数月甚至数年间持续陪伴用户、积累知识,它就必须拥有一套强大的长期记忆“外挂”系统。