RAG

MathForm:知识检索+验证迭代,8B小模型形式化准确率反超32B

为了打破这一僵局,来自面壁智能(ModelBest)与清华大学的研究团队提出了 MathForm 框架。该研究彻底颠覆了“一次性黑盒翻译”的旧范式,将自动形式化重构为“检索规划—编译器诊断—语义一致性校验—多轮修正”的闭环系统。

代码Agent找文件太费Token?CodeGrep精准检索缩减19%开销

来自网易与独立研究者团队提出了名为 CodeGrep 的专用代码检索智能体,试图从架构层彻底重塑这一交互链路。他们基于 Qwen3-14B 模型,通过 GRPO(Group Relative Policy Optimization)强化学习端到端训练了一个轻量化检索专职模型。

DeepMind与哈佛揭示大模型交互盲区:欠指定程度越高,越爱盲目提前作答

DeepMind:如果在前一到两轮,模型由于搜索空间过于宽泛而提出了边缘化、无信息增益的问题,其在后续轮次中自主“纠偏”的能力极其孱弱。早期恢复斜率分析证实,大部分开源与闭源模型在偏离正确依赖路径后,随着交互轮次增加,其累积不确定性不仅没有减少,反而因为无序信息注入导致状态塌陷,提问越来越盲目。

EnterpriseRAG:单约束达标84%综合仅27%!企业RAG面临协同断崖

针对这一严重的工业落地痛点,中国移动等机构的研究团队提出了全新的基准测试集 EnterpriseRAG 。该项研究揭示了一个此前被传统基准广泛忽视的残酷事实:在真实的复杂约束条件下,主流大模型对单个指令约束的平均满足率虽然可以达到 80% 到 84%,但当多条约束组合施加时。

RippleMem:告别单次匹配,图构建降本30倍的智能体长记忆联想法

针对这一症结,来自中国传媒大学媒体融合与传播国家重点实验室和智联英和技术团队提出了全新长程记忆框架 RippleMem 。该框架打破了传统记忆系统“单次孤立检索(Isolated Retrieval)”的思维定式,转而借鉴人类认知心理学中的情景记忆激活机制。

AutoIndex:把文档索引做成可执行代码,BM25召回率提升30.5%

来自 Databricks 与马萨诸塞大学阿默斯特分校(UMass Amherst)的研究团队在最新论文中提出了一个截然不同的视角: 文档在进入检索系统前的表示形式,不应该是一成不变的预处理超参数,而应当被视作可优化的代码程序 。基于这一理念,他们推出了名为 AutoIndex 的框架。

MegaMem:解耦超大长效记忆与生成证据,6.5亿Token下正确率达86.5%

来自埃默里大学因果动力学实验室(Causal Dynamics Lab, Emory University)的研究团队提出了名为 MegaMem 的超大上下文记忆检索系统,试图从根本架构上破除这一两难处境。其核心洞察在于: 必须将“可检索的持久记忆规模”与“模型生成所消耗的证据上下文”彻底解耦 。

ERSkill:让Agent记忆检索学会自我进化,综合表现最高提升31.3%

来自深圳国际工业与应用数学中心、中大深圳、深数院以及中山大学等机构的研究团队提出了 ERSkill(Evolving Retrieval Skill) 框架。这项工作跳出了“只优化记忆构建或推理引导”的旧范式,首次将 记忆检索行为本身 抽象为可执行、可组合的原语序列。

Memory in the Loop:进程内检索将延迟降至100μs,长上下文召回升至4.8/5

当前的大语言模型智能体(LanguageAgents)普遍遵循着“观察-推理-行动”的经典循环,但它们所依赖的外部记忆,往往被隔离在这个核心循环之外。在现有的主流架构中,外部记忆通常被当作一个独立的数据库,智能体在每个对话轮次(Turn)开始时最多只查询一次。

不是固定Top-K!SkillReranker:基于执行图的Agent自适应技能检索

大模型智能体(Agent)正越来越多地依靠外部技能库来完成复杂任务。相比于完全依赖模型的隐式推理能力,调用封装好的功能代码或API能够显著提升执行的稳定性和成功率。然而,随着技能库规模的不断膨胀,如何精准地为当前任务挑选最合适的技能,成为了制约Agent系统能力上限的瓶颈。

港大等提出EvoGraph-R1:自进化多模态GraphRAG,打破静态检索瓶颈!

检索增强生成(RAG)已经成为大模型解决幻觉和获取外部知识的标准范式。为了让大模型具备更复杂的推理能力,基于知识图谱的GraphRAG逐渐成为当前的研究热点。然而,现有的系统往往潜藏着一个致命缺陷:它们将知识图谱视为一种静态的数据结构。

告别“单机时代”:首篇AI Agent通信协议双维分类指南

当无数大语言模型驱动的Agent在企业客服、代码生成和数据分析领域遍地开花时,一个致命的系统性瓶颈已悄然浮现。这些Agent虽然具备强大的推理与执行能力,但它们大多是彻头彻尾的“语言孤岛”。不同厂商、不同架构的Agent各自为战,无法顺畅调用外部数据,更难以实现多智能体间的无缝协作。

突破纯文本瓶颈!增强语言模型(ALMs)如何用推理与工具重塑AI边界

尽管以大语言模型为核心的技术已深入数百万人的日常,它们依然面临着不可忽视的工程痛点。纯统计的语言建模范式带来了令人头疼的幻觉,模型在复杂数学计算和实时信息获取上也总是捉襟见肘。为了打破纯文本生成的局限,学术界正在推动一场大规模的范式转移。