“停药”变“给药”余弦仍达0.96?Agent相似度门控审计:56个语义反转拦截为0
” 然而,由 Eigenforma 与 Freemind Labs 联合开展的一项最新测量学审计研究表明,这套遍布生产环境的机制在回答的其实是另一个截然不同的问题:“这段文本的字面措辞改变了多少?
” 然而,由 Eigenforma 与 Freemind Labs 联合开展的一项最新测量学审计研究表明,这套遍布生产环境的机制在回答的其实是另一个截然不同的问题:“这段文本的字面措辞改变了多少?
为了打破这一僵局,来自面壁智能(ModelBest)与清华大学的研究团队提出了 MathForm 框架。该研究彻底颠覆了“一次性黑盒翻译”的旧范式,将自动形式化重构为“检索规划—编译器诊断—语义一致性校验—多轮修正”的闭环系统。
针对这种 检索与分析的结构性失配 (Retrieval–Analysis Mismatch),一项最新研究提出了 AdaMM (Adaptive Multi-view Memory)框架。
实验结果令人振奋:在 51 万篇全量语料抽样的 150 道严苛测试题上,基于裸文件系统的原生 Agent 得分仅为 36.9,纯 Native BM25 的基线得分为 54.8,而切换为“Agent + BM25”之后,综合得分一举飙升至 69.4!
来自网易与独立研究者团队提出了名为 CodeGrep 的专用代码检索智能体,试图从架构层彻底重塑这一交互链路。他们基于 Qwen3-14B 模型,通过 GRPO(Group Relative Policy Optimization)强化学习端到端训练了一个轻量化检索专职模型。
针对这一问题,该研究提出了包含 61,228 个技能的新基准 SkillReason-Bench ,并设计了名为 SkillReason 的双阶段推理增强框架。
DeepMind:如果在前一到两轮,模型由于搜索空间过于宽泛而提出了边缘化、无信息增益的问题,其在后续轮次中自主“纠偏”的能力极其孱弱。早期恢复斜率分析证实,大部分开源与闭源模型在偏离正确依赖路径后,随着交互轮次增加,其累积不确定性不仅没有减少,反而因为无序信息注入导致状态塌陷,提问越来越盲目。
针对这一严重的工业落地痛点,中国移动等机构的研究团队提出了全新的基准测试集 EnterpriseRAG 。该项研究揭示了一个此前被传统基准广泛忽视的残酷事实:在真实的复杂约束条件下,主流大模型对单个指令约束的平均满足率虽然可以达到 80% 到 84%,但当多条约束组合施加时。
针对这一瓶颈,来自字节跳动、北京大学和上海交通大学的研究团队提出了全新的解决方案 SkillLens 。该方案将非结构化的人机交互经验重构成一种名为 视觉技能卡 (Visual Skill Cards, VSC)的状态条件记忆单元,并在推理时采用“低开销检索与按需视觉展开解耦”的机制。
针对这一症结,来自中国传媒大学媒体融合与传播国家重点实验室和智联英和技术团队提出了全新长程记忆框架 RippleMem 。该框架打破了传统记忆系统“单次孤立检索(Isolated Retrieval)”的思维定式,转而借鉴人类认知心理学中的情景记忆激活机制。
来自 Databricks 与马萨诸塞大学阿默斯特分校(UMass Amherst)的研究团队在最新论文中提出了一个截然不同的视角: 文档在进入检索系统前的表示形式,不应该是一成不变的预处理超参数,而应当被视作可优化的代码程序 。基于这一理念,他们推出了名为 AutoIndex 的框架。
来自埃默里大学因果动力学实验室(Causal Dynamics Lab, Emory University)的研究团队提出了名为 MegaMem 的超大上下文记忆检索系统,试图从根本架构上破除这一两难处境。其核心洞察在于: 必须将“可检索的持久记忆规模”与“模型生成所消耗的证据上下文”彻底解耦 。
针对这一隐蔽威胁,研究团队同时提出了一种无需调用大模型、零推理开销的输入端防御策略——显著性归一化(Salience Normalization),成功将攻击率压制至 15.3%。传统 RAG 系统在处理知识密集型问答时,通常依赖单次检索匹配。
为此,研究团队提出了 V-Mem 。该框架放弃了在统一表征空间硬碰硬的暴力跨模态检索,转而通过轻量化的“模态路由”解耦多模态记忆管理。在极具挑战性的多模态长记忆基准 Mem-Gallery 上,V-Mem 斩获了 0.825 的 LLM 评测分,远超此前最佳基准的 0.561;在带有输入图像的...
为了打破这种粗暴的信息摄入模式,研究团队提出了名为 SIEVE 的全新交互范式。该框架放弃了传统的 Search–Visit 模式,转向“搜索-检视-获取”(Search–Inspect–Fetch)三段式架构,并深度整合了基于字段的布尔查询语言(Boolean Query Language,...
这项来自神经形态硬件与边缘 AI 领域的研究,提出了名为 PRECOG (Pre-Computed Context Injection,预计算上下文注入)的检索机制,以及面向长期设备记忆的 SMC (Structured Memory Consolidation,结构化记忆整合)架构。
来自深圳国际工业与应用数学中心、中大深圳、深数院以及中山大学等机构的研究团队提出了 ERSkill(Evolving Retrieval Skill) 框架。这项工作跳出了“只优化记忆构建或推理引导”的旧范式,首次将 记忆检索行为本身 抽象为可执行、可组合的原语序列。
为了彻底复原这种复杂性,VAKRA 基于 BIRD-SQL 衍生出的真实数据库生态,构建了覆盖金融、医疗、供应链等 62 个领域的 8000 余个可执行 API。
这项研究提出了名为 QCR (Query-Conditioned Reuse,查询条件化重用)的范式,并搭建了严格控制变量的评测框架。在涵盖 WebArena、WorkArena 和 AppWorld 三大主流环境的 2,391 个长流程任务实例评测中,QCR 在消耗在线 Token 减少 4...
当前的大语言模型智能体(LanguageAgents)普遍遵循着“观察-推理-行动”的经典循环,但它们所依赖的外部记忆,往往被隔离在这个核心循环之外。在现有的主流架构中,外部记忆通常被当作一个独立的数据库,智能体在每个对话轮次(Turn)开始时最多只查询一次。
大模型智能体(Agent)正越来越多地依靠外部技能库来完成复杂任务。相比于完全依赖模型的隐式推理能力,调用封装好的功能代码或API能够显著提升执行的稳定性和成功率。然而,随着技能库规模的不断膨胀,如何精准地为当前任务挑选最合适的技能,成为了制约Agent系统能力上限的瓶颈。
检索增强生成(RAG)已经成为大模型解决幻觉和获取外部知识的标准范式。为了让大模型具备更复杂的推理能力,基于知识图谱的GraphRAG逐渐成为当前的研究热点。然而,现有的系统往往潜藏着一个致命缺陷:它们将知识图谱视为一种静态的数据结构。
当无数大语言模型驱动的Agent在企业客服、代码生成和数据分析领域遍地开花时,一个致命的系统性瓶颈已悄然浮现。这些Agent虽然具备强大的推理与执行能力,但它们大多是彻头彻尾的“语言孤岛”。不同厂商、不同架构的Agent各自为战,无法顺畅调用外部数据,更难以实现多智能体间的无缝协作。
尽管以大语言模型为核心的技术已深入数百万人的日常,它们依然面临着不可忽视的工程痛点。纯统计的语言建模范式带来了令人头疼的幻觉,模型在复杂数学计算和实时信息获取上也总是捉襟见肘。为了打破纯文本生成的局限,学术界正在推动一场大规模的范式转移。