知识系统

提速60%的BoundaryRouter:揭秘LLM与Agent冷启动智能路由

在实际的业务落地中,大型语言模型面对复杂任务常显力不从心。为了提升性能,开发者往往会引入具备工具调用能力的智能体。然而,智能体的算力成本和推理延迟往往让人望而却步。事实上,许多基础查询完全在轻量级模型的原生能力边界之内。它们根本不需要启动完整的智能体执行流。近期,多所顶尖高校联合提出了一项名为...

从“死记硬背”到“经验直觉”:LLM智能体记忆机制的三阶进化论

很多开发者在构建大模型智能体时,常会遇到一个非常棘手的问题。给智能体配备了外部工具,写了超长的提示词,但它在多步复杂任务中依然会“断片”。它要么在同一个地方重复犯下逻辑错误,要么在动态变化的环境中彻底迷失了最初的目标。根本原因在于,大语言模型(LargeLanguageModel,LLM)本身...

SimpleMem: Efficient Lifelong Memory for LLM Agents

SimpleMem:让Agent记忆成本暴降30倍!F1提升26.4%的“语义无损压缩”新架构。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

MemEvolve: Meta-Evolution of Agent Memory Systems

让Agent自己“进化”大脑?MemEvolve实现17%性能跃升与跨模型泛化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Fast-weight Product Key Memory

Sakana AI新作:赋予模型“即时记忆”,4K训练竟能泛化至128K长文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

General Agentic Memory Via Deep Research

AI记忆革命GAM:用“即时研究”取代静态压缩,长文本任务准确率超90%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

CAMformer: Associative Memory is All You Need

CAMformer横空出世:Attention能效飙升10倍,用联想记忆取代矩阵乘法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

HaluMem: Evaluating Hallucinations in Memory Systems of Agents

AI Agent记忆也“幻觉”?HaluMem:首个记忆系统“CT扫描”基准,精准定位错误根源。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Dynamic Affective Memory Management for Personalized LLM Agents

本文提出了一种名为DAM-LLM的动态情感记忆管理系统,通过引入基于贝叶斯的更新机制和记忆熵概念,使智能体能够自主维护一个动态更新的记忆数据库,以解决传统静态记忆的冗余、过时和一致性差的问题,从而提供更具个性化的情感交互。

LLM-empowered knowledge graph construction: A survey

本文系统性地综述了大型语言模型(LLM)如何重塑知识图谱(KG)构建的全流程,通过分析本体工程、知识抽取和知识融合三个核心阶段的新兴范式,揭示了从传统方法向语言驱动、生成式框架的转变。

Continual Learning via Sparse Memory Finetuning

本文提出了一种名为稀疏内存微调(sparse memory finetuning)的方法,通过仅更新与新知识高度相关的、利用TF-IDF筛选出的极少数内存槽位,使大型语言模型在学习新知识的同时,显著减少了灾难性遗忘。

Efficient Memory Management for Large Language Model Serving with PagedAttention

本文提出 PagedAttention,一种受操作系统虚拟内存和分页机制启发的注意力算法,通过将键值缓存(KV Cache)划分为非连续的内存块进行管理,解决了大型语言模型(LLM)服务中因内存碎片化和无法共享而导致的效率低下问题,从而在 vLLM 系统中实现了 2-4 倍的吞吐量提升。