提速60%的BoundaryRouter:揭秘LLM与Agent冷启动智能路由
在实际的业务落地中,大型语言模型面对复杂任务常显力不从心。为了提升性能,开发者往往会引入具备工具调用能力的智能体。然而,智能体的算力成本和推理延迟往往让人望而却步。事实上,许多基础查询完全在轻量级模型的原生能力边界之内。它们根本不需要启动完整的智能体执行流。近期,多所顶尖高校联合提出了一项名为...
在实际的业务落地中,大型语言模型面对复杂任务常显力不从心。为了提升性能,开发者往往会引入具备工具调用能力的智能体。然而,智能体的算力成本和推理延迟往往让人望而却步。事实上,许多基础查询完全在轻量级模型的原生能力边界之内。它们根本不需要启动完整的智能体执行流。近期,多所顶尖高校联合提出了一项名为...
很多开发者在构建大模型智能体时,常会遇到一个非常棘手的问题。给智能体配备了外部工具,写了超长的提示词,但它在多步复杂任务中依然会“断片”。它要么在同一个地方重复犯下逻辑错误,要么在动态变化的环境中彻底迷失了最初的目标。根本原因在于,大语言模型(LargeLanguageModel,LLM)本身...
SimpleMem:让Agent记忆成本暴降30倍!F1提升26.4%的“语义无损压缩”新架构。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
模拟大脑“胶质细胞”!RMAAT解锁线性注意力,长序列训练显存效率暴涨。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
单卡全量微调MoE大模型?RevFFN让显存占用减半,性能超越LoRA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
QwenLong-L1.5:挑战GPT-5,揭秘400万字长文本推理的“后训练”秘籍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
打破LLM能效瓶颈:32KB缓存+1.4GHz高频竟是最佳硬件甜点?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MoEBlaze:打破显存墙!Meta提出MoE训练新框架,速度飙升4倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别微调!MemRL:用“记忆RL”让Agent在运行时实现自我进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别AI“健忘症”:Memoria利用加权知识图谱打造可扩展的个性化记忆。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让Agent自己“进化”大脑?MemEvolve实现17%性能跃升与跨模型泛化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
准确率飙升至91%!Hindsight:让20B模型记忆力超越GPT-4o。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
给 AI 装上“橡皮擦”:MaRS 架构如何用“遗忘”换取 0.911 的高分表现?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Sakana AI新作:赋予模型“即时记忆”,4K训练竟能泛化至128K长文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
阿里CoMeT:32k训练解锁100万长文,显存恒定,告别KV Cache爆炸。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
给大模型装上“类脑记忆”:CogMem三层架构破解长对话遗忘难题,多轮推理更像人。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI记忆系统的“脑科学”革命:复旦哈工大万字综述,揭秘智能体进化的核心。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agentic Memory:让LLM像人类一样“自主管理”记忆,长程推理能力暴涨49%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
记忆即算力?阿里ReMe让8B模型超越14B,揭秘动态记忆进化论。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI记忆革命GAM:用“即时研究”取代静态压缩,长文本任务准确率超90%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
CAMformer横空出世:Attention能效飙升10倍,用联想记忆取代矩阵乘法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent记忆也“幻觉”?HaluMem:首个记忆系统“CT扫描”基准,精准定位错误根源。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让Agent经验“活”起来:可训练图记忆,助小模型性能飙升25.8%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为DAM-LLM的动态情感记忆管理系统,通过引入基于贝叶斯的更新机制和记忆熵概念,使智能体能够自主维护一个动态更新的记忆数据库,以解决传统静态记忆的冗余、过时和一致性差的问题,从而提供更具个性化的情感交互。
本文系统性地综述了大型语言模型(LLM)如何重塑知识图谱(KG)构建的全流程,通过分析本体工程、知识抽取和知识融合三个核心阶段的新兴范式,揭示了从传统方法向语言驱动、生成式框架的转变。
本文提出了一种名为稀疏内存微调(sparse memory finetuning)的方法,通过仅更新与新知识高度相关的、利用TF-IDF筛选出的极少数内存槽位,使大型语言模型在学习新知识的同时,显著减少了灾难性遗忘。
本文为解决递归 Transformer 的性能瓶颈,提出了以下关键概念。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了“功能性Token假说” (Function Token Hypothesis),揭示了语言模型中的一小部分高频Token(功能性Token)在记忆检索和巩固中扮演着核心角色:在推理时激活上下文中的预测性特征,在预训练时驱动模型学习和扩展新特征。
本文的核心论点建立在对认知科学概念的借鉴和对机器学习泛化能力的重新审视之上。以下是理解本文至关重要的核心概念。
本文提出了Memory-R1框架,通过强化学习(RL)训练两个专门的智能体——一个用于结构化记忆操作的内存管理器和一个用于筛选并推理记忆的回答智能体,从而使大型语言模型(LLM)能够主动、自适应地管理和利用外部记忆,显著提升了其长时程推理能力。
本文提出 PagedAttention,一种受操作系统虚拟内存和分页机制启发的注意力算法,通过将键值缓存(KV Cache)划分为非连续的内存块进行管理,解决了大型语言模型(LLM)服务中因内存碎片化和无法共享而导致的效率低下问题,从而在 vLLM 系统中实现了 2-4 倍的吞吐量提升。