RAG

手机操作不再断片!UI-Copilot凭副驾驶机制实现GUI任务17.1%性能跃升

当用户要求手机上的智能助手“帮我核对上个月的账单,计算出餐饮开销占比并填入新的备忘录”时,大多数现有的AI助手在点击了几次屏幕后,往往会陷入迷茫。它们要么忘了最初要找什么,要么算错了数据,甚至一直在同一个页面里无意义地来回滑动。

打破“专机专用”魔咒:基础大模型重塑通用机器人的核心机制与局限

长期以来,人工智能在物理世界面临着一个尴尬的困境:机器人在工厂里极其精准,但只要光线微调或零件偏移,它们就会立刻宕机。这种“专机专用”的模式,要求开发者为每一个特定任务收集数据、定制算法并在受限环境中部署。然而,自然语言处理和计算机视觉领域的基础大模型,却展现出了惊人的开放世界泛化能力。

解构1947篇顶会论文:IdeaSpark提炼15大创新模式,重塑AI科研

当前的大语言模型在科研头脑风暴中似乎无所不能,生成候选研究方向往往只需几秒钟。然而,真实的科学研究需要的远不止天马行空的灵感。研究者必须在浩如烟海的文献中精确锚定问题,识别出具有实际意义的技术瓶颈,与现有的解决方案划清界限,并在投入大量算力资源去复现前,严谨地评估潜在风险。

突破智能体孤岛:MATM共享Agent轨迹记忆,任务成功率提升17%

当前的大语言模型智能体在执行各类复杂任务时,会产生大量高价值的中间轨迹。然而,这些包含丰富过程知识的交互数据,通常在单次使用后就被直接丢弃。或者仅被生产该轨迹的单一智能体私有保留。这种“阅后即焚”的孤岛模式,导致新实例化的智能体被迫反复重新探索已存在的解决方案。

LightMem:小模型重构Agent记忆,检索仅83ms,F1提升2.5

Agent在处理长线任务时,往往深深受困于记忆系统的技术瓶颈。目前主流的记忆架构,普遍面临着一个极为尴尬的“两难困境”。传统基于向量检索的系统响应极快,但极其容易召回大量无关的错误噪声。如果直接让超大参数模型接管记忆操作,检索的准确率虽然有所提升。但随之而来的是难以忍受的累积延迟,以及极其高昂...

放弃提示词!Harness架构打造120/120满分企业级Agent

许多企业级大模型应用在原型阶段表现惊艳,往往只需一段系统提示词加上基础的检索增强生成(Retrieval-AugmentedGeneration,RAG)就能在演示环境跑通业务逻辑。然而一到真实商业环境落地,合规溯源、权限路由和输出审计等严苛要求,会让单纯依赖提示词的系统瞬间崩溃。

纵览124篇文献:LLM智能体动态技能库的八阶段生命周期揭秘

当大语言模型从简单的对话助手,逐步深入并接管实际的工作流时,一个严峻的核心瓶颈浮出水面。这种瓶颈并非模型单次推理能力的不足,而是智能体(Agent)能否在重复性任务中复用过程知识。如果每次遇到相似任务,智能体都要在有限的上下文窗口中从头推导策略,这显然低效且不可靠。

问卷调查走向死局?AI新架构A-TLM零偏差击败三大传统算法

现如今,发一份在线问卷,你收回的可能是大量机器刷单、AI辅助作弊以及随意乱填的“无效数据”。这种数据质量危机正在悄无声息地摧毁社会科学的基石。在争分夺秒的灾害响应研究中,情况更为致命。受灾最严重的人往往处于断网、流离失所或极度焦虑的状态,他们根本没时间填满冗长的问卷。这导致收集到的数据出现成片...

大模型长记忆返璞归真:Nano-Memory极简检索法降低近半Token消耗

随着智能体与用户的交互日益频繁,让大语言模型记住几个月甚至一年前的冗长对话,已成为各大研究团队竞相攻克的难题。为了实现这种长期记忆,现有的主流方案往往走向了无休止的“堆料”之路。从极其复杂的层次化摘要,到繁琐的强化学习图谱构建,亦或是引入专门的记忆层与模型权重更新,记忆系统变得越来越臃肿。

突破纯文本瓶颈!增强语言模型(ALMs)如何用推理与工具重塑AI边界

尽管以大语言模型为核心的技术已深入数百万人的日常,它们依然面临着不可忽视的工程痛点。纯统计的语言建模范式带来了令人头疼的幻觉,模型在复杂数学计算和实时信息获取上也总是捉襟见肘。为了打破纯文本生成的局限,学术界正在推动一场大规模的范式转移。

告别“单机时代”:首篇AI Agent通信协议双维分类指南

当无数大语言模型驱动的Agent在企业客服、代码生成和数据分析领域遍地开花时,一个致命的系统性瓶颈已悄然浮现。这些Agent虽然具备强大的推理与执行能力,但它们大多是彻头彻尾的“语言孤岛”。不同厂商、不同架构的Agent各自为战,无法顺畅调用外部数据,更难以实现多智能体间的无缝协作。

Tackling the Inherent Difficulty of Noise Filtering in RAG

RAG去噪为何这么难?人大清华揭秘“三元困境”,非线性微调让LLM自带“过滤器”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Memory in the Age of AI Agents

Agent记忆≠RAG!复旦/NUS重磅综述:3大维度全景拆解智能体“大脑”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

DoPE: Denoising Rotary Position Embedding

LLM长文本“失效”有救了!DoPE:免训练为RoPE降噪,解锁64K超长上下文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Retrieval Augmented Generation (RAG) for Fintech: Agentic Design and Evaluation

本文提出了一种专为金融科技(Fintech)领域设计的智能体化检索增强生成(Agentic Retrieval-Augmented Generation, A-RAG)架构,通过一个由专业智能体组成的模块化、迭代式流水线,有效解决了领域内术语密集、缩写混杂和知识碎片化等挑战,显著提升了检索精度...

LLM-guided Hierarchical Retrieval

本文提出了一种名为 LATTICE 的LLM引导分层检索框架,通过将海量文档组织成语义树,并让大型语言模型(LLM)基于创新的校准路径相关性得分进行推理和导航,从而以对数级的搜索复杂度高效解决复杂的推理密集型查询。

Less LLM, More Documents: Searching for Improved RAG

本文通过系统性实验证明,在检索增强生成(Retrieval-Augmented Generation, RAG)系统中,扩大检索语料库的规模可以作为一种有效的替代方案来弥补使用较小语言模型(LLM)所带来的性能差距,为构建更高效、更易于部署的RAG系统提供了新的权衡思路。

RAGs to Riches: RAG-like Few-shot Learning for Large Language Model Role-playing

本文提出了一种名为 RAGs-to-Riches 的新颖提示框架,它将大语言模型(LLM)的角色扮演问题重构为一个类似检索增强生成(RAG)的文本检索任务,通过使用精心策划的、源于训练数据之外的参考范例,显著增强了模型在面对敌对用户时保持角色一致性的能力。

Improving Context Fidelity via Native Retrieval-Augmented Reasoning

本文提出了一种名为CARE的新型原生检索增强推理框架,通过教导大型语言模型(LLM)在推理链中动态地从输入上下文中检索并整合证据,以解决上下文失真问题,从而在无需昂贵外部工具的情况下显著提升答案的准确性和忠实度。

On the Theoretical Limitations of Embedding-Based Retrieval

本文通过连接学习理论与嵌入式检索,从理论和实证上证明了单向量嵌入模型因其维度限制,无法表示所有可能的相关文档组合,并构建了一个名为LIMIT的简单数据集,揭示了即使是当前最先进的模型也存在这一根本局限性。

Retrieval-Augmented Generation for Large Language Models: A Survey

本文系统性地综述了大型语言模型(LLM)的检索增强生成(Retrieval-Augmented Generation,RAG)技术,将其发展划分为朴素(Naive)、高级(Advanced)和模块化(Modular)三个范式,并深入剖析了检索、生成与增强这三大核心组件的前沿技术、评估体系及未来挑战。

ImageBind: One Embedding Space To Bind Them All

本文提出 ImageBind,一种仅通过将图像与其他多种模态(文本、音频、深度、热成像、IMU)的数据进行配对,就能学习到一个统一的多模态联合嵌入空间,并由此涌现出跨模态对齐与组合等新能力的方法。