ReFind:不建图不做摘要,智能体直接搜聊天记录反超HippoRAG 2
When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory
在赋予大模型长期记忆能力的军备竞赛中,业界似乎达成了一种不成文的共识:要想让智能体(Agent)准确记住几百轮甚至数千轮之前的对话细节,就必须在问题提出之前,把原始对话提前加工成各种复杂的结构。
ArXiv URL:https://arxiv.org/abs/2608.12888v1
于是,我们看到了各种各样的“预结构化”方案:有的在后台不断用小模型做增量摘要,有的将对话切片并计算向量存入数据库,更激进的方案如 GraphRAG、HippoRAG 2 或 RAPTOR,甚至直接在对话后台实时抽取实体、关系并构建庞大的多层树状结构或知识图谱。这类方案的底层逻辑是一致的——在提问发生之前,通过离线计算“押注”未来的检索需求,试图用结构换取检索质量。但这种做法不仅带来了高昂的构建与增量维护成本,还伴随一个致命缺陷:任何脱水和抽象都是不可逆的信息过滤,提炼阶段被丢弃的琐碎细节,在后续查询时再也无法复原。
来自 MetaStone Technology 与中国科学技术大学的研究团队提出一个尖锐的问题:在长程对话记忆任务中,这些精心构建的记忆结构所带来的增益,到底有多少真正归功于结构本身,又有多少仅仅是因为系统具备了对历史记录的基本检索能力?
为了检验这一猜想,研究者走向了极端:完全不做任何语义预处理,不提取实体,不生成向量,也不做摘要,让原始聊天记录保持原汁原味。 他们开发了一套名为 ReFind 的交互式搜索接口,让智能体像普通人打开微信或 Slack 搜索栏一样,完全由模型自主掌握关键词、时间窗口并逐轮搜寻原始日志。实验结果出人意料:在包含约 2800 道题目的记忆评测基准 MemoryAgentBench 上,在完全相同的 GPT-4o-mini 底座下,ReFind 以 58.2% 的综合平均准确率位居榜首,击败了此前业界公认强悍的图结构记忆系统 HippoRAG 2(53.2%)以及树状递归摘要方案 RAPTOR。
这项研究直接挑战了当下对复杂长程记忆结构的崇拜,证明对于事实定位与更新追踪类任务,赋予智能体一套符合聊天规律的动态搜索控制权,其收益远远超过静态构建的记忆结构。
人类翻找聊天记录的直觉,正是记忆接口的缺失拼图
为什么完全不加工的原始日志,能在智能体的驱动下爆发如此强大的检索效能?这要追溯到人机交互领域对个人信息重新查找(Personal-Information Refinding)的经典行为研究。
日常生活中,几乎没有人会在需要确认某件事时去翻阅自己提前绘制的人际关系图谱。当我们需要找回一个月前朋友推荐的某家餐厅名称时,最常见的做法是“定向探索”(Orienteering):在聊天工具的搜索栏里随手输入一个模糊词(例如“火锅”或“周五”),命中某一条消息后,顺着这条消息往上或往下划动屏幕查看上下文,发现日期不对就借助时间筛选收窄范围,发现这个群聊不是目标就换一个群,或者换一个更精确的专有名词重新检索。
人类找回信息的过程高度依赖对话本身的自然属性——局部上下文依赖、会话聚集性、时间先后顺序以及对已检查区域的排除。然而,现有的通用检索或向量 RAG 系统通常把整段对话扁平化切片,既抹杀了聊天记录的局部对话流,也无法跨轮次维护“哪些地方已经翻过”的搜索状态。
ReFind 的核心构思正是将这种人类翻看聊天记录的行为范式,映射为智能体可调用的具体机制。它保留原始记录的原始文本、时间戳、单轮发言边界(Turn)以及完整的会话边界(Session),并在底层仅依托极轻量级的 BM25 词法倒排索引。索引构建不调用任何模型,零显存占用,新消息发出的瞬间就能毫秒级追加到索引末尾,彻底抹平了传统记忆系统动辄数秒乃至数分钟的离线图谱提取延迟。

模块解耦与四项“聊天原生”检索控制
在系统架构上,ReFind 采用了严格的“检索-推理”两阶段解耦设计,以确保上下文预算被最高效地利用。
在检索阶段,系统并不急于让模型作答,而是由一个基于 ReAct 范式的智能体全权接管控制权。该智能体拥有三个核心动作:执行聊天记录搜索、保存关键证据片段(做笔记)、结束搜索。每次检索返回的并不是冰冷的孤立片段,而是经过特定规则过滤后的上下文。当智能体确认收集到的证据足够充分时,便主动终止搜索循环;在随后进入的推理阶段,收集到的所有笔记片段会统一按照会话分组,并严格按时间戳由远及近展开,交由推理模型集中生成答案。这种设计彻底避免了解析长篇搜索结果与最终逻辑推理在同一个上下文窗口内发生干扰。
支撑这一套迭代检索循环的,是 ReFind 针对聊天数据原生特征量身定制的四项控制机制:
其一是基于倒排秩融合(RRF)的会话级双层重排序。单轮对话(Turn)往往很短,关键词可能只命中只言片语。但如果一个会话(Session)中有多个单轮对话同时命中了检索词,该会话大概率就是目标话题的发生地。ReFind 先在单轮粒度计算 BM25 得分,同时将同一会话内所有命中轮次的分数加权求和作为会话级得分,最后通过 Reciprocal Rank Fusion 公式将轮次排序与会话排序相融合:
\[\text{Score}_{\text{session}}(s)=\sum_{c\in s}\text{BM25}(q,c)\] \[\text{RRF}(c)=\frac{1}{k+r_{1}(c)}+\frac{1}{k+r_{2}(c)}\]这种双层排序能精准挖掘那些单句得分不高、但在高相关性会话内部起到关键支撑作用的对话上下文。
其二是局部上下文窗口扩展。聊天具有强烈的上下文依附性,一句“行,那就买它了”在字面上毫无语义信息。当 BM25 命中某个具体的单轮对话 $c_i$ 时,系统不会单独抛出这句话,而是以该句为中心,自动抓取其前后各 2 个轮次的对话片段 ${c_{i-2}, \ldots, c_i, \ldots, c_{i+2}}$,并且该扩展在触及会话边界时自动截断。返回给智能体的是带有前因后果的微型对话块,使证据变得立即可读。
其三是动态时间范围过滤。智能体在遇到带有相对时间提示的问题(例如“上个月”、“搬家前几天”)时,可根据第一轮搜索摸底得到的全局时间轴,主动在后续搜索中追加起始与截止时间戳参数。底层索引会在计算词法相关度之前,直接裁掉时间窗口外的所有候选,极大地过滤干扰噪声。
其四是已读会话排除机制。这是整个接口中唯一跨轮次保留状态的操作。如果智能体在第一轮搜索中已经调阅了 Session A 的内容并确认了部分信息,系统会在状态表里标记 Session A。在接下来的迭代搜索中,即便 Session A 依然包含高频词,系统也会自动将其跳过,强制检索器转向尚未被检查过的其他会话。这种会话去重机制直接解决了多轮搜索中模型频繁在同一段对话里打转、白白耗尽迭代预算的痼疾。
击碎“预构建神话”:2800道题目的端到端对决
为了全面验证 ReFind 的有效性,研究团队采用了 MemoryAgentBench 的增量多轮对话测试集,共计涵盖约 2800 道问题。这些评测不仅包含考察单一事实定位的单跳问答(SH-QA)、跨会话拼接线索的多跳问答(MH-QA)、长程记忆评测(LME)和事件时序问答(EventQA),还包含了极其严苛的事实更新追踪(FC-SH 与 FC-MH)——后者要求系统在某个属性被多次覆写修改的历史流中,精准返回最终生效的状态,而不是过期的旧版本。
所有参与对比的基线系统全部统一采用 GPT-4o-mini 作为骨干模型,确保没有任何底座能力差异带来的偏差。对比对象包括了稠密向量检索(Contriever)、单次检索的 BM25-RAG、递归摘要树 RAPTOR、分块记忆系统 Mem0,以及基于图结构的顶尖记忆架构 HippoRAG 2 和 GraphRAG。
在六大基准任务的无加权宏观平均准确率上,ReFind 拿到了 58.2% 的全场最高分,明显拉开了与第二名 HippoRAG 2(53.2%)的差距,更是将传统单次 BM25-RAG(48.8%)甩在身后近 10 个百分点。
从具体任务的分布规律来看,ReFind 的统治力在那些复杂检索场景中尤为突出。在单跳问答(SH-QA)中,ReFind 达到 83.0%,相比 BM25-RAG 提升了整整 17 个百分点;在跨会话线索拼图的多跳问答(MH-QA)中,ReFind 拿下 69.0%,高出 BM25-RAG 13 个百分点。在两类事实覆写追踪任务中,依靠显式时间约束和结构化的时序推理,ReFind 同样全面领先所有基于向量的竞品。唯一的例外是极度依赖单点匹配的 EventQA,单次 BM25 取得了 74.6%,而 ReFind 为 74.1%,两者几乎持平,这说明对于简单的单事件检索,强词法命中就已经足够触顶。
当研究人员进一步将底层控制器升级为推理能力更强的 GPT-5-mini,并在长文本基准 LongMemEval-S(单任务约 11.5 万 token)和 LongMemEval-M(单任务约 50 万 token)上运行五次重复实验时,ReFind 的平均得分分别飙升到了 $93.2\pm 3.3$% 和 $89.3\pm 6.0$%。不仅稳定压制了专为长对话设计的 STITCH 系统(86.0% / 80.0%),更将同样采用原始文本多轮搜索路线但缺乏原生聊天控制的 GAM(70.0% / 60.0%)大幅甩开。
为什么朴素的词法检索反而在多轮搜索中胜出?
在针对 ReFind 的各项控制变量与消融实验中,两组反常识的结论非常值得技术人员深思。
首先是对四项聊天原生控制机制的剥离测试。如果只保留 GPT-5-mini、多轮 ReAct 循环和记笔记机制,但剥离掉上下文扩展、会话 RRF 重排、时间过滤和已读会话去重(即退化为纯粹的“通用多轮 BM25 Agent”),其在 LongMemEval-S 上的准确率立刻从 93.2% 坠落至 78.7%,在 M 数据集上也下跌了 7.1 个百分点。
在各个细分组件中:
-
局部上下文扩展的影响在短文本 S 集中最为立竿见影。一旦移除上下文扩展,命中单句往往语义残缺,模型因缺乏理解上下文的桥梁而频繁误判;
-
会话去重机制的影响则在长文本 M 集中达到峰值。在长达 50 万 token 的庞大历史中,如果不强制屏蔽已访问过的会话,智能体会在后续两三轮迭代中不断被前排高分旧会话的其余轮次吸引,导致 4 次迭代预算白白耗尽,其在 M 数据集上的性能因此直接跌落 9.3 个百分点。
其次,也是最引人注目的发现:在多轮交互搜索中,底层的纯词法检索(BM25)竟然全面优于语义向量检索(Dense RAG)乃至混合检索(Hybrid)。
在固定智能体控制逻辑和提示词的前提下,研究团队测试了仅替换底层检索器的效果。结果显示,BM25 单独驱动的接口平均表现最高;加入密集语义向量的混合方案仅仅略微提升了运行稳定度,但在绝对召回与准确率上均未能击败纯 BM25。
这一现象揭示了长期记忆检索与常规通用 RAG 的本质区别。在聊天档案中,用户需要追踪的目标往往附带极具区分度的“表面特征”(Surface Forms)——特定的朋友昵称、某家具体餐馆的名字、特定的地址、一段带有特殊标点的代号或是时间表达。
在传统的单次检索中,语义向量检索擅长用模糊泛化的语义匹配对付语意含混的查询;但在由 Agent 主导的多轮搜索闭环里,词法检索的“确定性”展现出了无可比拟的优势。BM25 的命中与否是一面清晰的镜子:命中就是命中,没命中就是没命中,智能体会立即观察到“当前关键词失效”这一明确信号,从而在下一轮自主换用同义词、别名或提取命中上下文中的新实体来发起二次进攻。反之,语义向量输出的相似度分数往往平滑而缺乏解释性,更容易将模型带入语义漂移的陷阱,反而削弱了智能体迭代修正的效率。
重新审视智能体长期记忆的设计哲学
长期以来,AI Agent 领域普遍存在一种“架构增生”的倾向:面对长上下文带来的记忆挑战,研究者习惯于引入更复杂的流水线——设计多层图谱提取 Prompt、微调摘要模型、建立复杂的分级存储体系。每一次架构升级,都伴随着不可忽视的离线计算开销与信息降维损失。
ReFind 带来的启示十分清醒:我们不应当混淆“记忆的组织形式”与“寻找记忆的能力”。
对于个人聊天记录这种天然具备弱结构(时间、说话人、会话)的文本流,过早、过度的语义抽象不仅不是良药,反而是信息保真度的杀手。将存储介质还原为最简单、零维护成本的原生文本,将智能释放给具备反思与重试能力的交互式 Agent,再辅以符合人类信息翻找规律的底层界面工具,就能以极简的工程架构跨越结构化记忆堆砌的壁垒。
这并不意味着知识图谱或多层摘要在所有场景下都失去了价值。对于那些要求从数万条对话中萃取宏观性格特征、抽象思维偏好或全局情感演变的“全景式理解”任务,预聚合的摘要仍然具有不可替代的高阶语义整合作用。然而,对于绝大多数日常场景中最频繁发生的具体事件回忆、细节求证以及最新事实状态校准,ReFind 给出了一条极其轻量且强悍的新路径:收起那些沉重的离线图谱生成管线,让你的 Agent 直接去翻原始聊天记录即可。