港大等提出EvoGraph-R1:自进化多模态GraphRAG,打破静态检索瓶颈!

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

港大等提出EvoGraph-R1:自进化多模态GraphRAG,打破静态检索瓶颈! 论文图示

检索增强生成(RAG)已经成为大模型解决幻觉和获取外部知识的标准范式。为了让大模型具备更复杂的推理能力,基于知识图谱的 GraphRAG 逐渐成为当前的研究热点。然而,现有的系统往往潜藏着一个致命缺陷:它们将知识图谱视为一种静态的数据结构。这种“先离线建图,后在线单次检索”的流水线,完全违背了人类面对复杂问题时“边查边想、反复验证、动态纠错”的认知规律。

ArXiv URL:https://arxiv.org/abs/2607.12764v1

由莫纳什大学、西北工业大学、上海人工智能实验室、香港中文大学(深圳)以及香港大学等机构联合提出的 EvoGraph-R1 框架,彻底打破了这一僵局。该研究跳出了传统 RAG 的被动检索思路,首次将多模态知识图谱重构为一个可以通过智能体(Agent)交互来塑造的动态环境

通过将检索过程建模为马尔可夫决策过程(MDP),EvoGraph-R1 能够在一个闭环中自主查询网络、修改图谱结构、纠正早期错误,从而让知识图谱随着推理的深入而“自我进化”。实验表明,这种动态机制在多模态和文本问答基准测试中不仅大幅提升了准确率,甚至在仅保留 1% 内部语料的极端低资源设定下,依然表现出惊人的鲁棒性。

为什么静态 GraphRAG 走到了死胡同?

要理解 EvoGraph-R1 的价值,首先必须剖析当前 GraphRAG 系统面临的底层困境。虽然引入结构化的实体-关系图能够显著提升大模型的推理路径连贯性,但现有的流程通常被划分为截然分开的三步:利用大模型提取实体关系建图、根据问题检索子图、基于子图生成答案。

这种将建图与推理硬性解耦的静态范式,在面对复杂的长文本或多模态输入时,暴露出三个难以逾越的瓶颈。

现有的静态检索范式与EvoGraph-R1自进化范式的对比

第一个瓶颈是以文本为中心的碎片化。当前主流的图谱提取工具大多基于纯文本逻辑。当它们处理多模态数据时,往往会简单粗暴地将丰富的视觉证据(如图像中的物体关系、空间方位)压缩成孤立的文本三元组。这种降维打击切断了细粒度的视觉语义和跨模态的对齐关系,导致构建出的图谱从一开始就支离破碎,根本无法支持需要图文深度融合的多跳推理。

第二个瓶颈是冻结的僵化结构。在现有的系统中,知识图谱一旦离线构建完毕,在推理阶段就被彻底“冻结”。这意味着,如果在建图阶段漏掉了某个关键实体,或者错误地连接了两个无关节点,系统在后续检索时将完全无能为力。它既无法在发现证据不足时吸收新的外部信息,也无法对已有图谱中的谬误进行在线纠偏,只能眼睁睁地任由错误在推理链条中传播。

第三个瓶颈是刚性的单次检索机制。人类在解决复杂问题时,检索策略是高度动态的:先查阅一份文档,发现线索 A 后,再根据 A 的指引去检索文档 B。而传统 GraphRAG 的检索往往是一次性敲定的(single-pass)。由于系统无法评估初步证据的充分性,也就无法在遇到死胡同时调整检索方向、探索替代路径或调用外部搜索引擎。

这些问题的根源在于,我们一直将知识图谱仅仅看作一个“被动等待查询的数据库”,而不是一个可以支撑复杂思维活动的“主动推理基底”。

EvoGraph-R1:将图谱重构为动态进化的环境

为了彻底消除上述瓶颈,EvoGraph-R1 引入了强化学习中的智能体-环境交互理念。在这一框架下,知识图谱不再是死板的数据仓库,而是演变成了一个与智能体推理过程协同进化的动态环境。

EvoGraph-R1的整体架构:智能体通过四种操作与超图环境交互并触发自我进化

在这个重新定义的马尔可夫决策过程(MDP)中,系统的运行逻辑被拆解为四个相互依存的核心要素:

这种闭环设计的精妙之处在于,每一次检索和修改都不再是孤立的动作,而是构成图谱生命周期的一部分。系统从一个极其稀疏、甚至充满噪声的初始超图出发,经过多轮的“观察-行动-反馈”循环,最终将环境塑造成了一个高度聚焦于当前查询、逻辑严密且高度连贯的领域知识状态。跨模态信息在这个过程中被动态地对齐,而非在初始阶段被强行抹平。

实验结论:动态进化的压倒性优势

EvoGraph-R1 的自进化机制是否真的优于传统静态检索?研究团队在文本问答(如 2WikiMultiHopQA、HotpotQA)和极具挑战性的多模态问答(如 E-VQA、InfoSeek)基准上进行了详尽的评测。

结果表明,EvoGraph-R1 在所有任务上均实现了对现有 RAG 和 GraphRAG 基线的全面超越,并且在多模态任务上的优势尤为显著。这种领先并不是通过盲目堆砌计算量得来的,而是源于底层检索逻辑的质变。

动态修剪比盲目搜索更高效

直觉上可能会认为,允许智能体反复编辑和查询图谱会导致推理过程异常缓慢。然而,消融实验揭示了一个反直觉的结论:具备修改和外部搜索能力的动态图谱,其检索效率远高于受限系统。

在 2Wiki 数据集上,完整的 EvoGraph-R1 平均只需要 2.57 轮检索就能锁定答案;而在 E-VQA 数据集上,这一数字甚至低至 1.65 轮。相比之下,如果剥夺智能体修改图谱结构的权力(去除 GraphEdit 中的插入操作),系统在 E-VQA 上的平均检索轮数会暴增至 3.48 轮,增幅高达 35.4%。

这意味着什么?当知识图谱是静态且存在缺失时,智能体在里面找不到关键证据,它只能被迫在错误的路径上反复打转,徒劳地进行一次又一次无效的内部查询。而 EvoGraph-R1 的智能体一旦发现内部图谱存在断层,就会果断调用 WebSearch 获取新知,并通过 GraphEdit 将新节点稳固地锚定在超图上,从而以最快的速度打通多跳推理的逻辑链。

拒绝幻觉,全方位提升生成质量

为了更细致地探究图谱进化对生成质量的影响,研究团队评估了回答的七个关键维度。

雷达图展示了EvoGraph-R1在七个生成质量维度上的全面领先

通过对比可以看出,由于自进化图谱在推理过程中不断剔除噪声、引入高置信度事实,EvoGraph-R1 在“相关性”和“正确性”上与之前的基线(如 MMSearch-R1 和 Graph-R1)拉开了明显差距。更值得注意的是,其在“事实性”和“逻辑连贯性”上的优异表现证明,动态纠错机制确实有效地遏制了多模态大模型的幻觉问题;而“多样性”指标的领先,则验证了外部网络搜索的无缝接入成功打破了信息孤岛。

极端低资源下的降维打击

EvoGraph-R1 最具说服力的应用场景,体现在对知识库极度匮乏环境的适应能力上。研究团队在 E-VQA 任务中人为制造了极限挑战:将系统可访问的维基百科语料库削减至完整版的 10%、5% 甚至 1%。

在不同知识库规模下,EvoGraph-R1与其他基线的准确率对比

在这种“巧妇难为无米之炊”的绝境下,传统静态 RAG 模型的表现迎来了断崖式暴跌。然而,EvoGraph-R1 却展示出了惊人的韧性。在仅有 1% 内部语料的设定下,它依然维持了 37.2% 的准确率,将一众准确率仅在 13.2% 到 18.9% 之间徘徊的基线模型远远甩在身后。

更有趣的是,随着语料库规模的急剧缩小,EvoGraph-R1 相较于表现最好的基线模型(MMKB-RAG)的领先幅度,反而从全量语料时的 7.7 个百分点,一路扩大到了 1% 语料时的 13.2 个百分点。这一趋势无可辩驳地证明:当静态内部知识严重不足以支撑回答时,EvoGraph-R1 主动向外探索并将零散信息编织成结构化网络的能力,构成了其核心壁垒。

从静态数据到主动认知基底

在这项研究中,最有洞察力的一组数据并非简单的准确率数字,而是图谱在经过智能体梳理前后的拓扑特征对比。在初始阶段,基于文本抽取的超图往往显得单薄且松散,存在大量单跳的孤立节点,缺乏主题的内聚力。而随着 WebSearch 的引入和多次 GraphEdit 的修剪重组,图谱不仅节点数量更为精炼,其聚类系数和连接密度也会大幅攀升。

在这个过程中,知识图谱完成了从“被动检索对象”到“主动认知基底”的跨越。EvoGraph-R1 证明了,大模型在外部知识增强上的潜力远未被完全释放。真正的推理不仅需要强大的参数化大脑,更需要一个能够随着思考过程一起生长、自净、重塑的外部记忆器官。将马尔可夫决策的动态博弈引入结构化检索,或许正是下一代 Agentic RAG 从拼缝走向原生的必由之路。