SoG-R1:将图谱多跳搜索内化进8B模型,无需Judge实现CWQ精度新高

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

SoG-R1:将图谱多跳搜索内化进8B模型,无需Judge实现CWQ精度新高 论文图示

大语言模型在常识推理上展现出了惊人的能力,但在涉及事实严谨性、强结构化的知识密集型任务中,参数记忆的局限性暴露无遗。大模型不仅存在知识过时与幻觉问题,更难以验证其推理依据。将大模型与知识图谱(Knowledge Graph, KG)结合,被视为解决这一难题的关键路径。知识图谱具备明确的实体和关系,能够让模型沿着图结构进行“跳跃”(hop)式探索,从而挖掘扁平语义检索无法捕捉的多跳推理路径。

ArXiv URL:https://arxiv.org/abs/2607.18481v1

然而,现存的知识图谱问答(KGQA)方案大多陷入了两难境地。一方面,以 ToG、PoG 为代表的前沿闭源方案依赖 GPT-4 级别的模型通过 Prompt 调用外部检索工具,推理成本居高不下且延迟极高;另一方面,近期的开源尝试要么将图谱转换为静态子图塞进上下文,剥夺了模型动态探索的能力,要么依赖庞大且不稳定的外部 LLM Judge 来构建强化学习奖励,导致训练信号脆弱且难以落地。

来自加拿大高级研究所、麦吉尔大学和 Mila 魁北克人工智能研究所等机构的研究者提出了 Search-on-Graph-R1(简称 SoG-R1)。该方法摒弃了对外部庞大模型和辅助判断模块的依赖,通过“SPARQL 引导的冷启动轨迹蒸馏”配合“基于确定性奖励的强化学习(GRPO)”,成功将多跳知识图谱导航能力完整内化进一个紧凑的 8B 参数开源模型中。在 WebQSP、CWQ 和 GrailQA 三大经典基准测试中,仅有 8B 参数的 SoG-R1 全面超越了所有对比的冻结前沿大模型系统,并在复杂的 CWQ 基准上刷新了业内最佳表现。更具启发性的是,该研究表明强化学习不仅能提升问答准确率,还会自主学会用更少的图搜索调用步数击中目标,展现出与网络检索强化学习截然相反的“路径压缩”特性。

SoG-R1 整体框架概览

为什么图谱搜索难以低成本内化?

让紧凑型模型自主在知识图谱上搜寻答案,本质上是一项极具挑战的序列决策任务。在多跳知识图谱问答中,从问题中提及的头实体(Topic Entity)出发,到最终指向答案的尾实体,中间往往隔着数层关系跳数和大量干扰节点(Distractor Nodes)。

过去的解决方案主要分为两大派系。第一派是语义解析(Semantic Parsing)路线,模型被训练直接输出完整的结构化逻辑表达式(如 SPARQL 或 s-expression)。这种方法的致命缺陷是一锤定音:一旦模型在单次解析中选错了关系谓词,或者遇到了训练集中未曾覆盖的 Schema 模式,整个推理便会彻底崩溃,完全没有纠错机制。

第二派则是将知识图谱视为黑盒检索环境,让模型以智能体(Agent)的身份通过工具多轮交互。然而,以往让紧凑模型掌握这一能力的手段存在明显妥协。例如,部分系统先离线抽取局部静态子图,将其拼接为文本上下文让模型阅读。这种方式实际上将召回率的上限锁死在了预处理步骤,模型无法在推理中途根据线索自主扩展图谱。另一部分系统虽然支持在线查询,但在强化学习训练阶段引入了 70B 级别的 LLM 作为裁判,对推理轨迹打分,并引入 3B 模型判断最终答案是否吻合。这种裁判机制不仅引入了不可预测的随机性与偏见,而且允许模型在图谱检索失败时回退到内部参数记忆中“胡说八道”,破坏了图谱问答最重要的可追溯性。

SoG-R1 的核心思路是:必须把检索与推理完全融合进同一个闭环中。模型在中途推理时,根据当前收集的线索自主决定发起什么检索,使图谱召回能力变成模型可以学习的导航策略。同时,整个训练与推理链路坚决剔除任何第三方法官,只依赖与真实知识图谱服务器的确定性交互。

SPARQL 支架:构建百分之百落地的冷启动轨迹

要让 8B 模型学会这种多跳图导航,首先需要高质量的多轮专家轨迹进行监督微调(SFT)冷启动。然而,如果直接让强大的前沿教师模型在没有指引的情况下盲目探索图谱,其合成的轨迹往往包含海量错误尝试,经过后验过滤后留存率极低。

研究团队在此挖掘出了一个此前被普遍忽视的数据集结构特征:几乎所有经典的知识图谱问答训练集,都自带问题标注的黄金 SPARQL 查询语句。这句 SPARQL 不仅是一个可以执行的代码片段,它本质上就是一张完美的“航海蓝图”。SPARQL 语句 WHERE 子句中的每一个三元组约束,清晰地标注了从头实体出发、穿过哪些复合值类型(CVT)节点、经过哪些特定关系谓词,最终抵达 SELECT 目标的精确路径。

研究团队巧妙地将这一黄金 SPARQL 作为脚手架(Scaffold)提供给参数量达 235B 的前沿教师模型(Qwen3-235B-A22B-Thinking),但强制教师模型在生成轨迹时,必须通过与学生模型完全相同的 Search 工具来实际走完这条路径。在每一步操作中,教师模型发起的检索都会真正发送到本地搭建的 Freebase Virtuoso 数据库服务器并实时执行。

通过这种设计,教师模型不需要在大海捞针中猜测路径,而是严格将逻辑蓝图翻译成多轮工具交互动作。因为每一次工具调用都在真实知识图谱服务器上执行,返回真实的邻居三元组,所以合成轨迹中的每一个事实在物理上都百分之百真实落地,从根源上杜绝了教师模型的幻觉。只有当最终答案与真实标注完全吻合且所有检索无报错时,轨迹才会被收入冷启动训练池。该机制展现出了惊人的数据转化效率:在 WebQSP 上的轨迹留存率高达 99.6%,CWQ 达到 96.0%,GrailQA 达到 87.2%。这不仅为后续的紧凑模型训练提供了极其纯净的高价值监督数据,而且整个脚手架在学生模型推理时完全不可见。

与此同时,研究团队针对小模型在多跳图遍历中的典型缺陷,对检索工具本身做出了关键改进。在原生知识图谱中,诸如演员参演的具体电影等信息,往往由 CVT 虚拟节点相连。早期方案单次工具调用仅允许输入单个实体 ID,当模型需要扩展同一跳下的多个候选节点时,必须连续发出多次调用。研究发现,小模型在连续多次单实体调用时极易半途而废,遗漏部分实体导致答案丢失。为此,SoG-R1 将 Search 工具重构为支持“实体列表批量查询”(Batched 1-Hop Neighbor Retrieval)。模型可以将同一层级打算探索的所有实体打包成列表一次性传入,这不仅将小模型的序列决策简化为单一动作,消除了漏检隐患,还大幅缩短了上下文长度,降低了推理偏航的概率。

确定性奖励的 GRPO 强化学习:摆脱 LLM Judge

在利用上述专家轨迹对开源基础模型(Llama-3.1-8B-Instruct)完成 LoRA 监督微调之后,模型便具备了扎实的图谱交互先验,形成了名为 SoG-SFT 的中间检查点。然而,SFT 只能模仿专家在理想状态下的行径,一旦在未见分布中遇到分支选择失误,模型往往缺乏容错与回溯修正的能力。因此,引入强化学习以让模型在多分支环境中自主探索成为必由之路。

SoG-R1 采用群体相对策略优化(GRPO)算法展开在线强化学习演进。与以往同类研究最大的区别在于,SoG-R1 彻底清除了外部 LLM 评分员。其奖励函数被严格设计为轨迹属性的确定性数学计算,由三个核心乘积项组成:

\[r(\tau)=g(\tau)\cdot r_{\mathrm{em}}(\tau)\cdot f(n_{t})\]

式中各因子的定义逻辑极为精简且严密:

  1. 格式与执行有效性 $g(\tau)$:属于硬性门控,要求模型生成的输出必须符合预定的格式规范,且包含可被解析并执行的工具调用。若格式崩溃或无法执行,取值为 0,否则为 1。

  2. 答案完全匹配项 $r_{\mathrm{em}}(\tau)$:直接将模型在终止轮次给出的预测答案与数据集给出的真实答案进行字符串精准比对,完全命中即得 1,未命中则得 0。这里不引入任何语义模糊的裁判打分,阻断了非事实性的软性奖励欺骗。

  3. 步数效率抑制因子 $f(n_{t})$:用于惩罚拖沓冗长的盲目检索行为。具体函数定义为:

    \[f(n_{t})=\max\!\bigl(f_{\min},\;1-\lambda\cdot\max(0,\,n_{t}-T_{d})\bigr)\]

    其中 $n_t$ 为实际调用的搜索次数,$T_d$ 为该数据集上的免惩罚步数阈值(设定为专家轨迹调用步数的第 75 百分位点),$\lambda$ 为单步惩罚衰减率,$f_{\min}$ 是保底惩罚下限。

这一奖励设计蕴含着至关重要的强化学习机制考量。由于 $f(n_t)$ 与 $r_{\mathrm{em}}(\tau)$ 是乘积关系,这意味着步数效率惩罚项只在产生正确答案($r_{\mathrm{em}}=1$)的不同轨迹分支之间发挥“决胜裁决”(Tie-breaker)作用。如果模型的回答错误,$r_{\mathrm{em}}=0$ 会让整个奖励直接归零,惩罚项根本不起作用。这种数学特性从理论上保证了惩罚参数绝不可能改变正向样本与负向样本之间的 Advantage 符号,它只会驱动模型在确保回答准确的前提下,寻找跳数更少、更精炼的检索路径,避免了因过分追求“少调用工具”而牺牲准确率的逆淘汰现象。

全面对比:8B 紧凑模型逆袭前沿大模型

在 WebQSP、CWQ 以及 GrailQA 三大多跳问答测试集上,研究团队将 SoG-R1 与各大派系进行了严格的 Hits@1 精确匹配度评估。其实验呈现出了极具冲击力的结果。

首先,在与依赖 GPT-4、GPT-4o 或 Claude 3.5 Sonnet 等闭源超大模型的系统(如 ToG、PoG、DoG、PARoG 以及原生 Prompted SoG)对比中,仅具 8B 参数的 SoG-R1 实现了全方位的超越。在此前依赖复杂多智能体协作、推理规划框架的基准任务上,单一权重的 8B 模型凭借自主在线交互,展现出了更强的导航鲁棒性。

其次,在多跳关系最深、结构最复杂的 CWQ 数据集上,SoG-R1 跑出了全表所有对比系统中的最高精确度。这一成绩不仅击败了所有前沿闭源系统,也超越了参数量数倍于己的开源专有微调架构(如使用更大骨干网络的系统)。

最后,与当前完全同构的顶尖开源系统 KG-Hopper 相比,由于两者采用完全相同的 Llama-3.1-8B-Instruct 底座并同样采用 SFT 加 RL 的双阶段架构,这一对照极具说服力。实验数据显示,SoG-R1 在 WebQSP、CWQ 和 GrailQA 上分别取得了 14.8、30.5 和 34.6 个百分点的惊人领先优势。这一巨大的性能鸿沟直接证明:依靠外部大模型打分构建的松散强化学习,极易受幻觉与奖励漂移污染;而 SoG-R1 坚持让模型直面实时图谱、完全基于精准匹配和确定性轨迹长度构建强化学习闭环,能让模型习得更具泛化性且极度纯粹的图导航策略。

阶段消融与涌现特征:RL 带来的“路径压缩”

为了剖析两阶段训练中各组件的真实贡献,研究人员在统一的评估环境下对基础模型、单纯进行 RL 的零冷启动模型(SoG-R1-Zero)、单纯进行 SFT 的模型(SoG-SFT)以及完整形态(SoG-R1)展开了消融实验。

结果显示,性能呈现出极其鲜明的阶梯性分布:SoG-R1-Zero < SoG-SFT < SoG-R1。

未经冷启动直接进行 GRPO 的基础模型,在多跳图谱环境中的表现非常吃力,在 CWQ 和 GrailQA 上的准确率仅为 63.0% 和 60.0%。原因在于知识图谱的环境反馈极其稀疏,基础模型在庞大的关系图空间中盲目调用工具,几乎无法随机撞见正确终点,导致缺乏有效的正反馈梯度。而经过高质量 SPARQL 脚手架轨迹微调后的 SoG-SFT,一跃提升至 90.9%、86.3% 和 88.8%,充分证明了高质量先验在图谱任务中的不可或缺性。

在 SFT 已经达到极高水平的基础上,强化学习阶段依旧带来了确定性的正向增益,最终将三项基准的成绩进一步推高至 91.7%、88.7% 和 90.0%。这一增益在跳数最深、难度最大的 CWQ 上体现得最为明显(绝对提升 2.4 个百分点)。在深入分析模型的推理轨迹后可以发现,强化学习主要教会了模型两件事:一是当第一次检索走向死胡同或遇到语义混淆的干扰节点时,如何主动回溯并重新规划搜索方向;二是在面临多种可能路径时,选择更直接的那一条。

这一现象引申出了 SoG-R1 极为独特的行为演化——路径压缩(Path Compression)。

在测试集上对所有正确回答的推理轨迹进行统计后发现,经过 RL 训练的 SoG-R1,其平均调用的 Search 工具次数在所有三个基准上均显著低于其 SFT 初始化阶段。例如在 CWQ 上,模型成功解题所需的工具调用次数从 SFT 阶段的 2.51 次下降到了 2.15 次;在 GrailQA 上也从 1.83 次压缩至 1.58 次。

这一发现与此前通用网络检索强化学习(如 Search-R1)所报道的现象形成了鲜明对比。在开放域网页检索中,强化学习往往激励模型去发出更多次搜索请求以扩充证据链(表现为思考与检索长度膨胀);但在结构化的知识图谱中,多余的检索往往伴随着维度灾难式的实体爆炸和注意力分散。SoG-R1 中的强化学习不仅没有让推理过程变得冗长膨胀,反而教会了模型“精准出击”,用最具信息量的方式调用批量工具,以最少的交互跳数锁定目标实体。这不仅大幅降低了端到端推理的计算与网络延迟,更降低了上下文过长导致幻觉偏航的风险。

数据规模与架构泛化性

在落地应用中,数据效率与模型泛化度是决定算法价值的关键。研究人员在 CWQ 上对训练集规模进行了梯度测试。实验表明,SoG-R1 的两阶段管线展现出了极快的收敛速度:在仅使用数千条精炼的轨迹数据时,性能便已逼近饱和;当样本量从 6,700 增加到 8,700 时,精确度提升已不足 0.3 个百分点。这意味着工程实践中完全不需要耗费巨资构建数万条人工轨迹,仅需几千个带有黄金逻辑形式的问题,配合离线教师模型生成一次落地轨迹,即可让紧凑模型获得完备的图谱导航能力。

与此同时,研究人员将这一整套训练框架无缝迁移到了参数量更小、架构不同的 Qwen3-4B-Instruct 模型上。评测证实,即使在 4B 的超小参数规模下,这一训练范式依然展现出了卓越的迁移性能与一致的阶梯式提升。这表明 SoG-R1 提炼出的并非某种针对特定基础模型的“过拟合提示工程”,而是一套具有通用普适价值的图谱具身策略训练方法论。

结语与未来演进

SoG-R1 的成功带来了一个极具说服力的范式转变:处理结构化知识密集型任务,我们并不一定要依赖笨重昂贵的闭源前沿模型,也不应止步于把静态上下文硬塞给小模型的妥协做法。

通过利用知识图谱数据自带的 SPARQL 逻辑作为合成支架,辅以严格的物理图数据库执行验证,即使是参数量只有 8B 乃至 4B 的紧凑模型,也能通过模仿学习快速建立起对未知复杂图空间的感知与操作基础。在此基础之上,通过抛弃主观 LLM 裁判、完全依赖执行结果与效率惩罚构建的强化学习,能够进一步释放模型的自主演化潜力,不仅赋予模型动态纠错的能力,更促使其自主压缩探索路径,实现更高精度与更低调用开销的双重胜利。

尽管当前该方法仍建立在已知头实体链接的前提下,且探索主要集中在单步邻居检索原语上,但它清晰地揭示了小模型在结构化复杂决策环境中的进化方向。将外部结构化知识的导航策略完整内化进模型权重,同时保持零幻觉的实时交互闭环,正在成为推动大模型真正在专业化、低算力约束场景中稳定落地的基石。