WikiLoop:让检索反馈反哺知识库构建,多文档问答提升 6.3 分
WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

当前的检索增强生成(RAG)与智能体系统正面临一个隐蔽的结构性断层:建库的人不负责查库,查库的人管不了建库。
ArXiv URL:https://arxiv.org/abs/2607.26604v1
无论底层的外部知识库被组织成向量索引、分层摘要图,还是相互链接的 Wiki 页面,知识的组织和维护通常都是一个单向且孤立的预处理过程。建库模块只遵循启发式规则或局部的文本抽取逻辑,完全无法接收下游检索智能体在真实问答中的反馈;与此同时,负责检索问答的智能体只能被动适应固定的外部索引,一旦遇到跨文档的长链路推理或关键线索缺失,即便检索算法再精巧,也往往受困于死板的知识拓扑结构。
腾讯的研究团队在论文中提出了名为 WikiLoop 的反馈耦合框架,尝试打破这一长期存在的单向壁垒。该方案的核心思路在于:构建一套专为智能体机器导航设计的原生维基知识库(Agent-Native Wiki),并将知识库构建者(Builder)与检索导航者(Navigator)的策略整合进同一个大模型中。通过下游检索任务的真实反馈来倒逼知识库结构的更新,同时利用结构化知识来提升检索效率。
在统一基于 Qwen3.5-9B 骨干模型的情况下,WikiLoop 在复杂知识溯源与多文档基准 AuthTrace 上取得了 62.6 的综合答案准确率(Answer Correctness),相较于此前同架构的基线系统 LLM-Wiki 大幅提升了 6.3 个百分点,其中需要综合 3 篇以上文档的高难度查询收益最为突出。不仅如此,该框架无需特定领域微调即可直接迁移至 HotpotQA 与 MuSiQue 等多跳问答基准,证明了这种“以查定建、查建协同”机制具有极强的通用性。

为什么孤立优化不再奏效?
在传统的 Agent 检索范式中,智能体通常使用 ReAct 或交错式推理动作来逐步获取外部证据。随着任务复杂度的上升,业界开始从纯向量检索转向更加结构化的知识载体,例如链接页面形式的维基知识库(Agent-Native Wiki)。这种载体通过页面(Pages)、页面间超链接(Links)以及指向原始文本的溯源依据(Provenance)来组织长篇语料,使智能体能够像人类浏览维基百科一样通过搜索、阅读和点击跳转完成多跳推导。
然而,要让同一个智能体系统既能自主更新维基、又能精准读取维基,必须跨越三重相互纠缠的优化挑战。
首先是导航策略中的证据充分性与检索经济性冲突。为了避免智能体陷入无休止的检索循环,强化学习通常会引入步数或 Token 惩罚。但如果过早对检索调用施加均匀的成本惩罚,模型极易产生早停(Premature Stop)倾向——智能体为了避免扣分,在尚未找齐所有必要拼图碎片时便匆匆终止搜索并作答,这在复杂多文档问题上是致命的。
其次是构建策略中的边际效用归因困境。知识库的每一次更新(如新增一个页面、建立一条新跳转、修正一段摘要)是否合理,不能看编辑之后的知识库绝对表现有多高。因为编辑前的知识库本身可能已经包含了大量有效信息,高分无法证明这次特定的编辑贡献了正向增量。更危险的是,一个局部的激进修改可能会显著提升目标问题的准确率,却在不经意间破坏了其他不相关问题的检索路径,导致大面积的能力退化。
最后是共享策略下的多角色干扰问题。让一个模型同时充当“建库工程师”(Builder)和“文献检索员”(Navigator),虽然它们面对的是同一套知识图景,但两者的状态输入、动作空间与奖励函数完全不同。如果盲目进行多任务联合训练,很容易引发梯度冲突与灾难性遗忘,导致两者表现均不如独立的专用模型。
WikiLoop 的协同学习机制
WikiLoop 的整体设计哲学是通过“角色条件化共享策略”(Role-Conditioned Shared Policy)将两套接口无缝统一。模型参数量保持不变,仅根据上下文中的系统提示词切换为导航角色 $\pi_{\theta}(\cdot \mid r=\mathrm{NAV})$ 或构建角色 $\pi_{\theta}(\cdot \mid r=\mathrm{BUILD})$。
为了保证训练过程的平稳收敛,团队并没有一开始就进行完全自由的双向强化学习,而是规划了一条循序渐进的优化路径。训练从统一的指令微调(Joint SFT)初始化开始,随后经历三个严格分工的强化学习阶段:
\[\theta_{0} \xrightarrow{\mathrm{NAV\text{-}RL}} \theta_{N} \xrightarrow[\bar{\pi}_{N}\ \text{frozen}]{\mathrm{BUILD\text{-}RL}} \theta_{B} \xrightarrow[\bar{\pi}_{N}\ \text{frozen}]{\mathrm{Joint\ RL}} \theta_{J}\]第一阶段先行训练导航者(NAV-RL),打磨出一个高水平的检索策略。在第二阶段训练构建者(BUILD-RL)时,研究人员特意将第一阶段训练好的导航者权重冻结(记为 $\bar{\pi}_{N}$),作为衡量编辑质量的客观裁判。之所以冻结评测者,是为了固定效用评分的标尺,防止“建库者”与“评估者”在共同演化中产生奖励漂移。当构建者掌握了如何提交有价值的编辑补丁后,系统进入第三阶段的联合强化学习(Joint RL),在一个共享权重的大模型内部交错处理同质批次的数据,最终将两个角色的能力完全内化融合成一个模型。
1. 先充分后经济:门控式导航目标
在导航阶段,智能体的核心奖励包含答案准确率 $AC$ 和证据召回率 $ER$。为了解决前述的过早放弃检索问题,WikiLoop 设计了一种“先充分后经济”(Sufficiency-Before-Efficiency)的门控奖励结构。
定义检索过程中的综合成本包括轨迹 Token 数量 $\widetilde{T}$、维基搜索调用次数 $\widetilde{N}{s}$ 以及页面阅读调用次数 $\widetilde{N}{c}$:
\[\mathrm{Cost} = \gamma_{T}\widetilde{T} + \gamma_{s}\widetilde{N}_{s} + \gamma_{c}\widetilde{N}_{c}\]在计算最终反馈奖励 $R_{\mathrm{NAV}}$ 时,研究团队引入了一个二值指示变量 $I_{\mathrm{full}}$,只有当智能体收集到了该问题所需的全部必要证据(即 $ER=1$)时,$I_{\mathrm{full}}$ 才激活置为 1:
\[R_{\mathrm{NAV}} = \operatorname{clip}\Big[ \alpha_{a}AC\bigl(\rho+(1-\rho)ER\bigr) + \alpha_{e}ER + \beta_{\mathrm{full}}I_{\mathrm{full}} - \alpha_{c}\mathrm{Cost}\,I_{\mathrm{full}} + P_{\mathrm{deg}},\,-1,\,1\Big]\]这一门控机制在逻辑上极其清晰:在证据链条尚未找全之前,公式中的成本惩罚项 $-\alpha_{c}\mathrm{Cost}\,I_{\mathrm{full}}$ 根本不会生效。此时强化学习完全专注于拉大答案准确率与证据覆盖率的差距,模型不会因为多读了几个页面就被扣分,彻底消除了过早停止搜索的侥幸心理。而一旦证据被全部集齐($I_{\mathrm{full}}=1$),系统不仅会给出一个额外的通关奖励 $\beta_{\mathrm{full}}$,还会同时激活成本惩罚项,倒逼模型在保证证据完整的前提下压缩推理路径与工具调用次数,寻找最经济的阅读路线。
2. 边际效用增量与防退化监督
在构建阶段,Builder 的职责是在阅读新文档后,向维基知识库提交一个结构化补丁 $e$(包含新建页面、重写段落或调整超链接)。为了精准度量这个补丁的净收益,系统会在隔离的知识库副本上执行“控制变量”评估。
对于查询集合 $Q$ 和当前维基状态 $W$,冻结的裁判导航员 $\bar{\pi}{N}$ 能够在上面运行并产出一个综合效用评分 $U(Q,W;\bar{\pi}{N})$。评估一个补丁 $e$ 的质量,看的是知识库应用该补丁前后的效用差值(Utility Difference):
\[\Delta U_{Q}(e) = U(Q, W_{\mathrm{after}};\bar{\pi}_{N}) - U(Q, W_{\mathrm{before}};\bar{\pi}_{N})\]这种成对差分评估彻底剥离了原始维基质量带来的基线干扰。哪怕原本的维基系统准确率高达 80%,如果新加入的补丁无法进一步提升相关问题的解答质量,其边际效用增量也是零。
更重要的是,研究团队将评估查询划分成了两组:一组是该补丁理论上应当支持的受影响查询集 $Q_{\mathrm{affected}}$,另一组则是库内随机抽取的无关防御查询集 $Q_{\mathrm{guard}}$。最终赋予 Builder 的综合奖励不仅看它在目标问题上的突破,还要严密监控它是否造成了误伤:
\[R_{\mathrm{BUILD}} = \operatorname{clip}\Big[ \widetilde{\Delta U}_{\mathrm{affected}} - \lambda_{g}\bigl[-\Delta U_{\mathrm{guard}}\bigr]_{+} - \lambda_{e}C_{\mathrm{edit}} - P_{\mathrm{structure}},\,-1,\,1\Big]\]只要补丁导致无关查询的效用下降(即 $-\Delta U_{\mathrm{guard}} > 0$),防御惩罚项就会立刻生效并被放大权重 $\lambda_{g}$。再加上编辑尺寸惩罚 $C_{\mathrm{edit}}$(抑制无意义的大面积推倒重来)和格式校验惩罚 $P_{\mathrm{structure}}$,模型被强制约束去寻找那些“微创手术式”的精准编辑方案:以最小的改动幅度在目标问题上换取最大的效用提升,且绝不破坏已有知识网络的连通性。
3. 角色同质批次下的统一强化学习
经过 NAV-RL 与 BUILD-RL 两轮接力专项训练后,模型已经分别在读和写两端积累了深度偏置。此时如果直接使用混合了读写轨迹的 Batch 进行训练,梯度更新可能产生剧烈震荡。
WikiLoop 在最后的 Joint RL 阶段采用了分组相对策略优化(GRPO)结合序列级策略目标(GSPO)的更新方案。每次迭代时,训练框架向模型交替喂入同质批次(Role-Homogeneous Batches)——要么全批次都是 Navigator 的轨迹,要么全批次都是 Builder 的轨迹。在相同的参数网络下,优化器交替最大化两个角色的期望回报:
\[\max_{\theta} \mathbb{E}_{r\sim p(r)}\mathbb{E}_{\tau\sim\pi_{\theta}(\cdot\mid r)}\left[R_{r}(\tau)\right]\]这种批次隔离但参数共享的设计,使得参数更新既保留了角色专用优势的提炼,又促使两套动作空间底层的“知识表征与推理引擎”互相渗透。
核心实验与关键发现
针对该框架的全面验证主要围绕中国古典文学知识溯源基准 AuthTrace 展开。该数据集包含 5 位古代散文家的 860 部作品,设计了共计 2,099 道具有严苛证据链要求的复杂问题。评估根据解题所需的支撑文档数量 $f$,将问题细分为 Single($f=1$)、Low($f=2$)和 High($f\ge 3$)三个难度层级。
1. 全局端到端表现
在相同的 Qwen3.5-9B 骨干模型与评估设定下,WikiLoop 在 AuthTrace 上展现出了全面的统治力。最终的全指标综合答案准确率(All AC)达到了 62.6,相比监督微调基线 Joint SFT 的 58.2 高出 4.4 点,比未经过反馈回路迭代的同类基线 LLM-Wiki 基础版(56.3)大幅提升了 6.3 点。
最值得关注的是复杂多跳场景下的表现跃升。在涉及 3 篇及以上文档的 High 难度分层中,传统稠密 RAG 和无反馈的维基系统的准确率普遍出现严重滑坡,而 WikiLoop 保持了极其坚韧的多文档线索串联能力。不仅如此,与图增强检索方案 HippoRAG 2 相比,WikiLoop 在 Low 和 High 难度上均建立了统计显著的领先优势;HippoRAG 2 仅在单文档简单问题上微弱领先 0.7 点,但该差异在统计学上并不显著。
更为可贵的是运行成本的逆向优化。由于 Navigator 彻底学会了有目的的定向导航,系统平均在线查询延迟从基线 LLM-Wiki 的 16.90 秒缩短至 15.76 秒,整库维基的构建总 Token 消耗也从 194.00M 降至 185.15M。这直接打破了“模型能力越强推理代价越高”的惯性,实现了准确率与资源开销的双向优化。
2. 角色消融验证:机制是否真的生效?
为了证明性能增量确实来自专门设计的强化学习目标,而非单纯的步数堆叠,作者团队设计了精确的消融对比实验。
在针对 Navigator 的消融中,如果移除门控设计,直接使用未加保护的传统成本惩罚(即不论证据是否找齐,全程扣除检索成本),模型的早停率(Premature Stop)高达 18.9%,证据覆盖缺口达到 28.9%。而在引入“先充分后经济”门控后,早停率显著被压制到 11.1%,证据覆盖缺失直降至 17.6%。这一数据坚实地支撑了理论假设:让模型在证据不全时免受成本考核,是保障 Agent 坚持探寻深层线索的关键。
在针对 Builder 的消融中,如果移除差分增量机制,直接让模型以编辑后的绝对表现 $U_{\mathrm{after}}$ 作为回报,模型很快学会了“搭便车”——在原本就表现良好的知识页面上进行无关痛痒的微调,对残缺知识的实质修复能力显著低下。而一旦移除了防御惩罚项 $\lambda_{g}$,Builder 在目标受影响问题上虽然偶有亮眼突破,但防御查询集的性能退化(GuardReg)激增了数倍。只有将“边际增量”与“防御红线”结合,模型才真正学会输出高质量、高密度的结构性编辑。
3. 参数共享会稀释专业能力吗?
一个经典的担忧是:在最后的 Joint RL 之后,兼顾了建库和查库的多面手模型,会不会退化成“两头都不精”的中庸模型?
为了回答这一问题,研究团队追踪了能力沿训练阶段的演进轨迹。Navigator 的答案准确率在经历了专注导航的 NAV-RL 阶段后从 58.2 升至 60.4;在随后参数被单向拉向建库任务的 BUILD-RL 阶段,Navigator 准确率发生了一定程度的轻微遗忘,回落至 59.7;然而在最终的 Joint RL 阶段,双接口协同优化不仅让遗忘的能力完全失地收复,更反超达到了 60.8,相对于独立的导航专家模型甚至实现了 +0.4 点的边际收益。
成对比较表明,最终的单一共享策略完全保留了两个专家模型的独立能力。它既能以极高的精度产出与专家版无异的维基增量补丁,又能在测试阶段换上导航者身份进行精准穿梭,成功将原本需要维护两套甚至多套 Agent 模型的庞大管线,收敛为单个可灵活切换角色的轻量模型。
4. 零样本跨数据集与模型规模外推
在没有任何特定领域微调或校准的情况下,这套预训练好的 Qwen3.5-9B WikiLoop 共享策略直接被迁移到开放域多跳问答基准 HotpotQA 与 MuSiQue 上进行 Zero-shot 检验。
测试数据显示,相较于同底座的 LLM-Wiki 基础版,WikiLoop 在 HotpotQA 上的 F1 与完全匹配(EM)指标分别提升了 0.025 和 0.034;在难度更高、推理链更曲折的 MuSiQue 上,提升幅度进一步放大至 0.035 和 0.044,相对提升比例达到了 6.0% 与 10.0%。这强有力地说明,通过反馈循环学到的“如何把维基建得更好用”以及“如何顺着维基链接找答案”的能力,并不是记住了特定语料库的答案,而是掌握了一种跨语料通用的知识结构组织与机器检索直觉。
随后,团队进一步将骨干架构升级为规模更大的稀疏激活模型 Qwen3.5-35B-A3B。实验表明,更大的参数量带来了基线性能的全面抬升,但 WikiLoop 带来的超额收益依然稳固:在 35B-A3B 规模下,WikiLoop 相比 Joint SFT 依然保持了 4.1 点的全指标优势,其中在包含多篇文档的 Low 和 High 问题上的提升依然分别高达 6.1 和 7.2 点。这充分验证了闭环反馈学习范式具有出色的跨模型扩展潜力。
局限与演进方向
客观审视这项工作,WikiLoop 展现的范式虽然极具启发性,但仍属于朝向全自主长程进化知识系统迈出的早期探索,其内部仍留有若干值得技术人员关注的边界限制:
-
补丁评估环境的瞬态性与非持久性:在现行实现中,Builder 产出的候选补丁是在隔离的维基快照副本上独立评测打分的,打完分之后便被销毁。这意味着 Joint RL 并没有在一个连续演化、不断被永久写入改写的单次长轨迹中进行闭环学习。真正的“边写入、边导航、边积累”可能会引入复杂的历史依赖信用分配,甚至因前期的错误编辑污染而导致雪崩效应,这一更深层次的动态博弈仍有待突破。
-
知识库底座的传导性依赖:在 AuthTrace 的评测中,虽然查询集和标注严格隔离,但训练和测试共享了底层的文本篇章来源与初始维基。未来的验证需要扩展到跨多语言、多专业领域、且完全从零初始化的异构知识库场景。
总结与启示
回顾大模型驱动的企业级检索系统,我们长期将精力倾注在前端如何切分 Chunk、重排检索结果,或者后端如何借助图数据库进行图谱提取。这种将“存储媒介的设计”与“信息消费的场景”割裂开来的思路,注定会让智能体频繁在不合理的知识组织面前撞墙。
WikiLoop 提供了一个非常关键的解题视角:机器阅读知识的方式,理应成为机器重组知识的唯一准绳。通过引入下游检索导航的真实表现作为无偏信号,辅以“先充分后经济”的搜索门控和“边际增量防退化”的写入约束,AI 终于能够自行将杂乱的语料梳理成最适合机器自主跳转的维基结构。
更深层的意义在于,这项工作证明了复杂的协同系统未必需要堆砌多个不同参数的模型组件。让同一个大语言模型在不同批次中分别演练“写作者”与“阅读者”的角色,借助强化学习打通反馈回路,模型内部的表征能力便足以完成双向反哺。这种以消费端效用为唯一驱动力的自治知识闭环,或许正是下一代智能体记忆网络与知识图谱演进的重要底层范式。