CAG:解耦探索与承诺,微软北大让大模型长文事实性提升13%!
Only Say What You Know: Calibration-Aware Generation for Long-Form Factuality

大型推理模型(Large Reasoning Models)如 DeepSeek-R1 和 GPT-5 正在以前所未有的速度重塑复杂任务的解决边界。然而,当这些庞大的模型在生成长篇幅回答时,幻觉问题依然是悬在真实落地应用头顶的达摩克利斯之剑。尤其是在多步推理过程中,任何一个微小的局部错误推断,都会在后续的推理步骤中像滚雪球一样不断累积、放大,最终彻底污染整个输出结果。对于长文生成这一特定场景,错误的代价往往是难以承受的。
ArXiv URL:https://arxiv.org/abs/2605.01749v1
传统解决长文事实性问题的思路,往往陷入了非此即彼的僵局。有的方案倾向于让模型在遇到不确定的内容时直接采取拒答策略,这虽然规避了说错话的风险,但同时也牺牲了大量的有效信息,导致模型的实用性大幅下降。另一些方案则试图通过强化学习来进行事实性驱动的微调,尽管整体输出质量有所改善,但依然无法在微观层面精确阻断错误推理链条向最终答案的渗透。
微软(Microsoft Research)与北京大学(Peking University)的最新联合研究敏锐地指出,现有大模型在长文生成上的困境,其根本原因在于采用了一种僵化的“探索与承诺耦合”(Coupled Exploration-Commitment)范式。为此,研究团队提出了一种开创性的 探索-承诺解耦(Exploration-Commitment Decoupling)机制,并基于此构建了 CAG(Calibration-Aware Generation)框架。该方法通过让模型在推理探索阶段明确评估自身的可靠性,并在最终输出时有选择性地只陈述确凿的内容,在多个基准测试中不仅将大模型长文事实性最高提升了 13%,更是出人意料地将解码耗时大幅缩减了 37%。这项工作为构建真正具备自我觉知、值得信赖的生成式 AI 系统提供了一条极具潜力的底层重构路径。
致命的耦合:为什么现有的长文生成容易满嘴跑火车?
要深入理解这项研究的突破性,必须先看清大语言模型现存的工作惯性。在标准的生成流程中,当模型接收到一个复杂查询输入 $x$ 时,它首先会生成一条包含多个中间步骤的推理轨迹 $r$。随后,模型会在这些中间步骤的整体条件约束下,顺理成章地生成最终的长文本答案 $y$。研究人员将这种浑然一体的生成模式定义为“耦合的探索-承诺”。
这种机制的致命缺陷在于,它将推理探索阶段产生的任何想法——无论真伪、无论模型自身的把握有多大——都无条件地赋予了同等的权重,并强制渗透到最终的结论之中。长文生成具有极强的细粒度特征,一篇洋洋洒洒的回答往往包含数十个独立的事实声明,其中必然夹杂着模型为了保持连贯性而“顺势猜出”的成分。由于缺乏隔离机制,如果在中间某个推理节点出现了事实性偏差,这种耦合机制就会像扩音器一样,把局部的不可靠放大为全局的幻觉风暴。
正如研究指出的那样,现有的应对策略在这类微观错误的控制上显得极为无力。基于拒答的方法采用的是一种粗糙的“要么全盘作答、要么全盘拒绝”的策略,直接导致模型在面临长篇幅任务时变得极度保守,严重损害了作为助手的核心价值。而那些依靠专门奖励函数进行事实性优化的方法,虽然在宏观统计上降低了幻觉率,但由于其评估粒度过粗,依然无法建模和剥离单独某一步推理的可靠程度,最终只能眼睁睁看着带有瑕疵的中间思考继续污染最终答案。
破局之道:探索-承诺解耦与 CAG 框架机制
针对上述痛点,微软与北大的研究团队选择从源头重新梳理模型的决策链条。他们果断地将推理过程中的“知识探索阶段”与最终输出文本的“答案承诺阶段”进行了彻底切分。这种解耦的核心直觉极其契合人类的高级认知行为:人在思考棘手问题时,脑海中会发散出各种假说、碎片记忆甚至毫无根据的猜想,这是思维的“探索”;但在最终诉诸言语开口作答时,一个理智的人会主动启用内部过滤器,只陈述那些自己有确凿证据支撑的事实,这就是谨慎的“承诺”。大模型也理应具备这种“带着觉知去发散,带着谨慎去收敛”的高级智力特征。

在这个指导理念下,研究团队实例化了极具实操性的 CAG 框架,其运行逻辑由两个紧密衔接的核心环节构成。
第一环被称为“校准探索”(Calibrated exploration),其本质是强迫模型认清自己究竟知道什么。在这个阶段,模型被要求在生成每一步中间推理 $r_i$ 时,不能再只顾着吐出文本,而是必须同步显式地输出一个可靠性评估变量 $c_i$。这意味着,模型需要将原本隐藏在深层网络中的置信度显式化,并固化为伴随推理步骤的结构化表达。至关重要的是,这并不会阻碍模型原本的思维发散能力,模型依然可以自由探索各种解题路径以保证任务效用,只是此时它的每一寸思维轨迹,都已经被贴上了清晰的“置信度质检标签”。这种设计赋予了推理轨迹一种细粒度且高度可解释的结构。
第二环则是“选择性承诺”(Selective commitment),这一步直接决定了模型最终展现给外界的面貌,即根据自身已知采取克制的行动。在完成了带有可靠性评估信号的推理探索后,模型在构建最终答案 $\tilde{y}$ 时开始进行严酷的内容过滤。它被训练为高度依赖并放大那些被标记为高可靠性的推理步骤,将这些坚实的基础信息转化为流畅的最终表述;同时,果断地降权乃至彻底切断那些被判定为低可靠性的思考分支。通过这种机制,中间的推理过程不再是无条件绑架最终答案的绳索,而是变成了一张带有危险预警的路网图,引导模型精确避开事实性错误的暗礁。
值得注意的是,这种解耦范式完全与具体的底层模型架构或某种狭隘的训练目标解绑,它可以被视为一种高度通用的技术思想,能够平滑地桥接到未来的任何一代大模型,或者与现有的检索增强生成(RAG)体系无缝融合。
结构化监督与同策略蒸馏:如何让模型学会“自知之明”?
架构设计足够优雅,但如何从零开始让现有的大型语言模型真正学会这种自省与克制?研究团队针对性地开发了一套两段式的强化训练流程,确保模型能够深刻内化这种解耦逻辑。
训练的第一阶段被称为基于校准感知的结构化监督(Calibration-Aware Structured Supervision,简称 CASS)。为了让模型学会准确评估自身的可靠性,研究人员引入了细粒度的事实性评估工具 VeriScore。在准备训练数据时,他们将长文生成的每一个推理步骤强行拆解为不可再分的原子声明集合。随后,这些声明被送入外部搜索引擎进行严格的交叉比对。如果某一步骤中的大部分声明都能找到坚实的外部证据背书,该步骤就会被归入高可靠性桶中;反之,如果在真实世界的数据库中碰壁,则被打上不可靠的标签。
一个精妙的设计细节是,研究团队并没有使用连续的数字标量来表示置信度,而是将其离散化为特定的语义 token(如 <reliable> 或 <unreliable>)。从决策论视角来看,这种截断机制近似于非对称效用下的最优阈值过滤;而从语言模型的本性来看,输出语义 token 显然比输出一个冷冰冰的浮点数更契合自回归生成的目标函数,从而使得模型在学习“自我认知”时更加得心应手。拿到可靠性标签后,研究者动用更强悍的 GPT-5 扮演裁判,重新打磨原始答案,强制抹除所有依赖不可靠推理的内容。最终构建出的监督数据强迫模型必须同时达成两个目标:既要生成附带自我质检标签的探索路径,又要只针对优质路径作答。
然而,较小规模参数的模型在面对复杂的自我评估和果断的内容裁剪时,往往表现得犹豫不决。它们的自我评估可能出现严重误判,或者在过滤不可靠信息时残留幻觉毒素。为此,研究团队叠加了第二阶段的优化:基于校准感知的同策略蒸馏(Calibration-Aware Policy Distillation,简称 CAPD)。在这个环节中,学生模型被要求先在给定的查询下“本色出演”,生成一套包含推理、评估和答案的完整轨迹。这种同策略(On-Policy)的展开让学生模型暴露了自身在真实推理中特有的缺陷。随后,利用已经在 CASS 阶段训练成熟的同系列大尺寸模型(如 Qwen3-14B)作为教师,对学生生成的轨迹进行逐 token 的严苛诊断。通过最小化师生模型在预测分布上的 KL 散度,小模型能够在自己熟悉的生成模式下,快速学会修正错误估算的置信度信号,并掌握更加强硬的最终筛选技巧。
多维验证与效率红利:不仅说得更准,而且算得更快
为了全面验证 CAG 框架的有效性,研究人员在 AlpacaFact、Biography、FactBench、Factory 和 FAVA 五个极具挑战性的长文事实性基准测试中,对横跨 Qwen 和 Llama 家族的不同架构、不同参数规模的模型进行了深度摸底。
实验数据揭示了压倒性的优势。传统的拒答机制不出所料地在长文任务中折戟,因为拒绝回答严重破坏了有用性指标,导致综合得分惨不忍睹。而搭载了 CASS 监督机制的 CAG 框架,在所有测试阵列中均实现了显著的性能跃迁。以 Llama-3.1-8B 为例,其综合事实性得分从原先的 61.51 一举狂飙至 71.79,提升幅度超过 10 分。更令人振奋的是,研究团队通过严格验证确认,这些分数的大幅增长绝非因为投影机制暗中引入了外部新知识,而是纯粹依靠模型学会了更好地管理和压榨自身已有的知识库。对于参数规模较小的模型系列,在叠加 CAPD 蒸馏之后,还能榨取出额外的性能提升空间。
这项技术的适用边界也绝不仅限于标准的长文事实测验。研究人员进一步将测试版图扩展到了极其考验模型底蕴的知识密集型问答任务(如 PopQA 和 GPQA)以及强调开放交互的聊天机器人场景中。



通过这三组对比图表可以清晰地看到,无论是面对需要从深层权重中打捞罕见知识的 PopQA 提问,还是在考察前沿复杂科学概念的 GPQA 测试中,CAG 加持下的模型表现始终力压所有基线方案。在 Vicuna QA 模拟的自由对话环境中,解除了耦合束缚的模型在组织长篇距回答时显得尤为从容,不仅事实错漏大幅减少,其表达的连贯性和流畅度也经受住了严苛的考验。
在收获了巨大的事实性增益之外,CAG 框架还带来了一个极其诱人的工程学红利——显著降低了系统的解码耗时。在没有实施解耦干预的长文生成中,模型一旦在错误的推理分支上迈开脚步,就不可避免地会花费成百上千个毫无意义的 token 去为上一个错误辩护,或者堆砌毫无营养的车轱辘话。但在 CAG 的干预下,由于模型在进入最终的承诺环节时,会大刀阔斧地斩断并抛弃那些被判定为不可靠的冗杂推理路径,最终呈现给用户的答案变得空前精炼。数据证实,通过源头拦截不可靠内容,模型在保证信息核心价值不缩水的前提下,将整体解码时间最高压缩了惊人的 37%。对于算力成本高昂的大模型在线推理业务而言,这种通过重塑模型内在逻辑机制而自然结出的降本增效之果,无疑具有极高的现实商业价值。
这项由微软与北大共同推进的探索,彻底解构了束缚大模型长文生成质量的核心痼疾。CAG 框架证明了一个深刻的道理:要让生成式人工智能变得更加可信,我们未必非要一味地向其强灌海量知识,或者用外部检索器打满补丁。很多时候,教会模型保持内省,赋予它们分辨“已知事实”与“虚无妄测”的能力,并恪守不在最终输出中信口开河的底线,才是跨越现阶段幻觉困境的最短路径。探索与承诺的解耦机制,极有可能成为下一代大语言模型自我进化的一项基础出厂配置。