ReSum揭秘:大模型学会自我总结,推理提升4%且输出缩减18%

ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning

最近,强化学习在大语言模型复杂任务中大放异彩。 但随之而来的是一个恼人的副作用:模型极易陷入过度思考。 它们生成的推理链条越来越长。 这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。 甚至让模型陷入重复验证同一子问题的死循环。

ArXiv URL:http://arxiv.org/abs/2606.13316v1

针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。 该研究名为 ReSum。 它不依赖复杂的外部调用,而是通过强化学习让模型学会“自我总结”。 在提升4%平均准确率的同时,成功将推理长度缩减了18.6%。 本文将带你深入剖析这一令人耳目一新的前沿突破。

理论先导

在长文本组织领域,现有的应对方案多依赖外部机制。 例如使用缓存监控、额外的文本压缩器或是复杂的智能体模块。 这种“外挂”方式不仅增加了系统开销,还往往面临失实的风险。 外部模块生成的总结,很容易偏离模型最原始的推理意图。 那么,模型自身的“自我总结”能否作为内在的组织机制? 为了回答这个问题,研究团队进行了两项引人深思的先导实验。

Refer to caption

如上图左侧所示,第一项实验分析了生成轨迹中 Token 的熵值分布。 他们敏锐地发现,模型在即将输出总结性短语前,不确定性急剧升高。 而一旦成功输出总结短语后,后续 Token 的熵值会呈现断崖式下降。 这意味着自我总结能在关键时刻显著降低生成的混乱度。

右侧的第二项实验则更为直接。 研究者在错误的推理前缀中,强行注入诸如“总而言之”的总结短语。 结果令人惊讶:这种简单操作让后续生成的准确率最高提升了30%! 这充分说明,自我总结能有效阻断错误前缀的负面传播。

机制剖析

既然自我总结如此有效,如何让模型自主掌握这项核心技能? 该研究抛弃了传统的监督微调,转而采用树状强化学习进行探索。 为了更好地理解这个过程,我们可以引入一个“长途自驾”的克制比喻。 大模型在执行长链推理时,就像在一条没有路标的蜿蜒山路上驾驶。 开得越久,越容易忘记起点,甚至在原地打转。 自我总结就像是驾驶员定期在路口停下,在导航仪上打个“途经点”。 把之前绕过的所有弯路压缩成一句“我已经到了半山腰”。 这样接下来的路程就变得无比清晰,不易偏航。

为了让模型学会在哪里打“途经点”,本文设计了两种对比分支机制。 首先是 自然节点Natural Points, NPs)。 它对应于模型在生成过程中自发产生的总结行为。 通过关键字匹配定位后,系统会将该总结短语掩码屏蔽。 强迫模型在缺失总结的情况下重新生成后续内容。 这就像是在测试:如果刚才不打那个“途经点”,你会不会迷失方向?

其次是 人工节点Artifact Points, APs)。 它们是从非总结位置随机采样的点。 在这些位置,系统会人为注入预设的总结短语。 以此来评估在原本没有总结的地方强行总结,是否会带来潜在收益。 这两种分支策略相辅相成。 使模型既能学习何时应该引入新总结,又能验证既有总结的有效性。

策略优化

有了这些对比分支,接下来就是如何进行科学的信用分配。 传统的强化学习算法往往只计算全局或者单一维度的优势函数。 而本文提出了 感知总结的分组相对策略优化SGPO)。 在生成的轨迹树上,系统将所有分支划分为两组。 一组是包含总结的轨迹,另一组是不含总结的轨迹。

接着,算法会进行精细化的两层优势计算。 首先是包含总结组内的“组内优势”。 它偏好那些将总结放置在更有效位置并获得更高最终奖励的轨迹。 这从根本上解决了“在哪里总结收益最大”的问题。 其次是“组间优势”。 它将总结分支与未总结分支进行横向对比。 从而精准评估“总结”这一行为本身对当前任务的整体效用。 通过这种极其细粒度的过程监督,模型不再是盲目堆砌字数。 而是深刻掌握了“何时该总结”的火候。

理论透视

为了进一步巩固这一框架的严谨性,研究者提供了详实的理论透视。 核心思想是,总结本质上扮演了一个极其高效的上下文压缩算子。 它剔除了历史记录中的冗余信息,同时保留了未来推理所需的核心要素。 在固定的生成预算下,这使得整个推理过程变得更容易被优化。

研究者在文中定义了“压缩误差”这一数学概念。 它用来衡量带有总结的前缀与原始前缀在续写分布上的KL散度差异。 如果总结是忠实且准确的,那么这种误差就会被控制在极小范围内。 同时,理论推导表明,只要总结能够保持任务相关信息的保真度。 引入总结分支不仅不会降低期望回报,反而能在去除冗余时严格提升最终收益。 这为实证结果提供了坚不可摧的理论支撑。

核心验证

研究团队在包含 AIME24、MATH500 等多个硬核数学基准上进行了详尽测试。 他们选择了从 1.5B 到 7B 等不同参数量级的基座模型。 实验结果不仅证明了该方法的普适性,更彰显了其强悍实力。

以 Qwen2.5-Math-7B 为例,ReSum 的表现极为惊艳。 在各大测试集中,平均准确率达到了41.64%。 相比于标准强化学习基线,绝对提升了足足4.03%。 在竞争激烈的高难度测试集 AIME25 中,它更是拉开了显著差距。

更有趣的是训练与推理过程中的长度变化动态。

Refer to caption

如上图所示,在初期,由于模型还在摸索总结的技巧,输出长度有所增加。 但随着训练不断深入,模型彻底掌握了压缩冗余上下文的诀窍。 最终输出长度相较于基线方法大幅下降了18.6%。 这有力地证明了,性能的提升绝非源于无脑的“暴力穷举”。 而是来自于更凝练、更高质量的逻辑推演。

难度扩展与跨模态应用

该研究还进一步分析了不同问题难度级别下的表现趋势。

Refer to caption

在 MATH500 数据集的难度分级测试中,一个清晰的规律浮出水面。 对于最困难的 Level 5 题目,基线模型往往因容量或长程遗忘而崩溃。 但 ReSum 却能在此类高难度题目上实现高达6%的惊人飞跃。 这是因为复杂题目极易引发长程错误的滚雪球式累积。 而适时的自我总结机制,如同断路器一般,完美切断了错误的传导链。

此外,该研究并未局限于纯文本的数学推理领域。 团队还将这一框架应用到了多模态视觉问答任务中。 在 GEOQA-8K 数据集上,该方法依然奏效,取得了显著提升。 这证明了长序列自回归生成中的冗余与遗忘是跨模态的通病。 而内化总结能力,则是放之四海而皆准的通用解法。

局限探讨与工程启示

尽管效果拔群,本文的方法依然存在一些值得关注的局限性。 目前的总结触发主要依赖于特定短语的启发式关键字匹配。 这在一定程度上限制了总结形式的绝对自由度。 此外,在训练阶段构建庞大的树状对比分支,不可避免地增加了计算开销。

然而,这丝毫不影响该研究带来的巨大工程启示。 对于致力于开发新一代复杂推理大模型的工程师而言,本文敲响了警钟。 盲目鼓励模型拉长思考过程,绝非通往智能巅峰的唯一路径。 赋予模型自主压缩工作记忆、精炼历史上下文的能力同样关键。 ReSum 雄辩地证明了,强化学习能够优雅地将这一能力内化到模型深处。 在未来的长文本与复杂推理系统设计中,“定期整理思绪”或将成为不可或缺的底层机制。