打破大模型推理天花板:DSRL双空间强化学习,反思能力暴涨14倍
From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space
以DeepSeek-R1为代表的卓越模型,将基于可验证奖励的强化学习(RLVR)推向了整个行业的聚光灯下。 然而,这种后训练范式隐藏着一个不容忽视的致命瓶颈。 它通过优化条件分布 $P(y|x)$ 来提升推理能力,这意味着其潜力被基座模型现有的输出分布严格锁死。 简单来说,如果基座模型原本的推理路径就极度匮乏,单纯依赖后期的强化学习,模型很容易陷入局部最优。 如何才能真正打破这一先天形成的天花板?
ArXiv URL:http://arxiv.org/abs/2604.14142v1
近期,由中国科学院、新加坡国立大学与腾讯AI Lab等机构联合提出了一项开创性研究。 该研究大胆地将强化学习直接引入预训练空间,提出预训练空间强化学习(PreRL)以及进阶的双空间强化学习(DSRL)。 这一方法不仅大幅提升了样本的学习效率,更让模型内生的反思思考能力暴涨了惊人的14.89倍。
核心机制:从条件概率到边缘概率的底层跨越
在探讨大模型强化学习时,我们不得不正视现有方法的底层逻辑缺陷。 传统的强化学习(RL)方法,其核心目标高度依赖于输入问题 $x$ 的概率期望。 这种被称为后训练空间(Post-train Space)优化的范式,天然带有极强的任务偏好。 当我们在特定任务集上不断提升奖励信号时,模型实际上是在现有的知识库中进行“定向压榨”。 长期以往,这种学习方式不可避免地限制了探索空间。
而预训练空间的常规优化,虽然通过静态语料库保留了探索空间,但它是一个被动的过程,无法进行针对性的奖励驱动强化。 本文在数学层面上给出了严谨的推导,证明了边缘目标 $\log P(y)$ 与条件目标 $\log P(y|x)$ 之间存在着强烈的梯度对齐效应。 通过引入PreRL,研究人员成功移除了更新步骤中的问题条件约束。 直接在预训练空间优化边缘分布,不仅能作为标准强化学习的有效替代方案,还能完美保留模型最原始、最广泛的探索能力。
反直觉发现:负样本强化机制的奇效
这里的核心技术难点在于,如何在没有任何问题限制的预训练空间进行有效的强化学习? 本文细致地剥离了正样本与负样本在优化过程中的不同作用,并发现了一个极具颠覆性的现象。 如果在预训练空间中执行正样本强化(PSR),模型的整体性能反而会遭遇灾难性的崩溃! 因为这会让模型在自己生成的少数正确样本上过度堆砌概率权重,进而导致思维空间的严重僵化。 相反,负样本强化(NSR)却在这个空间中展现出了惊人的指导效力。
为了精准理解这个深奥的现象,我们可以引入一个“迷宫探险”的推演机制。 优化 $P(y|x)$ 就像是给模型绘制一张特定迷宫的精确通关路线图。 它能极其高效地通过当前迷宫,但一旦切换到未知迷宫,它往往会显得束手无策。 而在预训练空间直接做正样本强化,就像是强行让大脑死记硬背某一条走通的路,剥夺了它探索潜在可能性的宝贵机会。
负样本强化(NSR)的运作机制则截然不同。 它不主动告诉模型应该往哪里走,而是直接在预训练空间的所有死胡同前,牢牢钉上“禁止通行”的路牌。 通过这种机制,快速修剪预训练空间中那些注定错误的推理路径。 模型在这种“排除错误”的压迫感下,被倒逼着去自主探索更广阔的概率空间。 正是这种修剪机制,极大激发了模型内生的反思与纠错行为。 核心数据显示,NSR-PreRL让模型的过渡思考和反思思考分别激增了14.89倍和6.54倍。

双空间策略:DSRL的策略转世架构
基于对负样本强化机制的深刻洞察,研究团队精心设计了双空间强化学习(DSRL)的完整框架。 这套框架采用了一种被称为“策略转世”的巧妙分阶训练机制。 整个训练管线被严格划分为两个阶段,以实现探索与利用的极致平衡。
第一阶段:在预训练空间进行NSR-PreRL的高效预热。 在此阶段,输入特征 $x$ 被强制遮蔽,算法仅对生成轨迹中的负样本施加惩罚更新。 这能极其快速地修剪底层的错误逻辑,大幅拓宽模型的推理视野。
第二阶段:无缝平滑切换到标准的后训练强化学习阶段。 此时的模型,已经拥有了过滤掉大量低级错误的极佳初始化状态。 随后利用GRPO等标准算法,对条件策略展开细粒度的靶向优化。 这种先破除思维定式,再建立具体解题策略的方法,彻底打通了预训练与后训练的壁垒。
关键实验:效率与泛化能力的双重飞跃
在极具挑战的数学推理任务中,DSRL展现出了堪称碾压级别的性能优势。 该研究基于Qwen3-4B和Qwen3-8B模型展开了大规模对比实验。 在涵盖MATH500、AIME24、AIME25等顶尖数据集的评测中,DSRL全面超越了各类强力基线。 特别是在Qwen3-4B上,DSRL在AIME24基准上超越了标准GRPO高达4.69分,相较于Dr.GRPO和DAPO等最新算法,也保持了显著领先。
更令人印象深刻的,是其在训练效率上展现出的巨大潜力。 相较于标准GRPO算法,DSRL达到45.0%和58.0%准确率所需消耗的训练步数,分别大幅减少了2.5倍和1.6倍。 这有力地证明了,前期对底层错误路径的系统性修剪,能够以指数级降低后期试错的昂贵成本。

上图清晰记录了训练动态中“完全解出”与“完全未解”问题的演变轨迹。 在关键的NSR-PreRL预热阶段,“完全解出”的数量呈现出爆发式的陡增。 与此同时,“完全未解”的硬骨头问题数量则出现断崖式下跌。 这从根本上证实了,模型并非依赖运气碰巧猜中答案,而是真正内化了核心的错误模式,铸就了坚不可摧的推理地基。
除了专精的数学推理,DSRL在分布外的通用测试中同样展现出卓越的性能。 在GPQA-Diamond和MMLU-Pro等考验综合知识储备的任务上,Qwen3-4B分别获得了3.79和5.37分的巨大提升。 在代码生成测试中,也录得了实质性增长。 这充分证实了,预训练空间的优化赋予了模型强大的跨领域底层迁移能力。
局限性与工程落地启示
尽管成果斐然,该研究也严谨地揭示了双空间策略对预热阶段的高度敏感性。 消融实验清晰表明,NSR-PreRL的预热步数与最终性能之间存在一个敏感的倒U型区间。 通常情况下,10到25步的预热是最佳的黄金窗口。 步数过少,无法提供足够的刺激来修剪错误空间;而步数过多,过度的无约束探索会导致模型生成极度发散的内容,反而阻碍后期的细粒度策略优化。
研究团队还尝试将负样本强化策略直接照搬到后训练空间,结果平均得分仅为54.38分,甚至低于完全不预热的标准方法。 这一对比极其有力地论证了预训练空间在构建基础探索能力上具备不可替代的独特优势。
对于当前的工程落地实践而言,本文提供了一条极具操作性的全新破局路径。 在算力资源受限或面临基座模型能力瓶颈时,切忌盲目使用标准强化学习死磕复杂任务。 更为明智的策略是:先在无约束的预训练空间中,巧妙利用负反馈机制大规模剔除基础错误逻辑。 这种以极低成本实现的“地基加固”策略,极有可能成为未来大模型强化学习流水线中的核心标配环节。