GCPO:双侧正交约束锁死参数漂移,大模型强化学习告别长度膨胀与崩溃
GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

在以 DeepSeek-R1、GRPO(Group Relative Policy Optimization)等技术为代表的大模型强化学习后训练(RL Post-Training)浪潮中,自我生成的采样反馈(On-policy Rollout)带来了极强的复杂推理与思维链涌现能力。然而,这种依靠自身演化策略产生样本再进行优化的闭环机制,也伴随着业界普遍头疼的系统性痛点:训练过程极易出现剧烈震荡甚至突然崩盘、跨任务能力发生灾难性退化,以及策略为了“刷分”而疯狂拉长回复生成的“长度膨胀”(Response-Length Inflation)。
ArXiv URL:https://arxiv.org/abs/2608.11674v1
为了抑制这些不稳定现象,以往的主流方案大多在策略输出层面打补丁,例如施加参考模型的 KL 散度约束、对策略概率比进行截断(PPO/GRPO Clipping),或是对长度和格式进行奖励惩罚。但这些方法本质上都属于输出空间的“软性引导”,并没有真正触及模型内部参数在梯度驱动下究竟发生了什么。
来自华中科技大学、上海人工智能实验室、上海交通大学与 NovaCore 的研究团队在论文《GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs》中给出了一个全新的观察视角:导致模型性能崩溃与异常行为的根本诱因,并非输出空间的不平滑,而是参数更新在特定几何子空间内的“非法入侵”。团队提出了 GCPO(Geometrically Constrained Policy Optimization,几何约束策略优化),通过在参数空间施加严格的双侧正交硬约束,阻止强化学习梯度破坏预训练模型的关键流形结构。在 Qwen3-8B 和 GLM4-9B 上的大量实验表明,GCPO 不仅全面超越 GRPO 及其衍生变体(最高较强基线提升 2.37 分,相比基础模型提升最高达 27.69 分),还在几乎不增加额外显存负担的前提下,从结构上彻底根治了长度膨胀并显著提升了跨任务泛化保留能力。
隐藏在平均值之下的瞬态危机:参数更新的主子空间入侵
理解 GCPO 的第一步,是重新审视大语言模型在强化学习期间的参数几何形态。对于模型中任意一个预训练线性权重矩阵 $W_{\mathrm{ref}} \in \mathbb{R}^{d_{\mathrm{out}} \times d_{\mathrm{in}}}$,可以通过奇异值分解(SVD)将其表示为 $W_{\mathrm{ref}} = \Phi \Sigma \Psi^{\top}$。其中,前 $k$ 个奇异值对应的左、右奇异向量矩阵 $\Phi_k$ 与 $\Psi_k$ 所张成的子空间,被称为该权重矩阵的主子空间(Principal Subspace)。
在几何与泛函意义上,主子空间界定了该线性变换最主要的输入感应方向与能量输出方向,构成了预训练权重结构的主干;而与其正交的补空间(Orthogonal Complement)则代表了次要或未被完全占用的自由维度。以往的部分几何研究曾得出结论:强化学习的参数更新大部分天然落在主子空间之外,因此似乎不需要特别处理。
然而,研究团队指出,全训练周期的“平均正交”掩盖了单步更新中的“瞬态危险”。
为了精确刻画每一次策略更新在微观时间步上的几何行为,研究者定义了校正维度的单步主子空间重叠度(Principal-Subspace Overlap)。他们将每次更新量 $\delta^{(t)}W$ 投影分解为四个分块:
-
$PP$ 块:左右两侧均位于主子空间内($\Pi_{\Phi}\delta^{(t)}W\Pi_{\Psi}$);
-
$PO$ 块与 $OP$ 块:一侧位于主子空间、另一侧位于正交补空间;
-
$OO$ 块:左右两侧均位于正交补空间($\Pi_{\Phi}^{\perp}\delta^{(t)}W\Pi_{\Psi}^{\perp}$)。
更新能量落入主子空间的总比例为 $O_t = 1 - (E_{OO} / E_{\mathrm{total}})$。考虑到高维空间中纯随机向量也会因为子空间本身的维度产生固有重叠,论文进一步减去了各向同性随机更新下的期望重叠基线 $O_{\mathrm{null}}$,从而定义了超额主子空间重叠(Excess Principal-Subspace Overlap) $O_t^{\mathrm{excess}} = O_t - O_{\mathrm{null}}$。

监控这一指标后,研究者捕获到了惊人的一幕:如上图所示,尽管在整个训练阶段,模型更新的能量平均有 93% 到 97% 以上都安分地停留在 $OO$ 补空间中,但在训练过程的特定节点,超额重叠度会突然出现短暂而强烈的尖峰(红线)。更为致命的是,这些重叠尖峰的爆发,在时间维度上往往精准地先于模型验证集性能的断崖式下跌或持续退化(蓝线)。这一微观几何异常表明,一旦强化学习探索过程中的高方差梯度偶然“撞入”了预训练权重的主子空间,预训练的核心变换结构就会遭到破坏,进而诱发策略崩溃。
并不是巧合:子空间入侵的因果干预验证
时序上的相关性是否足以证实因果关系?为了排除“重叠尖峰仅仅是性能衰退的伴生副产物”这一可能性,论文在 Qwen3-8B 运行于 ToolAlpaca 的真实更新步上进行了精细的受控反事实干预实验。
研究团队设计了一个缩放系数 $\eta$,在严格保持每一层更新量的 Frobenius 范数(即扰动总能量)完全不变的前提下,人为调节该步更新中主子空间分量的强度:
-
当 $\eta = 1$ 时,对应模型实际发生的原始更新(基线准确率为 56.89%);
-
当 $\eta = 0$ 时,完全剔除更新中涉及主子空间的分量,仅保留双侧正交补空间分量;
-
当 $\eta > 1$ 时,则按比例强行放大主子空间分量,模拟更严重的入侵。
与此同时,团队还设置了一组控制组:向大小相同但完全随机抽取的子空间注入等量扰动。

干预结果呈现出极其清晰的单调剂量反应关系。如图所示,随着主子空间侵入系数 $\eta$ 的增加,模型的评估准确率迅速崩溃;而当 $\eta = 0$ 完全阻断主子空间重叠时,模型性能反而超越了原始更新步的表现。相比之下,向随机子空间施加相同能量的扰动,性能下降幅度要平缓得多。
这一因果干预直接锁定了问题的关键根源:在强化学习中,参数更新绝不是在任意方向上等价的向量。侵蚀预训练权重的主子空间具有极高的破坏性,而将更新完全限制在正交补空间中,不仅不会阻碍新能力的学习,反而能消除探索带来的自毁风险。
GCPO 机制:双侧正交投影的硬几何构型
既然主子空间入侵是诱发崩溃的病灶,解决方案便不再是去小心翼翼地微调目标函数里的 KL 惩罚系数,而是从数学结构上直接封死参数流向主子空间的通道。
这就诞生了 GCPO(Geometrically Constrained Policy Optimization)。GCPO 的核心思想极为直接:将强化学习的策略优化问题转化为一个带严格几何约束的极值问题。对于任意选定的自适应线性层 $\ell$,在追求策略奖励最大化的同时,强制要求其参数更新量 $\delta^{(t)}W^{(\ell)}$ 必须与预训练时固定的主奇异子空间完全正交:
\[\Phi_{k}^{(\ell)\top}\delta^{(t)}W^{(\ell)} = 0 \quad \text{且} \quad \delta^{(t)}W^{(\ell)}\Psi_{k}^{(\ell)} = 0\]这两个方程在几何上意味着:更新量既不能在输入侧拾取预训练的主输入模式,也不能在输出侧直接干扰预训练的主响应通道。
为了在工程实现中避免昂贵且不稳定的拉格朗日乘子迭代求解,GCPO 采用了一种高度优雅的参数化投影形式。在训练开始前,算法通过一次性 SVD 提取各层权重矩阵的前 $k$ 阶主奇异向量,并预先计算出其双侧正交补投影算子 $\Pi_{\Phi}^{\perp} = I - \Phi_k \Phi_k^\top$ 与 $\Pi_{\Psi}^{\perp} = I - \Psi_k \Psi_k^\top$。在后续的所有 Rollout 更新迭代中,权重的有效增量被直接参数化为:
\[\delta^{(t)}W^{(\ell)} = \alpha \Pi_{\Phi}^{\perp} L^{(\ell)} R^{(\ell)} \Pi_{\Psi}^{\perp}\]其中 $L^{(\ell)}$ 和 $R^{(\ell)}$ 为可训练的低秩分解矩阵,$\alpha$ 为缩放常数。
这种参数化设计赋予了 GCPO 若干关键的数学与系统特性:
-
构造即满足约束(Constraint by Construction):无论反向传播计算出的策略梯度多么混乱、方差多么巨大,经过两侧投影算子的夹逼,落在主子空间的分量会在前向和后向传播中被恒等置零。梯度只能在预训练结构的互补空间中更新参数,彻底杜绝了瞬态重叠尖峰的出现。
-
零干扰保证与庞大的更新容量:对于任何落在预训练主输入子空间内的信号向量 $x \in \mathrm{span}(\Psi_k)$,由于 $\Pi_{\Psi}^{\perp} x = 0$,自适应层对其计算输出的变化量恒等于零。这意味着预训练的核心骨架变换被完全冻结保全。与此同时,由于大模型层维度通常高达数千,而主子空间截断阶数 $k$ 往往只需设为 8 左右,正交补空间的自由维度仍高达 $(d_{\mathrm{out}} - k)(d_{\mathrm{in}} - k)$,为策略适应新任务留出了极其充裕的参数容量。
-
与传统 LoRA 及软惩罚的本质区别:常规的 LoRA 仅通过低秩分解来压缩参数规模,其更新方向依然能够在整个参数空间中任意旋转,无法阻断主子空间入侵;而基于损失函数的正交正则化惩罚(Soft Penalty)则需要在强化学习的高方差动态环境中反复调节超参数,一旦梯度信号过强,软惩罚很容易被冲垮。GCPO 则是将几何约束焊死在模型架构中,形成不可逾越的硬边界。
全面超越基线:性能增益与跨任务保留
研究团队在 Qwen3-8B 和 GLM4-9B 两大主流模型底座上,跨越数学推理(MATH500)、代码生成(HumanEval+)以及工具调用(ToolAlpaca)三大任务领域,对 GCPO 展开了系统性验证。对比基线不仅涵盖标准 GRPO,还囊括了近年来针对稳定性改良的代表性算法,如 GSPO、DAPO、GMPO 以及基于低秩适配的 GRPO-LoRA。
下表给出了各模型在三大核心基准上的多数投票准确率(majority@16)表现:
| 模型基座 | 优化方法 | 数学推理 (MATH500) | 代码生成 (HumanEval+) | 工具调用 (ToolAlpaca) |
|---|---|---|---|---|
| Qwen3-8B | Base Model | 56.40 | 66.83 | 55.45 |
| GRPO | 78.47 ± 1.36 | 72.80 ± 0.88 | 70.02 ± 1.52 | |
| DAPO | 79.53 ± 0.61 | 74.02 ± 0.48 | 71.74 ± 0.76 | |
| GSPO | 79.80 ± 0.69 | 74.45 ± 0.45 | 71.55 ± 0.71 | |
| GCPO (Ours) | 82.17 ± 0.31 | 75.47 ± 0.27 | 73.20 ± 0.39 | |
| GLM4-9B | Base Model | 56.40 | 60.12 | 53.64 |
| GRPO | 76.53 ± 1.84 | 69.88 ± 1.42 | 68.32 ± 1.65 | |
| DAPO | 81.33 ± 0.82 | 73.66 ± 0.71 | 72.63 ± 0.93 | |
| GSPO | 81.53 ± 0.91 | 73.78 ± 0.76 | 72.48 ± 0.88 | |
| GCPO (Ours) | 84.09 ± 0.34 | 75.93 ± 0.29 | 74.68 ± 0.41 |
从实验数据中可以提炼出三个极具说服力的结论:
首先,在全部 6 组对比实验中,GCPO 无一例外地斩获了最优准确率。相较于未经强化的指令微调基座,GCPO 带来了 7.09 至 27.69 个百分点的巨大跨越;对比当前各类强化学习变体中最强的竞品,GCPO 依然稳定领先 1.02 到 2.37 个百分点。在优化难度更大的 GLM4-9B 上,这种领先优势更加突出。
其次,训练方差大幅收敛。从多次随机种子的标准差(std)可以看出,GCPO 的波动范围通常仅有 0.27 至 0.41,不足传统 GRPO 的三分之一。双侧正交硬约束像一道避震器,有效过滤掉了策略探索过程中的随机扰动。
更为严苛的考验在于跨任务能力的保留测试。在强化学习后训练中,“对齐税”(Alignment Tax)常表现为单一领域微调导致的全面遗忘:在数学任务上强化后的模型,往往在通用代码和工具调用上出现断崖式退化。为了检验这一点,研究者将仅在 MATH500 上强化后的模型直接迁移至 HumanEval+ 和 ToolAlpaca 进行 zero-shot 测试。
测试显示,标准 GRPO 在 GLM4-9B 上的 ToolAlpaca 表现发生了高达 -14.97 分的暴跌;即便是加入了各种裁剪控制的 DAPO 和 GSPO,降幅也依然在 3 到 5 分左右。而 GCPO 凭借对主子空间的几何隔离,展现出了近乎免疫的保留特性:在 ToolAlpaca 上不仅没有发生能力衰退,反而取得了 +0.91 到 +1.03 分的微增,同时还将代码 HumanEval+ 的成绩反哺提升了 3.99 至 5.88 分。这确凿地证实:锁死预训练主子空间,是抵御灾难性遗忘最有效的物理屏障。
动力学诊断:斩断长度膨胀与保持策略健康
除了最终指标的提升,GCPO 在整个强化学习生命周期中所展现出的动力学稳定性,同样具有极高的工程应用价值。
1. 消除奖励作弊引起的“回复长度膨胀”
在基于 Rollout 的大模型推理强化(尤其是长思维链探索)中,模型极易习得一种被称为“长度膨胀”的作弊捷径:策略发现只要不断生成冗长、车轱辘话式的 Token,就能在统计上蒙对更高奖励,导致生成长度不受控制地发散。在 MATH500 训练轨迹中,GRPO 生成的 Token 数量在后期呈现失控式飙升。而在相同的奖励和训练配置下,GCPO 生成的响应长度却始终收敛在紧凑、平稳的健康区间内。论文作者给出的几何解释非常深刻:语言模型对生成长度的先验偏好与控制往往编码在高显著性的主子空间中。GCPO 阻断了梯度对主子空间的直接修改,从而剥夺了模型通过扭曲底层长度先验来进行投机取巧的能力,迫使策略只能在逻辑推演的子空间内探索真正有效的解答路径。
2. 平滑的策略熵衰减轨迹
在探索与利用的博弈中,策略熵(Policy Entropy)是核心指示器。理想的状态应当是熵值平稳、循序渐进地下降。在消融分析中,GRPO 的策略熵伴随着强烈的震荡,而许多基线算法为了控制稳定性,往往会导致策略熵在训练早期发生断崖式下跌——这意味着模型过早丧失了生成多样性,陷入局部最优。GCPO 则维持了一条极为优雅、平滑的单调下降曲线,既保留了前期的探索自由度,又确保了后期的稳健收敛。
3. 为什么必须是“双侧”正交硬约束?
在消融实验中,研究团队深入探讨了正交投影的配置细节,得出了两条关键结论:
-
单侧投影无法封堵泄漏:如果仅对左奇异向量(输出端)或右奇异向量(输入端)施加单侧正交,模型性能改善微乎其微。从矩阵代数上看,只保住一侧,高维梯度的能量依然会借由另一侧渗透到主变换中产生重叠;唯有左右开弓的“双侧正交”,才能彻底消除主子空间分量。
-
软性惩罚防不住迭代累积:若不在参数化层面使用硬投影,而是向损失函数中添加软正交惩罚项(如限制 $|\Phi_k^\top \delta W|_F^2$),在面对强化学习复杂的 Rollout 动态时,软惩罚会被累积的梯度迅速击穿,最终重蹈性能震荡的覆辙。
4. 显存与计算开销保持原位
引入了复杂的 SVD 和投影算子,是否会拖垮分布式训练的系统效率?事实恰恰相反。由于 SVD 仅需在训练前在 CPU 或单卡上预先计算一次(对于 8B/9B 模型仅需数秒),投影矩阵在训练期间完全冻结且不维护任何优化器状态(Optimizer States)。因此,GCPO 的实际 GPU 峰值显存占用与低秩适配的 GRPO-LoRA 完全在同一水平线,远低于维护全量参数梯度的全参数 GRPO。在推理阶段,学习到的低秩正交更新 $\delta W$ 可以直接折叠相加回原预训练权重矩阵中,实现推理阶段的零延迟、零额外计算负担。
总结与技术展望
长期以来,强化学习在语言模型后训练阶段的应用,多多少少带有一种“黑盒调试”的色彩。面对训练崩溃、泛化回退或长度失控,算法工程师们习惯于在 Prompt 构造、奖励塑造、KL 惩罚系数或概率比截断超参数中疲于奔命。
GCPO 的价值在于,它跳出了单纯在输出层做统计修补的思维定式,将目光投向了参数空间的微观几何演化。它通过严谨的时序观测与因果干预证明了:参数更新不是在无差别的空间中漫游;侵入预训练权重的主奇异子空间,就是引发模型崩溃与作弊行为的导火索。
通过引入低秩双侧正交投影这一兼具数学确定性与工程高效性的机制,GCPO 在保留预训练核心流形不变的同时,开辟了平稳可靠的任务探索通道。这一成果不仅为当前炙手可热的推理大模型强化训练提供了一套即插即用、开箱即用的稳健范式,也为未来进一步探索“网络内部参数几何如何决定宏观推理能力”打开了一扇极具启发性的窗口。