TCER:相对信息增益破解平庸偏置,阿里无监督强化学习新突破
Triviality Corrected Endogenous Reward

在当今大语言模型(LLM)的训练范式中,对齐技术已经成为决定模型最终表现的胜负手。在有监督微调(SFT)阶段之后,强化学习微调(RFT)被广泛用于进一步优化模型行为。然而,当我们把目光从数学推理或代码生成转向开放式文本生成(如长文写作、创意生成)时,强化学习面临着一个极为棘手的瓶颈:缺乏可验证的客观奖励信号。
ArXiv URL:https://arxiv.org/abs/2604.11522v1
与数学题有标准答案、代码可以通过编译器测试不同,写作的质量是主观且多维度的。当前的常规做法高度依赖于“模型裁判”(LLM-as-a-Judge),但这带来了一个进退两难的困境:要么调用极其昂贵的闭源顶级模型(如 GPT-4)API 充当评判者,要么耗费海量成本去收集人类偏好标注数据来训练一个专门的奖励模型(Reward Model)。更何况,即使是人类标注员,对于“什么是好文章”也常常难以达成共识。
面对这一困境,数学推理领域近期跑通了一条无需外部监督的优雅路径:内生奖励(Endogenous Rewards)。该方法直接利用模型自身的置信度(即对数概率,log-probabilities)作为强化学习的奖励信号。既然模型自身已经具备了一定的判别能力,我们能否将这种“自给自足”的奖励机制迁移到开放式写作中,彻底摆脱对外部奖励模型的依赖?
来自阿里巴巴、北京大学和兰州大学的联合研究团队对此进行了系统性探索。他们发现,直接将内生奖励生搬硬套到写作任务中,会引发一种严重的退化现象——平庸偏置(Triviality Bias)。为了攻克这一难题,团队提出了一种名为 TCER(Triviality Corrected Endogenous Reward,平庸纠正内生奖励)的全新框架。该框架通过计算领域专家策略与通用基础策略之间的相对信息增益,并辅以概率依赖纠正机制,成功在没有外部监督的情况下,实现了跨模型、跨维度的开放式写作能力大幅提升,甚至令人意外地反向泛化到了数学推理任务中。
致命的吸引力:内生奖励为何引发平庸偏置?
要理解 TCER 的精妙之处,我们必须先弄清楚传统的内生奖励在处理自然语言生成时究竟出了什么问题。
近期关于语言模型自我对齐的理论研究表明,下一个 Token 预测任务与逆向强化学习(Inverse Reinforcement Learning,IRL)之间存在着深层的数学联系。在 IRL 的框架下,给定一个隐式奖励 $r$,最优策略往往呈现出玻尔兹曼分布(Boltzmann distribution)的形式。这意味着,一个经过良好预训练和微调的模型,其参数内部实际上已经隐式编码了一个奖励函数。
基于这一洞察,最直观的内生奖励方法就是直接使用生成 Token 的对数概率作为奖励信号:
\[r_{e}(y_{i}\mid s_{i})=\log\pi_{s}(y_{i}\mid s_{i})\]这种方法在数学推理任务中表现极佳。因为在数学推导中,逻辑最严密、最不容易出错的步骤,往往也是模型置信度最高的步骤。引导模型朝着高置信度方向优化,实际上是在收敛搜索空间,剔除那些容易引发幻觉的脆弱推理分支。

然而,当研究人员将这种看似完美的机制迁移到开放式写作时,灾难发生了。如上图所示,虽然内生奖励在一定程度上能提升模型相对于纯 SFT 基线的表现,但随着强化的进行,模型输出的熵(Entropy)开始急剧下降。
这就是团队定义的平庸偏置(Triviality Bias)。在开放式语境下,模型为了贪婪地最大化自身置信度,会不可避免地倾向于生成那些最高频、最安全的词汇。原本生动多样的表达被空洞的套话所取代,文章变得模板化,多样性和内容丰富度断崖式下跌。在数学上,这意味着策略在向着最大概率的单一顶点坍缩。模型学会了“最安全的废话”,却丢失了生成的灵魂。
TCER 的破局机制:在信息增益与探索之间寻找平衡
如何既能利用模型内部的隐式奖励信号,又能避免模型陷入“安全废话”的泥潭?研究团队提出的 TCER 方案包含两个极为关键的机制:基于双模型的相对信息增益解构,以及对抗高概率的动态权重惩罚。

第一层解构:剥离通用废话,提取专业增益
为了从根本上隔离那些高频的通用词汇,团队引入了一个巧妙的对比基准。他们定义了两个策略:一个是经历了高质量垂直领域数据微调的专家策略(Specialist policy,记为 $\pi_{s}$),另一个是微调前的通用基座策略(Generalist reference policy,记为 $\pi_{b}$)。
对于任何一个生成的 Token,其在专家模型中的对数概率可以被精确分解为两个部分:
\[\log\pi_{s}(y_{i}\mid s_{i})=\log\pi_{b}(y_{i}\mid s_{i})+\phi(y_{i}\mid s_{i})\]其中,$\phi(y_{i}\mid s_{i})$ 被定义为该 Token 的特定信息增益(Specific Information Gain),即专家模型相对基座模型的对数似然比:
\[\phi(y_{i}\mid s_{i})=\log\frac{\pi_{s}(y_{i}\mid s_{i})}{\pi_{b}(y_{i}\mid s_{i})}\]这一项的物理意义非常明确:如果一个词是大家都爱说的废话(比如“因此”、“总之”),它在基座模型和专家模型中的概率都很高,那么它们的比值接近 1,对数值 $\phi$ 就接近于 0。相反,如果一个词是只有在这个特定高质量写作领域才会出现的精妙表达,专家模型会赋予它远高于基座模型的概率,此时 $\phi$ 就会产生一个显著的正向奖励。通过这种解构,TCER 成功剥离了那些仅仅因为“常见”而获得高分的通用 Token。
第二层纠正:对抗极端的门控权重
仅仅拥有相对信息增益是不够的,直接使用对数似然比作为强化学习的奖励极易引发数值不稳定(特别是当基座模型预测概率极低时)。因此,TCER 保留了原始的内生奖励作为基底,同时将相对信息增益作为一种修正项加入,并为其设计了一个精巧的门控权重(Gating Weight):
\[w(y_{i}\mid s_{i})=\left(1-\pi_{s}(y_{i}\mid s_{i})\right)^{\lambda}\]完整的 TCER 奖励计算公式变为:
\[r_{t}(y_{i}\mid s_{i})=\log\pi_{s}(y_{i}\mid s_{i})+k\cdot w(y_{i}\mid s_{i})\cdot\phi(y_{i}\mid s_{i})\]这里的核心奥秘在于权重机制 $(1-\pi_{s})^{\lambda}$ 的运作逻辑。当模型试图生成一个极其常见、自身概率 $\pi_{s}$ 接近 1 的平庸 Token 时,$(1-\pi_{s})$ 会趋近于 0,从而死死压制住这部分的奖励。相反,当模型生成一个概率偏低但蕴含丰富领域信息(高 $\phi$ 值)的 Token 时,该权重会被激活,为模型提供高额奖励。
这种机制在本质上重塑了模型的探索动机:它不再鼓励模型去走最平坦、最确定的老路,而是激励模型去探索那些“有价值且不那么容易被预料到”的表达空间。
参考增强的 GRPO 优化
在确定了像素级(Token-level)的奖励函数后,团队采用了近期备受瞩目的群体相对策略优化(GRPO)算法来进行全量训练。
为了进一步稳定优势函数的估计(Advantage Estimation)并为模型的探索提供锚点,研究者在 GRPO 的采样群组中不仅包含了模型当前策略生成的多个回答 ${o_{1},\dots,o_{G}}$,还强制混入了一条来自微调数据集的真实高质量参考答案(Ground-truth reference,$o_{\text{gt}}$)。这种“参考增强”的方法能够有效拉高群组的平均奖励基线,如果模型生成的文本质量不如参考答案,就会产生负的优势值,从而迫使模型在探索多样性的同时,始终不偏离高质量的写作轨道。
严苛的实验检验:跨越模型与领域的全面跃升
为了验证 TCER 的真实战斗力,研究团队并非只在一个讨巧的基准上跑分,而是构建了跨越不同模型家族、不同参数规模以及不同任务领域的庞大实验矩阵。
开放式写作:稳健突破微调天花板
在写作任务评估中,研究人员选用了 DeepWriting 和 LongWriter 作为高质量微调数据,并在 Qwen2.5-7B-Instruct 等模型上进行了验证。他们使用了覆盖长文生成(LongBench-Write)、指令遵循(HelloBench)以及综合维度的专门测试集。
实验数据显示了非常清晰的递进关系:首先,对基础模型进行高质量 SFT 确实能带来显著提升(例如,Qwen2.5-7B 的 LongBench 得分从 74.7 大幅攀升至 83.1)。随后,如果使用传统的内生奖励(RL-EndoR)进行进一步训练,模型表现会有所改善,但在某些强调整体连贯性和创造力的指标上,提升极其微弱,甚至存在波动。这正是平庸偏置发作的迹象。
而当引入完整的 TCER 框架(RL-TCER)后,模型迎来了全方位的突破,在几乎所有测试指标上都拿下了最高分。这证明了通过压制高频废话、奖励有效信息增益的策略,切实打破了 SFT 之后模型在开放域生成的性能天花板。

模型架构的泛化性:不挑基座的通用外挂
一种优秀的对齐算法不应受限于特定的模型架构。为了验证这一点,团队将同样的 SFT 和 RL 管线无差别地应用到了 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 以及最新的 Qwen3-8B 等截然不同的开源基座上。
上图的实验结果展现出了令人瞩目的稳健性:无论是哪种模型架构,无论是使用 LongWriter 还是 DeepWriting 训练域,TCER 的性能柱状图(橙色)始终稳稳压制着 SFT(浅蓝色)和常规内生奖励(深蓝色)。这表明 TCER 提取相对信息增益的数学机制具有普适性,它触及了自回归语言模型生成动力学的底层逻辑。
跨界降维打击:在数学推理中的意外表现
这项研究最令人拍案叫绝的部分,是团队做的一个“回马枪”式实验。既然 TCER 是为了解决自然语言写作中的平庸偏置而设计的,那么把它放回到内生奖励的“老家”——高度逻辑化的数学推理任务中,会发生什么?
直觉上,数学推理不需要太多的“多样性”和“创造力”,引入平庸纠正可能会干扰模型寻找正确答案的路径。但真实的实验数据推翻了这一假设。在 Qwen2.5-7B 和 Llama3.1-8B 模型上,TCER 同样以显著的优势击败了基础的 EndoR 方案。
研究者分析认为,这是因为即使在严密的数学推理中,模型依然容易陷入一种“高概率的错误捷径”——即生成那些看似公式化但实际上逻辑断裂的步骤。TCER 通过惩罚那些平凡、高概率的中间步骤,实际上是在鼓励模型探索更加丰富、潜在正确的推理路径,从而在宏观上提高了最终答案的准确率。这一发现极大地拓展了 TCER 的应用边界,证明其是一种普适性的无监督 RL 增强范式。

微观显微镜:奖励信号是否真正对齐了高质量?
为了排除性能提升只是因为模型碰巧迎合了某些 Benchmark 评估偏好的可能性,团队进行了一项极其苛刻的归因分析。
他们生成了一批语料,并邀请了包括 GPT-4o、Claude-Opus 和 Gemini 2.5 Pro 在内的顶级闭源模型组成“联合评委团”,由这些地表最强模型在语料中标注出那些真正闪光、具有极高写作质量的句子。随后,研究者将基础 EndoR 和 TCER 的 Token 级奖励聚合到句子级别,画出了一条奖励轨迹。
如上图所示,在面对联合评委团选出的高质量句子(图中加粗红点标记)时,蓝色的常规内生奖励(EndoR)反应平平,完全无法将其与普通句子区分开来;而橙色的 TCER 奖励曲线则在这些高质量句子处出现了极为敏锐和显著的峰值。这一微观层面的证据无可辩驳地证明:TCER 设计的相对信息增益,确确实实地在参数层面捕获到了人类和高级 AI 所认同的“好文章”特质,并且把最重的筹码押在了这些特质上。
结语与对未来的启示
在大型语言模型的后训练时代,算力和数据资源的争夺已经白热化。特别是对于写作、创意生成等强主观性任务,收集高质量对齐数据或调用顶级外部 API 正在成为制约开源模型进化的成本黑洞。
阿里巴巴联合北大等机构提出的 TCER,犹如在这个黑洞前打亮了一束光。它巧妙地利用信息论工具,通过解构专家模型与基座模型之间的相对增益,并辅以精妙的概率纠正,成功将数学领域成熟的无监督强化学习方法跨界引入了开放式文本生成中。它证明了模型可以通过审视自身不同状态下的概率分布差异,自主实现高质量的对齐跃升。
不可否认,这种依赖内生信号的强化学习仍然存在理论上的天花板——它无法无中生有地创造模型在预训练或微调中从未见过的知识,且极其复杂的自然语言依赖关系使得 Token 级别的奖励分配仍然具有黑盒属性。然而,在现有技术条件下,TCER 无疑提供了一条极具性价比的突围路径。它启示我们:有时候,最敏锐的评判者往往隐藏在模型自己过去的阴影中;拉开与平庸过去的距离,就是通向卓越最可靠的方向。