华为HiFloat4:首个端到端FP4强化学习,将BF16差距缩至1.1%

HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

华为HiFloat4:首个端到端FP4强化学习,将BF16差距缩至1.1% 论文图示

在以推理模型(Reasoning Models)为代表的大模型竞赛中,强化学习(RL)后训练正迅速成为决定模型智能上限的核心技术。无论是数学推导、代码编写还是复杂 Agent 的任务规划,长思维链(Chain-of-Thought)都需要强化学习算法如 GRPO 进行多轮采样与策略迭代。然而,这套流程的算力代价高昂得令人咋舌:模型为了探索最优解,需要生成数以千计、动辄数千 Token 的长轨迹,采样的 Rollout 阶段与模型梯度的 Training 阶段反复交织,吞噬着庞大的显存与算力带宽。

ArXiv URL:https://arxiv.org/abs/2607.26515v1

工业界此前对强化学习后训练做低精度优化的尝试,多停留在 8-bit(FP8/INT8)水平,或者仅对推理采样阶段做 4-bit 量化,梯度与训练核心仍然使用高精度或 LoRA 保护。来自华为的研究团队打破了这一界限,公布了业内首个端到端 FP4 强化学习后训练框架。该研究不仅让推理采样(Rollout)跑在 4-bit,连同训练更新的反向传播、梯度计算也全部置于 4-bit 精度下,且无需依赖任何高精度 LoRA 分支。

尤为关键的是,研究揭示了低精度强化学习中一个反直觉的底层机制:导致模型性能崩溃的罪魁祸首并非训练阶段的噪声,而是采样阶段由异常值(Outliers)引发的激活值大面积下溢。在此诊断之上,团队提出了带有硬件感知稀疏特性的残差量化机制 Rollout-ResQ,并结合三级层次缩放的 HiFloat4(HiF4)格式,在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,将全链路 FP4 与全精度 BF16 的准确率差距从 4.9% 缩小至仅 1.1%,几乎抹平了 4-bit 极低精度带来的性能损失。

低精度 RL 的崩溃谜团:反直觉的失真来源

在标准预训练阶段,将浮点数压缩至 4-bit 已经步履维艰,但强化学习后训练的脆弱程度更甚。强化学习的核心在于策略探索与价值反馈的动态平衡。传统认知普遍认为,在极低精度下训练大模型,反向传播过程中梯度的剧烈扰动和数值截断会导致优化器不稳定、模型发散。因此,过往研究往往致力于“保住训练阶段的精度”,只敢对推理采样阶段下手。

华为团队进行了一组对照实验,试图彻底摸清端到端 FP4 RL 的性能损失到底来自哪里。他们以 Qwen2.5-3B 在 GSM8K 数据集上的 GRPO 训练为基准,对训练策略(Training Policy)与采样策略(Rollout Policy)的精度进行交叉组合测试。基准的全精度 BF16 模型在测试集上达到了 86.96% 的准确率,而全链路均采用 HiFloat4 格式时,准确率滑落到 82.03%;如果采用当前业界开源标准的微缩放格式 MXFP4,性能更是大幅滑落至 73.31%。

令人意外的现象出现在分离精度的实验中:如果保持采样阶段为全精度 BF16,只把训练阶段置于 FP4,模型的准确率几乎没有受到影响,HiF4 和 MXFP4 分别取得了 86.88% 和 86.20% 的准确率,与基准 BF16 旗鼓相当。反之,如果将训练阶段保持在 BF16 高精度,仅将采样阶段压缩至 FP4,模型准确率出现灾难性暴跌:HiF4 跌落至 78.01%,MXFP4 更是跳水至 50.57%,甚至显著差于全链路皆为 FP4 的基线。

这一发现彻底打破了“训练梯度不稳定是低精度主因”的直觉假设。实验证明,低精度强化学习的致命弱点在于采样端与训练端之间的策略失配(Rollout-Training Mismatch),而引发这种失配的根源是采样阶段的数值失真。进一步对采样阶段的权重与激活值进行解耦测试发现,若仅做权重 4-bit 量化(W4A16),性能依然较为坚挺;但只要引入激活值的 4-bit 量化(W16A4),性能便会遭遇断崖式下滑。

为什么静态量化技术在强化学习中失效?

在传统的模型部署和后训练量化(PTQ)领域,处理激活值异常值早已有诸如 SmoothQuant、QuaRot 或 SpinQuant 等成熟方案。这些方法通过通道缩放、随机哈达玛变换(RHT)或旋转矩阵将尖锐的激活值平滑化,使之适配低精度表示。然而,这类手段在强化学习后训练中全部碰壁。

问题的根源在于动态分布漂移。传统 PTQ 针对的是冻结的静态模型,可以使用固定的校准集进行离线统计,优化好缩放因子或变换矩阵后固化在网络中。但强化学习是一个马尔可夫决策过程(MDP),随着策略网络的持续更新,模型输出的生成轨迹在不断演进,激活值的统计特征处于高度动态变化之中。如果在第 $t$ 步校准的变换参数,到了第 $t+1$ 步就已经发生偏移;若为了追踪这种漂移而频繁在每轮 RL 迭代中重新校准,其带来的巨大计算与同步开销将直接抵消 4-bit 计算带来的吞吐优势。

深入到底层分布可以发现更深层的物理机制。当使用位宽极窄的 4-bit 表示激活值时,极少数大幅偏离均值的异常值拉宽了整个张量的动态范围。为了容纳这些极值,量化缩放因子被迫变大,导致其余绝大多数处于中间及微小取值范围内的正常激活值无法被量化网格捕捉,直接下溢(Underflow)截断成了 0。

激活值下溢与分布热图

从该热图分布可以看出,经过 4-bit 激活量化后,张量内部出现了大片被清零的区域,这种大面积信息丢失引发了表征塌缩。采样阶段生成的 Token 轨迹偏离了模型的真实能力,策略网络基于这些严重畸变的样本计算重要性采样权重与优势函数,反向传递给优化器,最终引发训练崩溃。

机制创新:Rollout-ResQ 与硬件感知稀疏

为了在不破坏端到端低精度计算吞吐的前提下解决激活值下溢,研究团队没有选择代价高昂的混合精度矩阵乘(如 FP16 激活乘以 FP4 权重),而是提出了一种轻量级的残差补偿机制——Rollout Residual Quantization(Rollout-ResQ)。

Rollout-ResQ 的核心逻辑非常纯粹:既然 primary 激活量化会因为异常值丢掉绝大部分微小数值,那就显式提取其量化残差。在采样阶段的每个 Transformer 线性投影层 $\ell$ 中,输入激活值 $X_\ell$ 与权重 $W_\ell$ 的计算被重新构造。系统首先计算激活张量的残差 $\Delta X_\ell = X_\ell - Q(X_\ell)$,随后将其投影输出表示为主量化路径与残差校正路径之和:

\[\hat{Y}_\ell = Q(X_\ell)Q(W_\ell)^\top + Q(\Delta X_\ell)Q(W_\ell)^\top\]

如果直接计算上述公式,意味着每个线性层都需要执行两次密集的 FP4 矩阵乘法(GEMM),这无疑会让采样阶段的计算量直接翻倍,得不偿失。团队的精妙之处在于接下来的发现:量化残差 $Q(\Delta X_\ell)$ 对稀疏化操作表现出了极强的鲁棒性。

与主干激活张量不同,残差张量的数值分布更为平坦,抹除了尖锐的异常值影响。研究人员测试了不同稀疏化方式对残差项和主干项引入的均方误差(MSE),确认残差项在经过高比例稀疏化后,重建误差依然极低。基于此,Rollout-ResQ 引入了硬件级半结构化稀疏函数 $S$,将最终的采样投影层重构为:

\[\hat{Y}_\ell = Q(X_\ell)Q(W_\ell)^\top + S(Q(\Delta X_\ell))Q(W_\ell)^\top\]

这里的 $S$ 专门采用了现代 GPU 硬件原生支持的 $S_{2:4}$ 稀疏格式(即每 4 个连续元素中保留 2 个非零值)。由于残差张量被削减了 50% 的非零元素,在具备稀疏张量加速能力的架构上,其计算开销仅相当于常规稠密 GEMM 的一半。

在数值格式的选择上,该研究明确了底层浮点架构对精度下限的决定性作用。目前 4-bit 领域存在两大阵营:一种是以 OCP 为代表的开源微缩放格式 MXFP4,它在 32 元素块上采用单个 E8M0 共享尺度配合 E2M1 数据;另一种是华为此前主导推进的 HiFloat4(HiF4)。HiF4 在 64 元素块上引入了三级层次缩放方案,其第一级缩放采用带尾数的 E6M2 格式,第二、三级采用 E1 格式,基础数据则采用等价于 E1M2 的 S1P2 表示。这种多层次嵌套的尾数保留设计,为 FP4 本就极其紧凑的 4-bit 空间提供了更精细的数值分辨率。两者在后文的实验中展现出了截然不同的精度韧性。

实验评测:数学长链推理极限施压

为了检验端到端 FP4 强化学习的真实成色,评测选择在对数值精度和长思维链极度敏感的数学推理任务上展开,训练框架基于整合了 vLLM 采样与 FSDP 训练的 VeRL 混合引擎。

第一组实验在 Qwen2.5-3B 模型与 GSM8K 任务上进行,基线涵盖全精度 BF16、朴素 4-bit、以及外挂 SmoothQuant、RHT(随机哈达玛变换)和 OCC(异常值截断补偿)的对照组。

在未经任何修补的朴素 4-bit 设置下,MXFP4 在 GSM8K 上的精度暴跌 13.65 个百分点,跌幅达 15% 以上;即使是表征能力更强的 HiF4,也产生了 4.93 个百分点的回落。引入 SmoothQuant 后,由于无法适应策略更新带来的动态漂移,模型表现进一步滑坡。而采用 Rollout-ResQ 配备 $S_{2:4}$ 稀疏配置后:

  1. 在 HiF4 格式下,Qwen2.5-3B 在 GSM8K 上的测试准确率直接回升至 85.90%,相比 BF16 理论上限的 86.96%,差距被一举收窄至 1.06%;在跨任务的 Math-500 测试中,差距同样大幅缩小至 8.6%。

  2. 在较为脆弱的 MXFP4 格式下,Rollout-ResQ-$S_{2:4}$ 亦将原本高达 13.65% 的差距剧烈压缩至 5.31%。

第二组实验则将难度大幅提升,直接采用更具挑战性的 Qwen2.5-Math-7B 骨干网络,在 DAPO-Math-17K 数据集上进行端到端强化学习后训练,并在 AIME-2024、AIME-2025、AMC-2023 以及 Math-500 等顶级数学竞赛基准上进行贪婪采样与多重采样评测(Mean@32)。

7B 模型的实验结果更加鲜明地证明了 HiF4 与 Rollout-ResQ 的协同威力。在高难度的 AIME-2024 评测中,朴素 HiF4 的准确率从 BF16 的 27.29% 骤降至 16.15%(跌落 11.14%);而引入 Rollout-ResQ-$S_{2:4}$ 之后,准确率回升到 20.73%,将差距缩小至 6.56%。在综合难度极高的 Math-500 上,全精度 BF16 的得分为 74.59%,朴素 HiF4 掉到 59.40%,而 Rollout-ResQ-$S_{2:4}$ 则直接拉升到 68.95%,全密度残差版本更是达到 69.02%,挽回了绝大部分失分。

在训练动态稳定性方面,从多轮迭代的平均奖励变化曲线可以清楚观察到:常见的静态量化基准在强化学习中后程往往表现出奖励震荡甚至崩盘的态势,唯独 Rollout-ResQ-$S_{2:4}$ 的奖励曲线平稳攀升,在更早的迭代轮数中就锁定了高奖励区间,展现出了与全精度训练高度一致的收敛行为。

计算复杂度与效率拆解

将残差补丁引入低精度计算,最关键的考量是它到底吃掉了多少原本属于 4-bit 的吞吐红利。本文给出了严格的算力开销推导:

对于输入激活 $X \in \mathbb{R}^{m \times d}$ 与权重矩阵 $W \in \mathbb{R}^{n \times d}$ 的常规线性层,稠密 FP16/BF16 GEMM 的 FLOPs 理论开销为 $2mdn$。在支持原生 4-bit 计算的架构上,FP4 GEMM 的吞吐优势通常是 FP16 的 4 倍,因此等效算力开销降为 $\frac{1}{2}mdn$。

如果采用稠密残差校正(Rollout-ResQ-Dense),由于需要执行两次 FP4 矩阵乘法,其总等效算力开销为 $\frac{1}{2}mdn + \frac{1}{2}mdn = mdn$。即便如此,相比于原生的 FP16/BF16 计算,它仍然保留了 2.0 倍的理论端到端加速比。

而当应用 $S_{2:4}$ 硬件半结构化稀疏时,由于残差矩阵中有半数元素被置零,稀疏残差乘以权重的 FLOPs 开销仅为 $mdn$。在硬件稀疏张量引擎支持下,该部分的等效算力开销进一步下降到 $\frac{1}{4}mdn$。由此计算,Rollout-ResQ-$S_{2:4}$ 的总等效算力开销被压制在:

\[\frac{1}{2}mdn + \frac{1}{4}mdn = \frac{3}{4}mdn\]

这一配置将相较于 FP16 的理论计算加速比从 2.0 倍提升到了接近 2.67 倍。在牺牲极微小算力预算的前提下,算法换取了原本在 4-bit 下几近崩溃的数学推理能力,达成了精度与算力成本之间极佳的权衡点。

对未来大模型后训练的深远影响

这项研究给大模型后训练的基础设施研发带来了数项极具分量的判断:

首先,它重塑了学术界与工业界对低精度强化学习瓶颈的认知。以往开发者耗费大量精力去设计复杂的低精度梯度裁剪、优化器状态保护或训练端平滑技巧,而华为的这篇工作指明了真正的发力方向——只要利用稀疏残差锁住采样端的激活值下溢,训练端哪怕直接上极低精度的反向传播,算法本身也具备惊人的鲁棒性。

其次,数据格式的底层结构设计构成了不可逾越的“物理天花板”。MXFP4 与 HiFloat4 在同样的残差修补框架下,最终依然拉开了明显的性能差距,这说明单纯依靠算法层面的 Trick 无法完全填补底层位宽设计的短板。HiF4 的三级微缩放机制在严苛的强化学习梯度与采样环境中证明了其架构优势,或将对下一代 AI 算力芯片的底层浮点格式标准制定提供重要参考。

受限于当前市场上主流芯片对原生端到端 FP4 硬件支持的缺位,作者在论文中亦坦承实验主要依赖硬件模拟环境进行验证,实际的端到端吞吐提升仍有待硬件全面铺开后落地实测。