ScaleQ-1.58:校准Token缩减百万倍,三值化推理大模型为何必须“注视自身思维”?

Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在大语言模型走向极限端侧部署与低成本推理的探索中,1.58-bit(即三值化,参数仅取 ${-1, 0, 1}$)被广泛视为模型压缩的终极形态之一。在这一精度下,庞大昂贵的浮点乘法运算几乎被硬件友好的整数加减法彻底取代,不仅能让显存占用呈现断崖式下降,更能将推理吞吐提升数倍。然而,三值化技术在真正落地时始终横亘着一座大山:严重的性能坍塌。

ArXiv URL:https://arxiv.org/abs/2608.01078

为了保住复杂推理能力,此前的标杆工作(如微软的 BitNet b1.58 系列)几乎全部倒向了量化感知训练(QAT, Quantization-Aware Training)。例如专为推理打造的 BitNet b1.58 2B4T,不得不依赖从零开始、动用整整 4 万亿(4T)Token 的庞大语料重新训练,其算力门槛与工程开销让绝大多数团队望而却步。相比之下,开销极低、免微调的训练后量化(PTQ, Post-Training Quantization)在常规 4-bit 或 8-bit 下表现良好,但只要精度触碰 1.58-bit 的极低比特深水区,面对数学与代码这类长链条推理任务,模型性能就会瞬间归零。

针对这一困境,研究人员提出了全新的三值化 PTQ 框架 ScaleQ-1.58。该框架的核心洞察非常尖锐:在极低比特的重构过程中,传统 PTQ 沿用通用网页文本进行校准的做法从根本上忽略了思维链(Chain-of-Thought, CoT)的本质。通过提出“注视自身思维”(Attend to Your Own Thoughts, AYOT)校准机制,ScaleQ-1.58 仅需 400 万(4M)Token 的校准数据——消耗的 Token 量比 BitNet b1.58 2B4T 减少了整整 1,000,000 倍,便在数学与代码基准上实现了显著的反超,并成功将三值化 PTQ 扩展至 235B 参数规模的 MoE 模型。

1.58-Bit 的致命陷阱:为何微分三值化在推理任务中全线崩溃?

从优化理论来看,三值量化之所以极度困难,在于其符号函数带来的硬截断和不可微性。传统做法通常沿用卷积网络时代提出的三值权重网络(TWN),依靠统计均值设定阈值 $\Delta$ 和缩放因子 $\alpha$,再借助直通估计器(STE)进行梯度回传。但对于参数敏感的复杂大模型,STE 的粗糙梯度近似极易导致优化停滞。

为了化解优化层面的不可微难题,学术界最近推出了基于平滑松弛的学习型量化方案 CAT-Q。CAT-Q 设计了一组平滑的自适应三值化函数:

\[T_{i}=f(\hat{W}_{i};s,t,\Delta)=\frac{\tanh(ts(\hat{W}_{i}-\Delta))+\tanh(ts(\hat{W}_{i}+\Delta))}{2\tanh(ts)}\]

通过在校准步长 $t \in [0, 1]$ 推进的过程中逐步调节锐度因子 $s$ 与阈值 $\Delta$,模型能够从最初的恒等映射平滑过渡到离散的三值状态,并通过反向传播直接学习各通道的分组缩放因子与阈值。

按常理推断,这种具备连续可微优化能力的先进 PTQ 方案,应当能保留足够的模型表现。然而,当研究人员将 CAT-Q 直接应用于 Qwen3-4B 这类高阶推理模型并测试数学(Math-500、GSM8K)与代码(HumanEval+、MBPP+)任务时,灾难性的结果出现了:即便是参数量比 BitNet 2B4T 大出一倍的 4B 模型,在完成可微三值化后,推理得分依然呈雪崩式下跌,远逊于从头训练的三值基线。

深入排查后,问题直指业界沿用多年的 PTQ 惯例——校准集的构造方式。

在传统的 8-bit 或 4-bit 量化流水线中,业界习惯性地从 C4 或 WikiText2 等通用网页语料库中随机截取 128 或 256 条文本片段来校准激活值分布与重构误差。这种做法基于一个隐式前提:中高比特格式具有充足的表达容量,量化过程对输入分布的漂移具备足够的容忍度。

但在 1.58-bit 的极限离散空间下,这个前提被彻底粉碎了。通用网页文本充其量只编码了局部的词法共现概率与基础常识,完全缺乏严格的由因导果、分步推进的严密符号逻辑。当模型在通篇闲聊式的语料上做逐层输出特征重构时,极低比特的网络权重被强行拟合到了与复杂推理毫不相关的特征空间。一旦面对需要数十步逻辑推演的数学证明或算法代码,量化后的网络权重根本无法重建高精度模型原有的长程注意力链路,最终导致逻辑推理能力彻底断裂。

AYOT 机制:让模型在校准中“复盘自己的思考”

既然传统校准语料无法表达推理动态,那是否直接使用数学题目的题干与标准答案进行校准即可?实验表明,若仅将题目输入模型,或者粗暴地把题目与标准答案拼接,量化效果依然不尽如人意。核心阻碍在于:对于复杂问题,从题干到最终答案之间存在巨大的信息断层,如果缺乏显式的推导过程,模型各层所捕捉的激活模式依旧是离散且割裂的。

为此,本文提出了 AYOT(Attend to Your Own Thoughts) 机制。其核心逻辑不是外求更多的数据,而是将高精度浮点模型自身的思考轨迹,作为三值化过程的自洽锚点

AYOT与传统校准方案的对比

如上图所示,在传统的推理无关校准流程中(左侧),校准数据要么是通用的非结构化文本,要么是缺乏推演过程的简单问答对,模型的中间表征在三值化压缩过程中被强行扭曲。而在 AYOT 架构下(右侧),整个流程形成了高度自洽的逻辑闭环:

  1. 采样本领域真实问题:从高难度数学推理(如 MetaMathQA)和代码指令(如 OpenCodeInstruct)中提取具代表性的输入 Prompt $Q$。

  2. 提取高精度模型的自生思维链:在量化开始之前,直接让未量化的高精度目标模型对这些问题进行充分推理,完整保留其自主生成的长思维链逻辑轨迹(Reasoning Traces, 记作 $T$)以及最终生成的结论 $A’$。

  3. 结构化拼接全上下文校准:将 $[Q, T, A’]$ 完整拼接为统一的 Context 输入序列,以此作为三值化重构期间的前向激活流。

这一设计的精妙之处在于“自洽性”。在逐层进行三值化重构时,优化目标不仅要让第 $l$ 层的三值化输出尽可能逼近全精度浮点输出,更要让这种拟合发生在该模型最熟悉、最擅长的“推导语法”之中。浮点模型在生成思维链时,其内部的多头注意力机制会激发出极其特殊的稀疏高幅值激活(Outlier Activations),这些激活正是模型串联长上下文因果推断的命脉。让模型“注视自己的思维”,实质上是强制极低精度的三值权重在最关键的逻辑传导通路上保持保真度,从而以极具针对性的方式锁死了推理能力在极端压缩下的外溢损耗。

软三值化与动态滑动窗口重构

以 AYOT 为灵魂,结合改进的可微优化,ScaleQ-1.58 构建了完整的端到端训练后量化链路。

在底层数学形式上,ScaleQ-1.58 并没有简单使用固定的全局截断阈值,而是引入了可学习的均值平移变量 $\mu$ 与尺度缩放因子 $\alpha$,对预训练高精度权重执行仿射变换 $\hat{\textbf{W}}=(\textbf{W}-\mu)/\alpha$。值得注意的是,平移变量 $\mu$ 仅在校准优化期间参与权重的重分布计算,在最终固化为硬件友好的三值表征时被彻底移除,从而严格保证了推理阶段完全符合标准 TWN 架构,不引入任何额外的推理硬件负荷。

与此同时,ScaleQ-1.58 摒弃了容易导致误差级联累积的经典逐层贪心重构(Layer-wise Reconstruction),而是采用了基于滑动窗口的跨层输出联合优化(Cross-layer Reconstruction)。在包含 $T$ 轨迹的 AYOT 上下文流动下,滑动窗口允许后序层对前序层因极端三值化带来的信息残差进行自适应动态补偿,使得全局累积截断误差呈现出受控的渐进收敛特性。

整个流程无需对模型进行任何全参数微调,也完全脱离了庞大预训练集群的束缚。在工程实测中,仅需单台配置 8 张 A100-80GB 的常见通用服务器,运行 4 到 240 小时(视模型从 1.7B 至 235B 的参数体量而定),即可一键输出高精度的 1.58-bit 推理模型。

实验评测:不仅击败从头训练,更揭示低比特扩展律

评测体系涵盖了目前最具挑战性的推理与通用基准:数学领域选取了 Math-500、GSM8K 以及极高难度的竞赛级评测 Omni-MATH;代码领域覆盖 HumanEval+ 与 MBPP+;逻辑推理采用 ProofWriter;同时辅以 PIQA、ARC、HellaSwag 等通用常识基准和 WikiText2 困惑度评测。

在对比基线中,最核心的参照标杆正是微软此前耗费千万级算力训练的 BitNet b1.58 2B4T

1. 效率与性能的双重反超

实验呈现出的核心结论具有强烈的反差感:

这意味着,过去大家普遍认同的“1.58-bit 必须依赖万亿级 Token 预训练(QAT)重塑参数空间”的固有观念被正面击碎。在合理的思维链校准牵引下,浮点模型原生的高维知识结构完全可以通过 PTQ 的方式低成本“映射”并保存在三值离散空间内,所消耗的训练数据直接实现了百万倍($1,000,000\times$)的缩减。

2. 参数规模与架构的普适性验证

以往的 1.58-bit 研究大多局限于 10B 以下的 Dense 架构,鲜有团队触碰结构更复杂、门控路由更敏感的混合专家(MoE)网络。而在 ScaleQ-1.58 的评估中,技术团队直接将验证边界推向了工业级前沿:

实验揭示出一条极为关键的低比特量化扩展律(Scaling Behavior):模型参数体量越大,三值化 PTQ 的抵抗力越强,性能衰减曲线越平缓。相比之下,小模型在极低精度下更容易触及容量瓶颈。同时,在同等参数量下,MoE 架构因专家路由的稀疏性,对三值量化的扰动敏感度明显高于 Dense 架构。但即便在高达 235B 参数的巨型 MoE 模型上,ScaleQ-1.58 依然保持了极佳的数值稳定性与推理留存率,这充分证明了该机制并不绑定于特定架构,具备跨模型家族的通用价值。

3. 校准规模的对数增长红利

在传统的量化认知中,PTQ 的校准样本量往往在数百条后迅速遭遇边际效应,继续增加数据对降低精度损失毫无助益。但 ScaleQ-1.58 在 Qwen3-4B 上的消融实验展现出了反常识的一幕:

当校准 Token 从 256K 逐步提升至 1M、4M、直至 16M 时,量化后模型在数学和编程任务上的准确率呈现出近乎单调上升的平滑扩展趋势。这一现象直接证实:在极低比特场景下,AYOT 本质上提供了一种“隐式逻辑微调”的能量,校准 Token 不再仅仅是统计算子方差的标尺,而是在三值离散约束下重新拉齐多步推理注意力的强化信号。

此外,消融研究还表明,AYOT 并不仅局限于三值化(W1.58A16),将其拓展至 2-bit(W2A16)乃至 4-bit(W4A16)等其他超低比特量化场景中时,相比传统非 CoT 校准,同样能带来非常稳定的增益,展现出了极强的泛化潜质。

极端量化时代的范式转移

回顾大模型量化技术的发展史,整个学术与工业界的重心长期偏向于“如何在不损害通用语言理解的前提下压缩体积”。当行业技术焦点全面转向依靠长思维链驱动的深层推理模型时,传统的量化评价体系与优化手段已经明显脱节。

ScaleQ-1.58 的价值不仅在于给出了一个能高效运转的开源实现,更在于打破了领域内长期存在的思维定势:

其一,极低精度的 1.58-bit 并不仅是从零预训练的专利,高精度模型的推理能力完全可以在后训练阶段被低成本萃取与固化;

其二,校准集从来不是“填满激活空间”的随机数字工具,模型在特定高阶任务上的认知能力,高度依赖其自发推演轨迹的保真度。

当单台 8 卡服务器即可在数天内完成百亿乃至千亿级推理模型的 1.58-bit 转化,原本横亘在学术界前沿与大规模工业落地之间的算力沟壑正在被迅速填平。让量化过程“注视模型自身的思维”,或许正是大模型在走向极低比特硬件落地时,最自然也最关键的一把钥匙。