大模型剪枝还是从头训练?50%压缩率下的LLM微缩路线指南

Small LLMs: Pruning vs. Training from Scratch

如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。

ArXiv URL:http://arxiv.org/abs/2606.14150v1

第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(Train from Scratch)。第二条路,则是利用网络剪枝技术(Pruning),直接拿现成的庞大模型“开刀”,剔除冗余参数,再进行轻量级的微调恢复。

剪枝技术的初衷非常诱人:它承诺提供一条捷径,能够继承父辈模型的强大知识库,从而绕过从头预训练的高昂成本。但这真的总是最佳路线吗?

卡内基梅隆大学、纽约大学和普林斯顿大学的最新联合研究《Small LLMs: Pruning vs. Training from Scratch》给出了一份详尽的答案。该研究对 Llama-3.1-8B 模型进行了深度解剖,在严格控制算力预算的条件下,揭开了模型微缩路线的残酷真相。

打破思维定势:将剪枝视为一种初始化策略

传统观念通常将剪枝视为一种纯粹的“压缩”手段。但在这项研究中,作者提出了一种全新的范式:将剪枝视为一种初始化策略Initialization Strategy)。

也就是说,剪枝后得到的残缺权重,仅仅是目标小模型训练的一个完美起点。基于这一视角,最合理的基准对比,不再是剪枝模型与原来的庞大父模型之间的较量,而是将其与具有完全相同参数量、并且在同等数据流上从随机初始化开始训练的模型进行对比。

为了彻底探究剪枝带来的优势到底只是“抢跑”带来的时间差,还是某种无法替代的“深层知识”,研究团队精心设计了两个严格对齐 token 消耗的对比实验环境。

实验体系中使用了三个核心代号: 首先是 S$N$,代表使用随机初始化,从头开始训练模型,共消耗 $N$0亿($N$B)个 token。 其次是 P$200$-R$N$,代表一条完整的剪枝流水线:先用 $200$B 个 token 对大模型进行预训练,然后按照目标比例进行剪枝,最后用 $N$B 个 token 对其进行重训练。

基于此,研究衍生出了两个核心对照组: 同等训练预算Equal Training Token Budget):比较 S$50$ 与 P$200$-R$50$,仅对比最后微调阶段的效率差异。 同等总预算Equal Total Token Budget):比较 S$250$ 与 P$200$-R$50$,考察如果把整个流水线耗费的总计 $250$B token 全都塞给从零训练的模型,它能否大力出奇迹。

为了保证结论的普适性,实验涵盖了六种代表性的剪枝算法,横跨了多个剪枝粒度Pruning Granularity)。在结构化剪枝Structured Pruning)阵营,包括了直接砍掉网络层的 Minitron-D、修剪通道宽度的 Minitron-W 等;在稀疏剪枝Sparse Pruning)阵营,则派出了 Wanda 和 SparseGPT 进行单个权重的精细掩码归零。

同等训练预算:继承遗产的绝对优势与边界

当预算受限,即只能使用 $50$B 的 token 进行训练时,剪枝初始化(P$200$-R$50$)毫无悬念地碾压了随机初始化的从头训练(S$50$)。

Refer to caption

在 $50\%$ 的经典剪枝率下,Minitron-D 让模型在 ARC Challenge 上的准确率比从零训练提升了 $4.5\%$,在 HellaSwag 上提升了 $6.1\%$。而更加细致的 Minitron-W 表现更为夸张,这两项指标的提升分别达到了惊人的 $8.2\%$ 和 $10.2\%$。

稀疏剪枝阵营同样遵循这一规律,且粒度越细,优势越大。Wanda 无结构稀疏将 WikiText-2 的困惑度相比从零训练大幅降低。在绝大多数基准测试中,携带大模型参数遗产的剪枝模型都展现出了降维打击般的起步优势。

然而,这种优势并不是无限的。随着剪枝率Pruning Ratio)的不断攀升,大模型的知识底座开始发生动摇。实验表明,当压缩率跨过 $81.3\%$ 这个极端阈值时,剪枝初始化甚至在某些任务上表现得比随机初始化还要糟糕。当剥离了过多参数后,残存的碎片知识不仅毫无帮助,反而成为了新模型收敛的绊脚石。

同等总预算:算力拉满时,从头训练的反超

如果算力不是瓶颈,我们把大模型预训练耗费的 $200$B token,连同微调的 $50$B token 全部交给 S$250$,让它在数据海洋中尽情遨游,局势会发生怎样的逆转?

这就是本研究最引人注目的发现:在充足的总算力面前,结构化剪枝惨遭反超,而稀疏剪枝依然坚挺。

Refer to caption

对于结构化的 Minitron-D 而言,S$250$ 在所有基准测试中完成了全面超越。不管是困惑度还是零样本下游任务的准确率,从头训练的模型都比剪枝模型高出了 $0.6\%$ 到 $4.0\%$。即使是表现更好的 Minitron-W,其领先优势也被极大压缩。这意味着,粗粒度结构化剪枝所传递的知识,只要给足数据,从头训练完全可以通过勤能补拙来弥补。

但是,当你把目光转向稀疏剪枝时,情况却大相径庭。对于最细粒度的无结构 Wanda 而言,尽管 S$250$ 吸收了多达五倍的数据,但它依然在 $8$ 个准确率指标中的 $6$ 个上败下阵来。此时,额外的数据喂养已经无法跨越两者之间的鸿沟。

深度机制解析:拆除承重墙,还是抽走零散砖块?

为什么同样的压缩率,结构化剪枝会被数据量反超,而稀疏剪枝却能保持无法逾越的优势?理解这一现象的关键,在于不同剪枝粒度对模型底层知识表征的破坏机制截然不同。

我们可以将大模型内部那庞大而深邃的参数网络,看作是一栋结构极其精妙、历经无数锤炼才建成的摩天大楼。

结构化剪枝Structured Pruning)的操作,相当于粗暴地直接拆除大楼的整层楼板,或者强行推平好几个主要的房间。这属于极其粗糙的粗粒度操作。经过这种大刀阔斧的破坏,整栋建筑的受力结构已经发生了根本性的变形与失衡。此时,如果你给一支优秀的施工队提供无限的时间和建材(等同于拉满的总 token 预算),让他们在旁边的空地上重新从零开始建造一栋比例协调的小型别墅,其最终的稳固程度和实用性,必然会超过那栋被暴力截断、随后只能强行缝补的残缺大楼。这也正是为什么只要算力足够,从零训练最终能打败结构化剪枝的原因。

相反,稀疏剪枝Sparse Pruning)的策略则更为高明。它就像是由高精度的工程机器人主导,小心翼翼地抽走整栋大楼各个角落里非关键承重墙内的单块砖头。这属于极其微观的细粒度操作。虽然大楼整体变轻了一半,但它最核心的建筑蓝图、错综复杂的隐式管道以及精妙的受力网络被近乎完美地保留了下来。这种历经千亿级数据冲刷才沉淀成型的“隐式知识蓝图”,是难以从零开始重新构建的。即使给施工队再多的时间和数据,他们也很难凭空复刻出这种历经沧桑却精妙无比的底层结构。因此,带有精细历史记忆的稀疏剪枝,依然能对从零训练保持绝对的碾压态势。

残酷的现实:性能与效率的硬件博弈

虽然细粒度的稀疏剪枝在理论性能上大放异彩,但在真实的工程落地中,开发者却不得不面对硬件架构带来的现实折叠。

研究表明,在缺乏专用稀疏张量核心的常规硬件(例如 Google TPU v4-256)上,无论是 $50\%$ 无结构稀疏还是 $2:4$ 稀疏模型,其训练和推理速度与原始密集模型几乎没有任何区别。只有在配备了专门针对稀疏矩阵优化的现代 GPU(如支持 cuSPARSELt 加速的 NVIDIA H100)上,$2:4$ 稀疏才能带来有意义的推理加速,而完全无结构的稀疏依然面临落地难的窘境。

相比之下,虽然结构化剪枝在同等压缩率下困惑度表现稍逊,但它生成的却是一个实打实的更小的密集模型,能够在任何常规硬件上实现显著的训练和推理双重加速。这揭示了一个两难的困境:性能最好的剪枝方法对硬件极为挑剔,而最容易硬件落地的剪枝方法,在充足算力面前又打不过从零训练。

终极部署建议

综合这些详实的实验数据,该论文为当今的 AI 开发者和企业提供了一份极具操作性的微缩模型实操指南:

第一,如果你手头拥有一个强大的开源大模型,但你的训练数据和算力预算非常有限,那么毫无疑问,选择剪枝并进行微调,将远胜于从头开始训练。这是性价比极高的“拿来主义”。

第二,如果你的算力和数据储备极度充沛,且目标是部署到缺乏专属稀疏加速支持的通用计算设备上,那么盲目迷信大模型剪枝反而是一种羁绊。此时,抛开复杂的粗粒度结构化剪枝管线,直接从零开始训练一个小巧的密集模型,不仅同样具有顶尖的竞争力,甚至有可能得到更稳定的性能预期。大模型的“光环”,在绝对的数据暴力面前,并非总是不可替代的。