斯坦福揭示数据过滤的苦涩教训:当算力充沛时,无过滤才是最优解

A Bitter Lesson for Data Filtering

长期以来,大语言模型预训练的数据清洗被视作不可逾越的金科玉律。

ArXiv URL:http://arxiv.org/abs/2605.19407v1

业界普遍认为,必须将海量网页数据精心过滤,剔除低质量内容,才能喂给模型。

然而,斯坦福大学的一项最新研究,向这一常识投下了重磅炸弹。

本文指出:当算力足够庞大且模型参数足够多时,最好的数据过滤器,就是完全不过滤No Filter)。

这正是理查德·萨顿在《苦涩的教训》中所预言的历史重演:

人类精心设计的手工规则(此处为数据过滤算法),最终都会被单纯的算力扩展所击败。

该研究不仅挑战了现有的数据配比策略,更为未来大模型的演进指明了残酷却高效的路径。

传统认知的颠覆

在算力受限的时代,数据过滤确实至关重要。

通用爬虫Common Crawl, CC)为例,不同筛选策略对模型性能的影响天差地别。

目前主流的 DCLM-Baseline 数据集,甚至只保留了原始 CC 数据约 $1\%$ 的内容。

这就产生了一个巨大的矛盾:

语言模型的发展趋势需要指数级增长的数据量,而严格的过滤却在大幅削减数据库存。

即便保留下的 3.8 万亿 Token 已经极为庞大,但距离极致的扩展法则需求仍有差距。

因此,本文提出一个极端且大胆的假设:

在极致算力下,数据过滤是否真的是必需的?直接使用未经过滤的“脏”数据会怎样?

探究无过滤预训练

为了验证这一假设,本文并未直接在几百万亿 Token 上盲目实验。

研究团队巧妙地将原始 CC 数据及其各种过滤版本,按同等比例缩小。

他们构建了从 6.7 亿到 100 亿 Token 不等的随机子集。

随后,在这些子集上不断增加预训练的计算资源。

增加算力的手段主要有两种:扩大模型参数规模,以及增加训练步数(Epoch)。

核心评估指标是模型在各项基准测试上的表现,包括困惑度以及下游任务。

实验结果令人震惊:

在不考虑计算成本的前提下,只要模型规模足够大且训练时间足够长。

使用完全未过滤的数据池,最终总是能超越那些经过精心过滤的数据集。

即使是使用最宽松的启发式过滤器,在极致算力下也会败给最原始的全部数据。

应对垃圾数据的鲁棒性

如果完全不过滤,意味着模型会吸入大量的冗余信息甚至是纯粹的“垃圾”。

大型 Transformer 真的能承受这些吗?本文通过“数据注入”实验进行了极限施压。

研究人员故意向干净的数据池中,注入了毫无意义的低质量数据。

第一种是完全随机生成的字符串,旨在消除任何有用的信号。

第二种是词序完全打乱的文档,虽然破坏了语义,但保留了词频分布特征。

Refer to caption

实验表明,在低算力预算下,这些垃圾数据确实会严重拖累模型性能。

但奇迹发生在大算力阶段:经过充分训练的大模型,不仅完全弥合了性能差距。

甚至在加入词序打乱的文档后,模型的表现还能获得额外的微弱提升。

这里我们可以用一个机制来理解:

将大模型想象成一个巨大的工业级矿石提炼系统。

小模型就像是简陋的作坊,如果混入大量废渣(垃圾数据),系统就会瘫痪。

而拥有千亿参数的大模型,其内部有海量的“提炼通道”(网络容量)。

它有足够的冗余能力,将无用废渣自动分离并旁路处理。

同时,它还能从被打乱的文本中,榨取到残存的词频(Unigram)统计信号,将其化作养分。

算力扩张规律

既然无过滤策略在未来必将胜出,那么这个“未来”究竟有多远?

本文构建了严谨的计算缩放定律(Scaling Laws),来预测交叉点的到来。

\[N^{\star}(M,m):=\min\left\{N\colon\ell(\mathcal{A}(D_{cc,m},M,N))<\min_{N^{\prime}}\ell(\mathcal{A}(f(D_{cc,m}),M,N^{\prime}))\right\}\]

上述公式定义了无过滤策略超越过滤策略所需的临界训练步数 $N^{\star}$。

研究发现,随着数据池大小 $m$ 的增加,所需的算力呈现高度线性的增长趋势。

Refer to caption

通过将模型拟合到 $R^{2}$ 超过 $0.99$ 的线性回归上,本文得出了一个惊人的推论:

对于包含 240 万亿 Token 的完整 Common Crawl 数据池。

无过滤策略将在算力达到 $10^{30}$ FLOPs 时,正式成为最优解。

这是什么概念?当前最前沿的模型预训练算力大约在 $5 \times 10^{26}$ FLOPs 级别。

虽然 $10^{30}$ 看起来遥不可及,但根据现有的算力发展预测。

到 2030 年,人类极有可能开展这种级别的模型训练。

这意味着,“不筛选数据”的时代,距离我们只剩不到十年的时间。

理论层面的解释

为什么大模型能够如此强悍地吸收噪声而不受干扰?

本文通过一个基于矩阵分解的理论模型,给出了事后解释。

假设模型需要从输入 $x$ 中预测输出 $y$(即 Token 预测)。

数据对来源于 $k$ 个不同的任务,且任务之间具有正交的输入特征。

如果模型的秩为 $r$(代表模型容量),理论证明如下:

\[\min_{\begin{subarray}{c}U\in\mathbb{R}^{m\times r}\\ V\in\mathbb{R}^{d\times r}\end{subarray}}\operatorname*{\mathbb{E}}\!\big[\|Y-UV^{\top}X\|^{2}\big]=\sum_{j=r+1}^{\rho}\sigma_{j}^{2}+\operatorname*{\mathbb{E}}\!\big[\|\xi\|^{2}\big]\]

这个公式清晰地揭示了模型容量与任务干扰之间的关系。

当模型容量不足($r < k$)时,不同任务会在输出空间发生严重的互相干扰。

这就是为什么小模型在遇到低质量数据时,性能会断崖式下跌,此时必须依赖数据过滤。

然而,当模型容量足够庞大($r \ge k$),秩空间足以覆盖所有任务分布时。

无论数据池里混入了多少正交的噪声任务,它们都能被模型完美隔离吸收。

基于梯度的优化方法,天然能够找到最优的参数矩阵组合,使得干扰项归零。

简单来说:只要脑容量够大,记住废话并不会占用你记住真理的空间。

局限性与工程启示

尽管“算力决定一切”的结论令人振奋,但本文也指出了潜在的隐患。

最大的挑战在于事实性Factuality)错误。

大模型对协变量偏移(如语言风格、排版混乱)具有极强的抵抗力。

但如果低质量数据中包含了大量条件分布的偏移,即“事实性错误”。

例如网页中反复出现“法国的首都是哥本哈根”。

模型如果具备了超强的记忆力,反而会将这种错误的事实内化到权重中。

这就是无过滤策略当前无法彻底解决的盲区。

在工程实践上,这项研究给了我们极具颠覆性的启示:

第一,不要在清洗数据的算法上过度内卷。

与其花费天价算力和人力去设计精妙的质量分类器。

不如将这部分资源直接投入到扩大模型参数和增加训练步数上。

第二,重新审视“高质量”的定义。

人类眼中的低质量文本(如语法残缺的网页),在算法眼里可能仍具备统计学价值。

第三,在算力相对匮乏的当下,数据过滤依然是小模型厂商的生存法则。

但对于立志于打造下一代万亿参数基座模型的头部大厂而言。

尽早开始囤积所有能获取到的原始数据,也许才是迎接 $10^{30}$ FLOPs 时代的最佳筹码。