PaLM 2技术深度拆解:摒弃参数暴政,1:1缩放与混合目标重构大模型基座

PaLM 2 Technical Report

大语言模型的发展似乎正陷入一种算力焦虑:要想模型更聪明,就必须无限度地扩大参数规模。然而,巨型模型带来的高昂训练成本与极慢的推理延迟,正成为阻碍技术落地的巨大鸿沟。

ArXiv URL:http://arxiv.org/abs/2305.10403v3

本文探讨的这篇重磅技术报告,彻底打破了这一“唯参数论”的路径依赖。该研究推出了一代全新基座,其最大版本的参数量显著小于前代,却在多语言理解、复杂逻辑推理和代码生成上实现了断崖式的领先。这背后的核心密钥,在于严苛的计算最优配比、丰富的数据混合策略以及底层架构目标的全面重构。

重估大模型缩放法则

在探索模型规模的边界时,学术界曾存在争议。早期的 Kaplan 缩放法则认为,模型参数量($N$)的增长速度应当快于训练数据量($D$)。但这一规律导致了大量早期模型在有限数据下处于“训练不足”的状态。

为了寻找计算最优Compute-Optimal)的真实边界,该研究针对超大参数规模进行了独立推导。研究团队在 $1 \times 10^{19}$ 到 $1 \times 10^{22}$ FLOPs 的四个不同算力预算梯度下,进行了大量严谨的模型训练实验。

最终的实证数据强有力地支持了 Hoffmann 等人提出的假说:在给定算力预算下,模型参数量 $N$ 与训练数据量 $D$ 应当保持大致 $1:1$ 的比例同步增长。这意味着,将宝贵的算力投资于“用成倍的高质量 Token 去喂养一个体积适中的模型”,远比单纯扩充模型参数更能拉升下游任务的极限性能。

架构演进与混合训练目标

除了严格遵循缩放法则,模型如何“消化”海量数据同样是决定性能的关键。过去的主流大模型几乎清一色地采用单一的因果语言建模Causal Language Modeling),即始终在做“预测下一个词”的任务。

该研究在基于 Transformer 的架构中,大胆引入了受 UL2 启发的混合目标训练机制。

这里我们可以做一个克制的技术类比。如果把训练模型比作培养一名田径运动员,过去的单一预测任务就像是只让他练习匀速长跑。虽然能练出体能,但应对复杂赛道时难免吃力。而本文引入的混合目标,就像是让运动员进行十项全能训练:不仅要练习长跑(因果预测),还要练习跨栏(文本掩码填空)、折返跑(段落乱序重组)。这种多维度的刺激,迫使模型学习到语言中更深层次的逻辑表征与上下文依赖,而不仅仅是表面的词频统计。

突破语言壁垒:跨越C2级精通门槛

在数据层面,前代大模型的预训练语料往往被英语主导(例如占比高达 78%)。该研究大幅度调整了数据配方,引入了数百种人类语言、编程语言以及海量平行多语言文档。

为了严苛验证这一改变的成效,研究团队使用专为人类设计的专业语言水平考试进行了零样本评估。测试标准对标欧洲共同语言参考标准(CEFR)的最高精通级别(C2级别)。

如上图实验结果所示,该模型在所有受评估的语种中均取得了及格以上的优异成绩。其中最令人震撼的是其日语能力的飞跃:相较于前代模型仅仅获得 F 级的惨淡表现,新模型直接跃升至特 A 级(Level A / Special A),在法语上也达到了 C1 级别。这种程度的精通,已经足以满足高阶专业交流甚至教学需求。

同时,在跨文化理解上,模型展现出了远超字面翻译的本土化能力。例如,当被要求解释波斯谚语“没有痛苦就没有收获”时,模型不仅能用波斯语精准释义,还能在未给出示例的情况下,直接输出对应的中文成语或谚语,体现了极强的跨语言语义映射能力。

逻辑推理与极低延迟的代码演进

复杂推理与代码生成是大模型核心能力的试金石。在 WinoGrande、StrategyQA 以及 BIG-Bench Hard 等一系列极具挑战的推理基准测试中,新模型的表现全面碾压了前代系统。特别是在考察复杂数学逻辑的 MATH 测试集上,其表现直接逼近了专门针对数学任务优化的 Minerva 模型;而在 GSM8K 测试中,更是超越了诸多顶尖竞品。

考虑到开发者工作流对低延迟、高吞吐量的极致要求,研究团队通过在富含多语言代码的混合语料上继续训练基础小模型,专门打造了一个轻量级的代码变体(PaLM 2-S*)。

令人瞩目的是,这个体积更小的代码专属模型不仅在 Python、Java 等主流语言上表现卓越,甚至在 Julia 和 Haskell 等极度低资源的偏门语言上,也实现了相较于前代巨型代码模型 4.7 倍至 6.3 倍的性能暴增。这再次印证了高质量垂类数据与充足训练步数带来的巨大红利。

推理期毒性控制与记忆阻断

随着生成能力的跃升,如何低成本且高效地控制模型输出的安全性,成为业界亟待解决的难题。常规的强化学习微调成本高昂,且可能损害基座的泛化性。

该研究在预训练阶段创新性地引入了极低比例的控制令牌Control Tokens)。在处理包含不同毒性等级的语料时,为其打上对应的特殊标记。在实际部署的推理阶段,开发者只需向模型输入对应的安全控制令牌,就能在不增加额外算力开销、不干扰其他自然语言能力的前提下,精准压制有害内容的生成。

此外,为了防范长文本记忆导致的隐私泄露风险,研究团队在预训练数据中隐蔽注入了“金丝雀”序列。大规模探测结果显示,得益于严密的数据去重(Deduplication)机制,新模型的逐字记忆率得到了有效遏制,仅在小语种尾部数据出现高频重复时才会暴露风险,这为下游数据的清洗提供了极具指导意义的参考。

局限性分析与核心工程启示

尽管在多项基准上大放异彩,该报告也客观指出了生成式模型的固有限制。例如,在涵盖社会身份的生成式问答中,虽然模型准确率高达 91.4%,但仍有 3% 的回答可能会因幻觉(Hallucinations)而意外放大社会偏见。这表明,仅仅依靠客观分类指标,无法完全捕捉开放域生成中的表征伤害。

这篇报告为整个AI工程界留下了至关重要的启示:在论文中展示的预训练基座性能,绝不等于面向终端用户的产品体验。

对于下游开发者而言,更小、更高质量的模型架构不仅大幅降低了服务成本(Serving Cost),还显著缩短了响应延迟,带来了更自然的交互节奏。但这同时也意味着,将这些底层基座转化为成熟的商业系统,必须配套构建强大的前处理(Pre-processing)提示工程与后处理(Post-processing)安全过滤。只有在特定应用场景下进行深度的偏见评估与对齐护栏建设,才能真正将强大的算力潜能转化为可靠的技术产品。