拒绝“特权幻觉”!DOPD双重蒸馏让大模型能力狂飙14分
为什么给大模型“开小灶”,它反而越学越傻?在如今的大模型后训练阶段,用一个强大的“老师”模型来指导一个较弱的“学生”模型,已经成为提升性能的标准操作。为了让老师教得更好,研究人员往往会给老师提供一些特权信息(PrivilegedInformation),比如数学题的解题提示,或者视觉任务中的目...
为什么给大模型“开小灶”,它反而越学越傻?在如今的大模型后训练阶段,用一个强大的“老师”模型来指导一个较弱的“学生”模型,已经成为提升性能的标准操作。为了让老师教得更好,研究人员往往会给老师提供一些特权信息(PrivilegedInformation),比如数学题的解题提示,或者视觉任务中的目...
大型语言模型(LLM)的原始形态,本质上是一个极其庞大的“文字接龙”机器。它们通过海量语料学会了预测下一个词,却并不知道如何满足用户的真实业务需求。当用户输入“帮我写一封辞职信”时,原始模型可能会补充“,你需要注意以下几点”。它在机械地续写句子,而不是在执行人类的命令。
大语言模型的世界一直被逐字生成的自回归机制统治。虽然扩散模型承诺了令人兴奋的并行生成前景,但它们在文本质量上始终无法与自回归模型抗衡。为什么扩散模型在图像领域大杀四方,在文本生成领域却总是“差一口气”?
大语言模型正经历从静态模仿向主动交互的深刻变革。这标志着智能体(AgenticIntelligence)时代的全面开启。在此范式下,模型必须学会在复杂多变的环境中自主感知、规划、推理并采取行动。然而,打造极致的智能体能力,意味着要在预训练与后训练阶段跨越两座大山。
当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。真正拖后腿的,是高度同质化且存在缺陷的训练数据。
当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。
大模型如何在缺乏人类优质标注的情况下实现持续的自我进化?这是当前大语言模型在后训练阶段面临的核心技术瓶颈。当前的工业级实践方案,往往高度依赖海量的优质专家标注数据。或者需要构建极其复杂的外部奖励模型来提供强化学习信号。这种范式虽然在受控环境下行之有效,但其高昂的成本不可忽视。
在评估图像编辑的优劣时,人类往往只需看几个参考示例,就能敏锐地察觉出编辑是否符合要求、有无违和感。然而,当前主流的视觉模型若想具备同样的判别能力,却需要消耗数十万对人工标注的比较数据,并进行高昂的模型重新训练。这种极度不对称的“数据效率鸿沟”,成为了强化学习对齐(RLHF)在视觉生成领域发展的...
如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(TrainfromScratch)。
在当今的大模型研发中,算力焦虑几乎笼罩着每一个技术团队。当我们将目光聚焦于动辄千亿参数的模型时,往往会陷入一个误区:单纯地增加GPU数量就能解决一切问题。然而,真实的工程痛点远比这复杂。
RL微调避坑指南:揭秘KL正则化的“梯度陷阱”与性能真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“无脑”检索:无需训练,DTR框架利用不确定性让RAG性能全面提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
128k长文本推理提速2.7倍:TTT-E2E让模型学会“边读边学”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GRPO多奖励训练“失效”?GDPO解耦归一化:AIME准确率提升6.3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
微软Kascade:无需训练,H100上长文本推理提速4.1倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
别再堆Thinking Tokens了!qTTT让长文本性能暴涨14%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
像搭积木一样优化Prompt:CMU新作MPO,分块微调击败TextGrad。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MoEBlaze:打破显存墙!Meta提出MoE训练新框架,速度飙升4倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LoRA收敛性之谜破解:首个 非渐进收敛速率证明。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
移位代替乘法!LLM推理提速10倍、内存节省87.5%的PoT-QAT技术。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SonicMoE:64张H100顶96张用,MoE训练显存暴降45%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SortedRL:简单排个序,LLM强化学习训练吞吐量提升近40%,性能最高涨18%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
FP4训练的诅咒与祝福:简单“减均值”,性能直追BF16。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Loss一直降,模型却没学会?揭秘LLM持续预训练的“学习假象”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。