What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
推理模型“瘦身”奇迹:2-bit量化下数学能力暴涨44%的技术解密。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
推理模型“瘦身”奇迹:2-bit量化下数学能力暴涨44%的技术解密。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
CMU揭秘大模型推理训练“三部曲”:性能飙升60%的黄金法则。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型“瘦身”革命:砍掉99.7%注意力连接,内部电路清晰100倍且性能不降!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI解魔方新突破:预训练一个“世界模型”,强化学习性能提升40%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AMD力作Dual LoRA:性能最高提升1.8%!将参数更新分解为“幅值”与“方向”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agent推理成本降低2.5倍:斯坦福提出“上下文蒸馏”,免训练让小模型偷师大模型。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
RL训练的秘密:LLM学会了举一反三,为何却被“先易后难”的结构卡住?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Mistral AI新作QuacK:不靠归一化,动态学习率让Transformer训练提速10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
推理成本直降75%!英伟达新研究:LLM学会“长话短说”,数学能力还不减。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别硬裁剪!阿里SAPO算法,用“柔性门控”提升LLM训练稳定性与性能。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AdamW的继任者?AdamHD让LLM训练提速15%,性能提升4.7%,显存再省30%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent训练成本减半!SkyRL-Agent框架揭秘1.55倍加速秘诀。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
批量归一化(Batch Normalization):深度学习的“稳定器”与“加速器”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
即插即用LoRA!LoGo实现零成本动态适配,推理性能最高提升3.6%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
只需数百样本,性能反超SOTA!蚂蚁Thinker教LLM如何“分层思考”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Sampling and Loss Weights in Multi-Domain Training。
本文提出,在测试时通过检索增强的方式重用模型的预训练数据,可以显著提升大语言模型的性能,这种方法相当于一种高效的“计算倍增器”,证明了当前预训练方法并未充分利用数据中的信息。
本文提出了一种名为 Tree Training 的新训练范式,通过将智能体交互产生的树状轨迹数据进行高效打包和计算复用,在训练的前向和后向传播中对共享的前缀(prefix)只计算一次,从而显著提升了智能体大语言模型(Agentic LLM)的训练效率。
大型语言模型 (Large Language Models, LLMs) 的后训练 (post-training) 已成为释放其领域适应能力和任务泛化潜力的关键阶段。这一阶段有效增强了模型在长上下文推理、人类对齐、指令微调和领域专用适应等方面的能力。
本文提出了一种名为 Parrot 的新颖训练流水线,旨在通过三个专门设计的子任务和混合训练策略,相互增强程序思维链(P-CoT)和自然语言思维链(N-CoT)的性能,从而同时提升两种范式下的数学推理能力。
本文提出了一种名为 SpecAttn 的免训练方法,该方法将推测解码(speculative decoding)与稀疏注意力相结合,通过利用草稿模型(draft model)已计算出的注意力权重来为目标模型(target model)动态预测并选择重要的 Token,从而在不显著牺牲模型性能的...
本文发现,在强化学习微调大型语言模型时,仅需将训练精度从广泛使用的 BF16 切换回 FP16,即可从根源上解决训练与推理策略之间的数值不匹配问题,从而获得更稳定的优化、更快的收敛和更强的模型性能。
当代大型语言模型 (LLM) 的开发已从单一的预训练模式演变为复杂的多阶段优化框架。预训练通过接触大规模多样化语料库为模型奠定基础能力,而后续的优化阶段则系统性地增强特定能力。中间训练 (mid-training) 作为连接预训练和后训练的关键桥梁,其重要性日益凸显。
本文提出了一种名为缺陷感知策略优化 (FAPO) 的方法,通过训练一个生成式奖励模型(GenRM)来识别并惩罚那些最终答案正确但推理过程有误的“缺陷正样本”,从而在不增加Token预算的情况下,提升大型语言模型在强化学习训练中的推理可靠性、效率和稳定性。