模型训练

大模型剪枝还是从头训练?50%压缩率下的LLM微缩路线指南

如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(TrainfromScratch)。

仅需100条数据超越GPT-5:RewardHarness自进化奖励框架解读

在评估图像编辑的优劣时,人类往往只需看几个参考示例,就能敏锐地察觉出编辑是否符合要求、有无违和感。然而,当前主流的视觉模型若想具备同样的判别能力,却需要消耗数十万对人工标注的比较数据,并进行高昂的模型重新训练。这种极度不对称的“数据效率鸿沟”,成为了强化学习对齐(RLHF)在视觉生成领域发展的...

零标注自我进化:PST框架激发群体智慧,推理能力提升4.3%

大模型如何在缺乏人类优质标注的情况下实现持续的自我进化?这是当前大语言模型在后训练阶段面临的核心技术瓶颈。当前的工业级实践方案,往往高度依赖海量的优质专家标注数据。或者需要构建极其复杂的外部奖励模型来提供强化学习信号。这种范式虽然在受控环境下行之有效,但其高昂的成本不可忽视。

统治大模型的RLHF完美吗?深度揭秘其3大环节的核心缺陷

当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。

1.2B反超200倍巨头:MinerU2.5-Pro重塑文档解析飞轮

当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。真正拖后腿的,是高度同质化且存在缺陷的训练数据。

Kimi K2重磅开源:万亿参数与MuonClip重塑Agent智能

大语言模型正经历从静态模仿向主动交互的深刻变革。这标志着智能体(AgenticIntelligence)时代的全面开启。在此范式下,模型必须学会在复杂多变的环境中自主感知、规划、推理并采取行动。然而,打造极致的智能体能力,意味着要在预训练与后训练阶段跨越两座大山。

吞吐量飙升3倍!I-DLM破局并行解码,媲美同级自回归质量

大语言模型的世界一直被逐字生成的自回归机制统治。虽然扩散模型承诺了令人兴奋的并行生成前景,但它们在文本质量上始终无法与自回归模型抗衡。为什么扩散模型在图像领域大杀四方,在文本生成领域却总是“差一口气”?

万字长文拆解大模型“听话”的秘密:指令微调(IT/SFT)前沿全景综述

大型语言模型(LLM)的原始形态,本质上是一个极其庞大的“文字接龙”机器。它们通过海量语料学会了预测下一个词,却并不知道如何满足用户的真实业务需求。当用户输入“帮我写一封辞职信”时,原始模型可能会补充“,你需要注意以下几点”。它在机械地续写句子,而不是在执行人类的命令。

拒绝“特权幻觉”!DOPD双重蒸馏让大模型能力狂飙14分

为什么给大模型“开小灶”,它反而越学越傻?在如今的大模型后训练阶段,用一个强大的“老师”模型来指导一个较弱的“学生”模型,已经成为提升性能的标准操作。为了让老师教得更好,研究人员往往会给老师提供一些特权信息(PrivilegedInformation),比如数学题的解题提示,或者视觉任务中的目...

拒绝大模型SFT后“千篇一律”:注释锚定训练将语义崩溃降低6倍

毫无疑问,经过监督微调(SupervisedFine-Tuning,SFT)的大语言模型变得更加听话和好用了。它们学会了遵循指令,掌握了安全边界,也习惯了人类喜欢的对话格式。但你是否发现,当你让模型进行创意写作或开放式问答时,它们的回答套路越来越“千篇一律”?

突破大模型思考极限:最新推理前沿综述拆解两大核心演进路线

当OpenAI的o1模型横空出世,紧接着DeepSeek-R1震撼开源界时。人们敏锐地察觉到,大语言模型不再仅仅是“单句接龙”的文本生成器。它们开始展现出极具深度的长程逻辑推演能力。这种被称为“大模型推理”的核心能力。正成为区分传统聊天机器人与高级人工智能系统的一道巨大分水岭。

斯坦福揭示数据过滤的苦涩教训:当算力充沛时,无过滤才是最优解

长期以来,大语言模型预训练的数据清洗被视作不可逾越的金科玉律。业界普遍认为,必须将海量网页数据精心过滤,剔除低质量内容,才能喂给模型。然而,斯坦福大学的一项最新研究,向这一常识投下了重磅炸弹。本文指出:当算力足够庞大且模型参数足够多时,最好的数据过滤器,就是完全不过滤(NoFilter)。

On the Convergence Rate of LoRA Gradient Descent

LoRA收敛性之谜破解:首个 非渐进收敛速率证明。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

End-to-End Test-Time Training for Long Context

128k长文本推理提速2.7倍:TTT-E2E让模型学会“边读边学”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Controlling changes to attention logits

Mistral AI新作QuacK:不靠归一化,动态学习率让Transformer训练提速10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Soft Adaptive Policy Optimization

告别硬裁剪!阿里SAPO算法,用“柔性门控”提升LLM训练稳定性与性能。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Reusing Pre-Training Data at Test Time is a Compute Multiplier

本文提出,在测试时通过检索增强的方式重用模型的预训练数据,可以显著提升大语言模型的性能,这种方法相当于一种高效的“计算倍增器”,证明了当前预训练方法并未充分利用数据中的信息。

Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse

本文提出了一种名为 Tree Training 的新训练范式,通过将智能体交互产生的树状轨迹数据进行高效打包和计算复用,在训练的前向和后向传播中对共享的前缀(prefix)只计算一次,从而显著提升了智能体大语言模型(Agentic LLM)的训练效率。

SpecAttn: Speculating Sparse Attention

本文提出了一种名为 SpecAttn 的免训练方法,该方法将推测解码(speculative decoding)与稀疏注意力相结合,通过利用草稿模型(draft model)已计算出的注意力权重来为目标模型(target model)动态预测并选择重要的 Token,从而在不显著牺牲模型性能的...

Defeating the Training-Inference Mismatch via FP16

本文发现,在强化学习微调大型语言模型时,仅需将训练精度从广泛使用的 BF16 切换回 FP16,即可从根源上解决训练与推理策略之间的数值不匹配问题,从而获得更稳定的优化、更快的收敛和更强的模型性能。

A Survey on LLM Mid-training

当代大型语言模型 (LLM) 的开发已从单一的预训练模式演变为复杂的多阶段优化框架。预训练通过接触大规模多样化语料库为模型奠定基础能力,而后续的优化阶段则系统性地增强特定能力。中间训练 (mid-training) 作为连接预训练和后训练的关键桥梁,其重要性日益凸显。

FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning

本文提出了一种名为缺陷感知策略优化 (FAPO) 的方法,通过训练一个生成式奖励模型(GenRM)来识别并惩罚那些最终答案正确但推理过程有误的“缺陷正样本”,从而在不增加Token预算的情况下,提升大型语言模型在强化学习训练中的推理可靠性、效率和稳定性。

GaLLoP: Gradient-based Sparse Learning on Low-Magnitude Parameters

本文提出了一种名为 GaLLoP 的稀疏微调新方法,它通过优先选择在下游任务上梯度最大、且在预训练模型中权重绝对值最小的参数进行微调,从而在提升任务性能的同时有效保留预训练知识,实现了卓越的分布内(ID)和分布外(OOD)泛化能力。

Continual Learning via Sparse Memory Finetuning

本文提出了一种名为稀疏内存微调(sparse memory finetuning)的方法,通过仅更新与新知识高度相关的、利用TF-IDF筛选出的极少数内存槽位,使大型语言模型在学习新知识的同时,显著减少了灾难性遗忘。

Imbalanced Gradients in RL Post-Training of Multi-Task LLMs

本文通过实验证明,在大型语言模型 (LLM) 的多任务强化学习 (RL) 后训练中,不同任务会产生幅度差异悬殊的梯度,并且大梯度并不意味着大的学习增益,这种梯度不平衡现象会导致优化过程偏向特定任务,从而损害整体性能。

Mid-Training of Large Language Models: A Survey

本文首次将大语言模型(LLMs)的中期训练(mid-training)概念化为一个统一的范式,并提出了一个涵盖数据分布、学习率调度和长上下文扩展的分类体系,旨在系统性地梳理这一介于大规模预训练和任务微调之间的关键阶段。

A Multi-Agent Framework for Stateful Inference-Time Search

本文提出了一个无需训练的有状态多智能体进化搜索框架,通过结合持久化推理时状态、对抗性变异和进化式搜索,提升单元测试中边缘案例的生成能力和代码覆盖率。

Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention

本文首次系统性地揭示了在使用Flash Attention进行低精度(BF16)Transformer模型训练时,导致训练崩溃的内在机制,指出其根源在于注意力机制中出现的相似低秩表示与BF16算术固有有偏舍入误差的累积效应,两者共同形成恶性循环,最终导致损失爆炸。

Understanding the Role of Training Data in Test-Time Scaling

本文通过一个可理论分析的线性回归任务,从理论上解释了训练数据的特性如何决定测试时增加计算(即更长的思想链)能否成功提升模型性能,并证明了在多样化、相关且困难的任务上进行训练对测试时扩展(test-time scaling)最为有利。

Staircase Streaming for Low-Latency Multi-Agent Inference

本文提出了一种名为“阶梯式流式传输 (Staircase Streaming)”的方法,通过让多智能体系统中的后续智能体(如聚合器)在接收到前序智能体(如提议者)的部分输出块(chunks)后便开始生成,而非等待其完整输出,从而将序贯依赖转变为流水线并行处理,显著降低了多智能体推理的首Toke...

CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling

本文提出 CALM 框架,通过专家智能体注入轻量级提示来修正大型推理模型 (LRM) 的原生推理缺陷,从而生成高质量数据,并通过监督微调和强化学习两阶段训练,打造出在优化建模任务上达到业界顶尖水平且参数高效的模型 STORM。

RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training

本文提出一种名为 RiskPO 的大语言模型训练后优化方法,通过引入一个基于风险度量的目标函数(MVaR),替代传统的均值优化目标,从而将模型优化的重点放在处理困难样本上,有效缓解了熵坍塌问题,并显著提升了模型的推理能力。

Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning

本文提出了一种非对称近端策略优化(Asymmetric Proximal Policy Optimization, AsyPPO),该框架通过使用一组在非重叠数据上训练的轻量级“迷你评论家”(mini-critics),在保持计算高效的同时恢复了评论家(critic)在大型语言模型(LLM)推...

Thinking Augmented Pre-training

本文提出了一种名为“思维增强预训练”(Thinking Augmented Pre-training, TPT)的简单且可扩展的方法,通过使用现有LLM为预训练数据自动生成“思维轨迹”(thinking trajectories),从而显著提升了语言模型训练的数据效率和推理能力。

RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training

本文提出了一种名为 RollPacker 的同步强化学习(RL)训练系统,其核心是一种创新的 rollout 调度策略——尾部批处理(tail batching),该策略通过将导致长响应的 prompt 整合到少数专用的 rollout 步骤中,显著减少了因响应长度不均衡导致的 GPU 空闲时...

Pre-training under infinite compute

本文提出,在数据受限而计算资源无限的未来场景下,通过深度优化正则化、模型集成和知识蒸馏等经典算法,可以显著提升语言模型预训练的数据效率,其效果远超单纯增加训练轮次或模型参数的传统方法。

Language Self-Play For Data-Free Training

本文提出了一种名为语言自博弈(Language Self-Play, LSP)的无数据训练方法,通过构建一个强化学习框架,让大型语言模型在“挑战者”(生成难题)和“解答者”(解答问题)两种角色间自我对抗,从而在无需外部训练数据的情况下实现持续自我提升。

Towards a Unified View of Large Language Model Post-Training

本文提出了一个统一的策略梯度估计器(UPGE),将监督微调(SFT)和强化学习(RL)两种后训练范式归纳到单一的优化目标下,并基于此设计了一种名为混合后训练(HPT)的新算法,该算法能根据模型的实时表现动态地在SFT和RL之间切换,从而有效提升模型的推理能力。

Understanding R1-Zero-Like Training: A Critical Perspective

本文通过剖析 R1-Zero 类训练,揭示了其基座模型与强化学习算法(GRPO)中存在的偏见,并提出了一种无偏的优化方法 Dr. GRPO,从而以更高效的方式提升了模型的数学推理能力。

Sigmoid Loss for Language Image Pre-Training

本文提出了一种用于语言-图像预训练的简单成对 Sigmoid 损失函数 (Sigmoid loss),它将对比学习任务转化为对图文对的独立二元分类,从而解耦了损失计算与批次大小 (batch size) 的依赖,实现了更高的内存效率和在小批量数据下更优的性能。

LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention

本文提出了一种名为 LLaMA-Adapter 的高效微调方法,它通过引入一个仅有1.2M可学习参数、带有零初始化注意力的轻量级适配器,在冻结 LLaMA 模型主体的情况下,实现了快速(1小时内)、高效的指令微调,并能轻松扩展到多模态任务。

Large Language Monkeys: Scaling Inference Compute with Repeated Sampling

本文系统地研究了通过重复采样来扩展推理计算(Inference Compute)的方法,发现其能显著提升模型在代码和数学等任务上的覆盖率(即解决问题的能力),其扩展性甚至遵循类似缩放定律的规律,并使得小模型在成本效益更高的情况下超越大模型的单次推理表现。

Jailbroken: How Does LLM Safety Training Fail?

本文提出并验证了大型语言模型(LLM)安全训练的两种核心失败模式——“竞争性目标”与“泛化不匹配”,并基于此设计出能成功“越狱”(Jailbreak)GPT-4和Claude等顶尖模型的新型攻击方法。

Efficient Streaming Language Models with Attention Sinks

本文提出了一种名为 StreamingLLM 的高效框架,通过保留少量初始 Token 作为“注意力池 (Attention Sinks)”来稳定注意力分布,从而使预训练好的大语言模型无需微调即可处理无限长的流式输入。

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

本文提出了一种名为直接偏好优化(DPO)的新算法,它通过一个解析性的映射关系,将传统强化学习中带约束的奖励最大化问题,巧妙地转化为一个简单的分类损失函数,从而无需显式训练奖励模型或进行复杂的强化学习,就能高效地使语言模型与人类偏好对齐。