模型训练 第3页

拒绝“特权幻觉”!DOPD双重蒸馏让大模型能力狂飙14分

为什么给大模型“开小灶”,它反而越学越傻?在如今的大模型后训练阶段,用一个强大的“老师”模型来指导一个较弱的“学生”模型,已经成为提升性能的标准操作。为了让老师教得更好,研究人员往往会给老师提供一些特权信息(PrivilegedInformation),比如数学题的解题提示,或者视觉任务中的目...

万字长文拆解大模型“听话”的秘密:指令微调(IT/SFT)前沿全景综述

大型语言模型(LLM)的原始形态,本质上是一个极其庞大的“文字接龙”机器。它们通过海量语料学会了预测下一个词,却并不知道如何满足用户的真实业务需求。当用户输入“帮我写一封辞职信”时,原始模型可能会补充“,你需要注意以下几点”。它在机械地续写句子,而不是在执行人类的命令。

吞吐量飙升3倍!I-DLM破局并行解码,媲美同级自回归质量

大语言模型的世界一直被逐字生成的自回归机制统治。虽然扩散模型承诺了令人兴奋的并行生成前景,但它们在文本质量上始终无法与自回归模型抗衡。为什么扩散模型在图像领域大杀四方,在文本生成领域却总是“差一口气”?

Kimi K2重磅开源:万亿参数与MuonClip重塑Agent智能

大语言模型正经历从静态模仿向主动交互的深刻变革。这标志着智能体(AgenticIntelligence)时代的全面开启。在此范式下,模型必须学会在复杂多变的环境中自主感知、规划、推理并采取行动。然而,打造极致的智能体能力,意味着要在预训练与后训练阶段跨越两座大山。

1.2B反超200倍巨头:MinerU2.5-Pro重塑文档解析飞轮

当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。真正拖后腿的,是高度同质化且存在缺陷的训练数据。

统治大模型的RLHF完美吗?深度揭秘其3大环节的核心缺陷

当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。

零标注自我进化:PST框架激发群体智慧,推理能力提升4.3%

大模型如何在缺乏人类优质标注的情况下实现持续的自我进化?这是当前大语言模型在后训练阶段面临的核心技术瓶颈。当前的工业级实践方案,往往高度依赖海量的优质专家标注数据。或者需要构建极其复杂的外部奖励模型来提供强化学习信号。这种范式虽然在受控环境下行之有效,但其高昂的成本不可忽视。

仅需100条数据超越GPT-5:RewardHarness自进化奖励框架解读

在评估图像编辑的优劣时,人类往往只需看几个参考示例,就能敏锐地察觉出编辑是否符合要求、有无违和感。然而,当前主流的视觉模型若想具备同样的判别能力,却需要消耗数十万对人工标注的比较数据,并进行高昂的模型重新训练。这种极度不对称的“数据效率鸿沟”,成为了强化学习对齐(RLHF)在视觉生成领域发展的...

大模型剪枝还是从头训练?50%压缩率下的LLM微缩路线指南

如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(TrainfromScratch)。

End-to-End Test-Time Training for Long Context

128k长文本推理提速2.7倍:TTT-E2E让模型学会“边读边学”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

On the Convergence Rate of LoRA Gradient Descent

LoRA收敛性之谜破解:首个 非渐进收敛速率证明。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。