RG-OPD:拒绝盲从教师模型!MIT提出奖励门控蒸馏,推理提升8.2分
在大型语言模型的后训练(Post-training)阶段,如何将强大的闭源或超大参数模型(Teacher)的推理能力,高效地迁移到参数量较小的模型(Student)身上,一直是工业界和学术界死磕的核心命题。
在大型语言模型的后训练(Post-training)阶段,如何将强大的闭源或超大参数模型(Teacher)的推理能力,高效地迁移到参数量较小的模型(Student)身上,一直是工业界和学术界死磕的核心命题。
在大型推理模型的部署中,知识蒸馏(KnowledgeDistillation)是将数百亿参数模型的强大能力压缩至轻量级模型的核心手段。长期以来,离线策略(Off-policy)蒸馏占据主导地位,即让学生模型在教师模型预先生成的静态数据上进行训练。
大语言模型正在加速演进为能够自主执行复杂任务的智能体(Agent)。在这一演进路线中,模型面对的最核心挑战之一不仅是“如何准确地生成工具调用参数”,更在于一系列离散的战略决策:“何时该调用工具”、“何时该消化工具的返回结果”,以及“何时该直接用自然语言回答用户”。
在当前的大语言模型(LLM)Agent研究中,工具调用能力已成为其与真实世界交互、解决复杂任务的核心基石。然而,当开发者们不断赋予Agent各种能力时,一个明显的效率瓶颈逐渐显现:现有框架绝大多数依赖由“原子操作”(AtomicActions)组成的静态工具集。
在大型语言模型的自我进化路线中,带有特权上下文的同策略自蒸馏(On-PolicySelf-Distillation,OPSD)一直被视为一种极具潜力的范式。这种方法让模型互为师生,同时给予“教师”模型额外的特权信息(例如标准答案或完整解题步骤),从而引导“学生”模型更高效地学习。
在大语言模型的后训练(Post-training)阶段,如何有效地将强大的闭源或超大参数模型的能力“灌输”给较小的学生模型,一直是极具挑战的核心命题。在过去的探索中,同策略蒸馏(On-PolicyDistillation,简称OPD)凭借其能够提供密集奖励信号、且不易发生灾难性遗忘的优势,迅速...
随着多模态基础模型和智能体系统的快速演进,图形用户界面(GUI)智能体正经历从单平台任务执行向跨平台复杂交互的关键跨越。真实世界的数字工作流往往需要跨越桌面应用程序、移动端App和Web服务,这就要求智能体不仅能适应异构的GUI环境,还要准确保留各个平台独有的交互习惯。
带有可验证奖励的强化学习(RLVR)是当前激活大型语言模型深层推理能力的核心密码。从各大顶尖机构的动作来看,让模型在数学、代码等逻辑严密领域通过自我纠错和多步推理来获取高分,已经成为一种标配。然而,这种后训练(post-training)范式极其昂贵。
当前,大语言模型正从被动响应的知识库,向主动解决现实难题的通用求解器跨越。实现这一跨越的核心,在于彻底打通智能体、逻辑推理与代码这三大核心能力。然而,闭源巨头在特定领域表现惊艳,开源界却始终缺乏一个能统一上述能力的轻量级霸主。本文将深入剖析清华大学与智谱AI最新联合发布的GLM-4.5及其轻量版。
大模型推理成本高昂,长文本处理更是内存“吞金兽”。如何在保证千亿参数级别强大推理能力的同时,将推理吞吐量提升数倍?NVIDIA最近开源的Nemotron3Super交出了一份惊艳的答卷。这款总参数量达120B(激活参数仅12B)的模型,不仅原生支持高达100万的上下文窗口,更在复杂推理场景下实...
在当今的大模型研发中,算力焦虑几乎笼罩着每一个技术团队。当我们将目光聚焦于动辄千亿参数的模型时,往往会陷入一个误区:单纯地增加GPU数量就能解决一切问题。然而,真实的工程痛点远比这复杂。
打破投机采样瓶颈:美团提出“稀疏验证”框架,Attention与MoE全面瘦身。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“写死”的工作流:IBM万字综述,定义Agent动态进化新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GRPO多奖励训练“失效”?GDPO解耦归一化:AIME准确率提升6.3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
微软Kascade:无需训练,H100上长文本推理提速4.1倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
蒸馏即遗忘?大模型记忆率暴跌50%,揭秘知识蒸馏的“隐私红利”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
挑战Ring-Attention霸主地位:Mesh-Attention实现3.4倍加速,通信暴降85%。
LLM越深越“健忘”?字节MoDA架构:性能+2.11%,开销仅3.7%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
像搭积木一样优化Prompt:CMU新作MPO,分块微调击败TextGrad。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
移位代替乘法!LLM推理提速10倍、内存节省87.5%的PoT-QAT技术。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
DPO假设失效?康奈尔联合Netflix提出SPO:大模型对齐的“单指标”革命。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SonicMoE:64张H100顶96张用,MoE训练显存暴降45%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
ETH新作SLHF:用“领导者-跟随者”博弈重塑对齐,推理性能零样本提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLSA:让Diffusion Transformer提速28倍的“对数级”稀疏注意力机制。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。