SEED:自我进化同策略蒸馏,40%数据即可匹敌全量强化学习
随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。
随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。
当前具身智能与机器人学习正经历一场深度的范式革命。以往大放异彩的视觉-语言-动作模型(Vision-Language-Action,VLA)正逐渐暴露出其在物理世界中的局限性。以直接将多模态观察映射为底层动作为核心,这些模型本质上仍是“纯反应式”的系统。
最近,强化学习在大语言模型复杂任务中大放异彩。但随之而来的是一个恼人的副作用:模型极易陷入过度思考。它们生成的推理链条越来越长。这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。甚至让模型陷入重复验证同一子问题的死循环。针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。
当你满怀期待地用强化学习训练多轮大语言模型Agent时,监控大屏上的指标可能正在欺骗你。通常业界习惯用“熵”来衡量模型推理的多样性与稳定性。当熵稳如泰山时,你以为模型正在积极探索不同的解题路径。然而在实际测试中,Agent却常常表现得像一个背诵万能公式的机器人。
大语言模型赛道早已不再是简单的参数堆砌游戏。如何在复杂的逻辑推理、代码生成与工具调用上硬刚闭源巨头?阿里云正式披露了其大规模语言模型系列的核心技术细节。该研究推出的Qwen模型不仅在基础通用能力上表现惊艳,其实验室数据的详细披露更是干货满满。本文将深入解析其背后的预训练机制、上下文扩展技巧及强...
当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。
现阶段在开发大语言模型智能体时,开发者们往往将绝大部分精力投入于调优提示词、微调模型,或是费力编写错综复杂的固定代码逻辑。这些包围在模型外围的代码框架,被称为外围控制层(Harness),它决定了Agent何时观察环境、何时调用工具、何时进行反思以及何时输出最终答案。
以DeepSeek-R1为代表的卓越模型,将基于可验证奖励的强化学习(RLVR)推向了整个行业的聚光灯下。然而,这种后训练范式隐藏着一个不容忽视的致命瓶颈。它通过优化条件分布来提升推理能力,这意味着其潜力被基座模型现有的输出分布严格锁死。
RL不该只会打游戏:哈佛联合帝国理工发布“现实世界落地”三步走指南。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据效率暴涨100倍!Meta AI揭秘强化学习在内容审核中的Scaling Law。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
随机奖励竟能提升数学推理?阿里新作揭秘RLVR背后的“熵减”魔法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
DPO收益甚微,LoRA竟被反超?斯坦福揭秘小模型微调的“最优解”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
训练加速2.4倍!TreeGRPO用“决策树”革新AI绘画模型对齐。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
UI-TARS-2:多轮强化学习炼成!达60%人类水平,AI智能体自主操作电脑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
破解AI智能体训练“死亡螺旋”:LLDS让Qwen2.5性能大涨37.8%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI当上CUDA工程师:性能超NVIDIA官方库26%,CUDA-L2来了!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Token级优化为何能对齐序列级奖励?阿里耗费数十万GPU时,揭秘LLM强化学习稳定之道。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI自己当“考官”:DR Tulu-8B用进化标尺实现顶级研究,成本降低近1000倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MIT新突破:Transformer实现火箭全程自主驾驶,成本仅高出最优解3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“对齐税”!Meta新研究:RL将LLM变身知识导航员,分层知识检索飙升24%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
强化学习“另辟蹊径”:避开90%关键参数,模型推理能力竟能大幅提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种基于收缩估计 (shrinkage estimators) 的新型基线 (baseline) 方法,通过在统计上更优地结合单个提示 (per-prompt) 和跨提示批次 (across-prompt) 的奖励均值,来显著降低策略梯度估计的方差,从而为大型推理模型的强化学习训练带...
本文识别并解决了多智能体 LLM 推理框架中的“懒惰智能体”问题,通过理论分析揭示其源于现有强化学习目标的内在偏差,并提出了一种名为 Dr. MAMR 的新框架,该框架利用夏普利启发的因果影响测量和一种可验证的深思熟虑(deliberation)奖励机制,以促进智能体之间更均衡、更有效的协作。
本文提出了一种名为 Prompt-R1 的端到端强化学习框架,该框架通过训练一个小型语言模型(作为智能体)以多轮交互的方式生成并优化提示,从而与一个大型语言模型(作为环境)协作,以更低的成本和更高的效率解决复杂问题。
本文提出了一种名为PREPO的高效强化学习方法,通过结合基于提示困惑度(Perplexity)的课程学习调度和基于相对熵(Relative Entropy)的探索性序列加权,在不牺牲模型性能的前提下,将大语言模型在强化学习训练中的数据效率提升了高达3倍。
本文提出了一种名为CROPI的数据高效强化学习框架,通过一种新颖的离策略影响函数估计方法,以极低的计算成本识别并挑选对模型训练最有价值的数据,从而在大型语言模型的推理能力训练中实现显著的加速。
本文提出了一种名为缺陷感知策略优化 (FAPO) 的方法,通过训练一个生成式奖励模型(GenRM)来识别并惩罚那些最终答案正确但推理过程有误的“缺陷正样本”,从而在不增加Token预算的情况下,提升大型语言模型在强化学习训练中的推理可靠性、效率和稳定性。
本文提出DeepAgent,一个通用的端到端深度推理智能体(Agent),它将思考、动态工具发现和动作执行统一在单个连贯的推理流中,并通过自主记忆折叠机制和专门的强化学习方法ToolPO,使其能够高效利用规模可变的工具集解决复杂真实世界任务。
本文提出了一种名为 Mixture-of-Minds (MoM) 的多智能体框架,它将表格理解任务分解为规划、编码和回答三个专门的角色,并引入一个基于蒙特卡洛树搜索(MCTS)和强化学习(RL)的自提升训练框架,从而显著提升了模型的表格推理能力。
本文提出 RLEV 方法,通过将可验证的正确性奖励与人类定义的显式价值(如题目分数)相结合,直接优化语言模型,使其不仅追求正确性,更优先处理高价值任务,并学会根据任务重要性调整回答的详略程度。
本文提出了一种名为 SSL4RL 的新框架,通过将自监督学习(SSL)任务重新定义为可验证的内在奖励,对视觉语言模型(VLM)进行强化学习(RL)微调,从而在无需人工标注或AI评判器的情况下有效提升模型的视觉推理与对齐能力。
本文提出了一种名为双重加权强化学习(Dual-Weighted Reinforcement Learning, DWRL)的新框架,该框架通过一个保留了偏好建模归纳偏置的双重加权强化学习目标,将思维链(CoT)推理与Bradley-Terry(BT)模型相结合,从而在不依赖可验证奖励的通用任务...
本文提出了一种名为 DLER 的强化学习训练配方,通过改进优化技术(而非设计复杂的长度惩罚函数)来解决模型输出过长的问题,在将响应长度缩短超过70%的同时,还能超越基线模型的准确率,实现了顶尖的准确率-效率权衡。
本文提出了一种成本感知的动态检索增强推理模型 Dynamic Search-R1,它通过强化学习动态调整检索文档的数量,在显著降低约16-20%延迟的同时,将精确匹配(Exact Match)准确率平均提升了约5%。
本文通过分析大型语言模型(LLM)在推理任务中的注意力模式,揭示了一种“预规划-锚定”(Preplan-and-Anchor)的内在节奏,并基于此发现提出了一种细粒度策略优化方法,有效解决了传统强化学习方法中奖励稀疏和信用分配不明确的问题,从而显著提升了LLM的复杂推理能力。
本文通过一个统一的数学框架证明,多种用于大型语言模型的流行强化学习算法(如REINFORCE、拒绝采样和GRPO),在处理二元奖励时,都可以被看作是在给定提示下获得正确答案概率的某个单调变换函数上的随机梯度上升,从而揭示了这些算法内在的深刻关联。
本文通过大规模系统性研究,首次为大语言模型(LLMs)的强化学习(RL)训练提出了一个可预测的规模化框架,并基于此提出了一套名为 的最佳实践方法,旨在将RL训练的规模化从“艺术”转变为可预测的“科学”。
本文提出了ARM-FM框架,利用基础模型(Foundation Models, FMs)从自然语言指令中自动生成奖励机(Reward Machines, RMs),为组合式强化学习(Compositional Reinforcement Learning)提供结构化的奖励信号,以解决长时程、稀...
本文提出了QeRL,一个量化增强的强化学习框架,它通过利用量化噪声来提升策略探索,在显著加速大模型强化学习(RL)训练、降低显存占用的同时,实现了超越16位基线方法的性能。
本文提出了 ROLL Flash,一个通过引入异步机制来解耦 rollout 和训练阶段的系统,从而显著提升了强化学习后训练(RL Post-Training)的吞吐量和资源可扩展性,同时通过精细化的陈旧度控制确保了模型的最终性能。
本文提出了一种名为 DocReward 的文档奖励模型,它通过在一个包含117K对文档的大规模数据集上学习,专门用于评估文档的结构和风格专业性,并在该任务上显著优于 GPT-5 等强大的基线模型。
本文提出了一种名为 LiveThinking 的两阶段优化框架,旨在解决AI直播等实时场景中推理质量与延迟之间的权衡问题。该框架首先通过知识蒸馏将大型推理模型的能力压缩到轻量级模型中,然后利用强化学习进一步优化推理路径的效率,最终实现了在大幅降低延迟和计算成本的同时,提升响应的正确性与帮助性。
本文提出并形式化了“智能体强化学习(Agentic Reinforcement Learning, Agentic RL)”这一新兴范式,将其定义为将大语言模型(LLM)从被动的序列生成器转变为在复杂动态环境中进行自主决策的智能体,并通过一个围绕智能体核心能力(规划、工具使用、记忆、推理等)的...
本文提出了一种名为 MARS 的双系统多智能体强化学习框架,该框架通过模拟人类认知的双系统(系统1的快速直觉与系统2的审慎推理),让两个智能体协同解决需要外部知识的复杂推理任务,显著提升了模型在动态信息环境下的深度研究和推理能力。
本文提出 CALM 框架,通过专家智能体注入轻量级提示来修正大型推理模型 (LRM) 的原生推理缺陷,从而生成高质量数据,并通过监督微调和强化学习两阶段训练,打造出在优化建模任务上达到业界顶尖水平且参数高效的模型 STORM。
本文通过将多轮智能体强化学习(multi-turn agentic reinforcement learning)的设计空间分解为环境、奖励和策略三大支柱,系统性地进行了实证研究,并最终提炼出一套用于训练大型语言模型(LLM)智能体的实用方法配方。
本文提出了一种名为 SCRIBES 的新型强化学习框架,它通过利用同一网站内网页间的布局相似性作为奖励信号,训练大型语言模型生成可重用的提取脚本,从而实现对网页半结构化数据(如表格和列表)的网络规模、高效率提取。
本文提出了一个名为“可执行反事实 (Executable Counterfactuals)”的框架,通过生成需要溯因、干预和预测三个步骤的编程和数学问题,系统地评估和提升大语言模型的反事实推理能力,并实验证明强化学习(RL)比监督微调(SFT)更能实现这种能力的泛化。
本文系统性地介绍了奖励模型(Reward Models, RMs)的基础概念、分类体系和主流应用,并深入分析了它们在提升大型语言模型(LLM)推理能力中的关键作用,最后探讨了该领域面临的核心挑战与未来方向。
本文提出了一种名为 BroRL 的强化学习扩展范式,它通过显著增加每个样本的探索次数 (rollouts) 来拓宽探索范围,从而有效克服了传统按训练步数扩展方法遭遇的性能瓶颈,实现了持续且高效的模型性能提升。
本文提出了一种名为 Tree-GRPO (Tree-based Group Relative Policy Optimization) 的方法,通过将传统强化学习中独立的链式轨迹采样替换为树搜索采样,从而在有限的 rollout 预算下为多轮智能体任务生成更多、更高质量的轨迹,并利用树结构从稀...
本文提出了一种新颖的方法,通过将复杂的多轮任务规划问题转化为一系列单轮任务推理问题,并利用基于专家轨迹的单轮强化学习(GRPO)进行优化,成功训练出在长时程规划任务中性能超越大型基线模型的小参数量智能体。
本文通过边缘归因修补(EAP)方法分析发现,在线强化学习(RL)微调能系统性地增强大语言模型(LLM)内部回路的激活强度和模式多样性,从而提升模型能力,而直接偏好优化(DPO)则不具备此效应。
本文提出了一种名为在线过程奖励学习 (Online Process Reward Learning, OPRL) 的智能体强化学习信誉分配策略,该策略通过在线交替优化一个过程奖励模型和智能体策略,将轨迹级别的偏好无缝转化为密集的步骤级奖励,从而在不依赖额外数据或步骤标签的情况下,高效稳定地训练...
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle。
本文通过一系列详尽的实验,系统性地探究了构建高性能多模态奖励模型的关键要素,总结出一套清晰的“配方”,并基于此提出了一款名为 BaseReward 的强大基线模型,在多个主流基准测试中达到了新的SOTA水平。
本文提出了一种名为 的新型损失聚合方法,通过构建一个无偏且方差最小的策略梯度估计器,有效解决了在带可验证奖励的强化学习(RLVR)中因响应长度变化巨大导致的高梯度方差和训练不稳定问题。
本文提出了一种名为 FlowRL 的强化学习算法,它通过匹配完整的奖励分布而非简单地最大化奖励,来提升大型语言模型(LLM)的推理能力,从而解决了现有方法容易陷入模式崩溃、探索多样性不足的问题。
本文提出了一个名为 AgentGym-RL 的强化学习框架和一个名为 ScalingInter-RL 的渐进式训练方法,旨在通过多轮交互式决策,从零开始(无需监督微调)训练大型语言模型(LLM)智能体,以解决长时程复杂任务。
对用于大型推理模型的强化学习的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为 SFR-DeepResearch 的方法,其核心是使用一套完全由合成数据驱动的强化学习(RL)方法,在保留并增强其原有推理能力的基础上,将专为推理优化的语言模型(如 QwQ, Qwen3)转化为用于深度研究(Deep Research)任务的自主单智能体。
本文证明,通过强化学习(RL)对一个较小的语言模型(如 Qwen2.5-3B)进行梯度更新,可以在机器学习工程(MLE)任务中超越比它大得多的静态模型(如 Claude-3.5-Sonnet),其核心贡献是提出了两种关键技术来克服RL在智能体(Agent)设置中的挑战:时长感知梯度更新(dur...
本文提出了一种“基于结果的探索”(Outcome-based Exploration)方法,通过在强化学习训练中根据最终答案(而非整个推理过程)给予探索奖励,有效提升了大型语言模型在推理任务上的准确率,同时缓解了传统RL训练导致的生成多样性下降问题。
本文提出动态推测规划 (Dynamic Speculative Planning, DSP),一个通过在线强化学习自适应调整推测步骤(speculation step)的智能体规划框架,旨在实现无损加速的同时显著降低成本,并允许用户控制延迟与成本之间的权衡。
本文提出了一种名为“平衡智能体初始化 (Balanced Actor Initialization, BAI)”的两阶段加权模型合并方法,旨在解决当对经过蒸馏训练的推理模型应用强化学习(RLHF)时出现的训练不稳定问题,从而稳定地结合蒸馏的效率和人类反馈对齐的优势。
本文提出了一种名为 CODA 的可训练组合式智能体框架,它模仿人脑的大脑与小脑功能分离机制,通过解耦的强化学习和两阶段训练流程,协同一个通用规划器(大脑)和一个专用执行器(小脑),以有效解决科学计算等专业领域中长时序规划与精确GUI操作的挑战。
本文提出了 VerlTool,一个统一、模块化且高效的框架,旨在解决智能体强化学习与工具使用 (Agentic Reinforcement Learning with Tool use, ARLT) 领域的系统碎片化、执行效率低下和扩展性差等核心问题。
本文提出了一种名为 ReST-RL 的统一强化学习范式,通过将优化的自训练算法 (ReST-GRPO) 与基于价值模型 (Value Model) 的蒙特卡洛树搜索解码方法 (VM-MCTS) 相结合,显著提升了大型语言模型 (LLM) 在代码推理任务上的准确性。
本文提出了一种名为 SimPO 的简单偏好优化算法,它通过使用一个无需参考模型、与生成过程对齐的长度归一化奖励,在提升模型性能的同时,显著提高了训练的计算和内存效率。
强化学习 (Reinforcement Learning, RL),在深度神经网络的推动下,已在多个学科取得重大突破,例如在计算机游戏、棋类对弈、机器人技术以及矩阵乘法和排序等高效算法开发中都展现了卓越能力。
本文提出 Reflexion 框架,通过让语言智能体对过去的试错经验进行口头反思(verbal reflection)并形成文本记忆,从而在无需更新模型权重的情况下实现强化学习,显著提升了其在决策、推理和编程等任务上的表现。
本文提出了一种通过强化学习(RL)扩展大型语言模型(LLM)能力的方法,其核心是利用长上下文(long context)和改进的策略优化算法,构建了一个无需蒙特卡洛树搜索等复杂技术的简化框架,从而在多项推理基准上取得了顶尖性能。
通过系统性地使用大 值的 指标进行评估,本文发现当前的带可验证奖励的强化学习(RLVR)方法并未赋予大语言模型超越其基础模型的新推理能力,而仅仅是提升了对基础模型已有能力的采样效率,甚至可能缩小了模型的推理范围。
本文提出了一种名为直接偏好优化(DPO)的新算法,它通过一个解析性的映射关系,将传统强化学习中带约束的奖励最大化问题,巧妙地转化为一个简单的分类损失函数,从而无需显式训练奖励模型或进行复杂的强化学习,就能高效地使语言模型与人类偏好对齐。
本文介绍了DeepSeekMath,一个通过在精心构建的120B数学语料上进行持续预训练,并采用一种名为GRPO的新型高效强化学习算法,从而将开源模型的数学推理能力推向接近GPT-4水平的7B语言模型。
本文通过大规模强化学习(无论是纯粹应用于基础模型还是结合少量冷启动数据),成功地激发并显著增强了大型语言模型的推理能力,推出了DeepSeek-R1系列模型,并验证了可以将这种高级推理能力通过蒸馏有效地迁移到更小的模型中。
本文提出了一个结合多目标进化算法与强化学习的新颖框架,用于解决微电网 (Microgrid, MG) 能源管理中的多目标优化问题,实现了在处理成本、排放和热能浪费等冲突目标时的性能提升和策略可解释性。
本文提出了一种名为DAPO的强化学习算法,通过解耦裁剪范围、动态采样、Token级损失计算和超长奖励塑造这四项关键技术,成功解决了大语言模型在长思路链(long-CoT)推理任务中遇到的熵崩溃、训练不稳定和效率低下等问题,并开源了整个大规模强化学习系统。