强化学习

SEED:自我进化同策略蒸馏,40%数据即可匹敌全量强化学习

随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。

告别纯反应式VLA:全面解析机器人世界模型进化密码

当前具身智能与机器人学习正经历一场深度的范式革命。以往大放异彩的视觉-语言-动作模型(Vision-Language-Action,VLA)正逐渐暴露出其在物理世界中的局限性。以直接将多模态观察映射为底层动作为核心,这些模型本质上仍是“纯反应式”的系统。

ReSum揭秘:大模型学会自我总结,推理提升4%且输出缩减18%

最近,强化学习在大语言模型复杂任务中大放异彩。但随之而来的是一个恼人的副作用:模型极易陷入过度思考。它们生成的推理链条越来越长。这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。甚至让模型陷入重复验证同一子问题的死循环。针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。

RAGEN-2揭秘:打破Agent强化学习“模板坍塌”,SNR过滤机制破局

当你满怀期待地用强化学习训练多轮大语言模型Agent时,监控大屏上的指标可能正在欺骗你。通常业界习惯用“熵”来衡量模型推理的多样性与稳定性。当熵稳如泰山时,你以为模型正在积极探索不同的解题路径。然而在实际测试中,Agent却常常表现得像一个背诵万能公式的机器人。

阿里Qwen深度技术解密:3万亿Token与全面对齐的工程实践

大语言模型赛道早已不再是简单的参数堆砌游戏。如何在复杂的逻辑推理、代码生成与工具调用上硬刚闭源巨头?阿里云正式披露了其大规模语言模型系列的核心技术细节。该研究推出的Qwen模型不仅在基础通用能力上表现惊艳,其实验室数据的详细披露更是干货满满。本文将深入解析其背后的预训练机制、上下文扩展技巧及强...

统治大模型的RLHF完美吗?深度揭秘其3大环节的核心缺陷

当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。

告别手写规则:离线强化学习让LLM Agent自主掌控工作流

现阶段在开发大语言模型智能体时,开发者们往往将绝大部分精力投入于调优提示词、微调模型,或是费力编写错综复杂的固定代码逻辑。这些包围在模型外围的代码框架,被称为外围控制层(Harness),它决定了Agent何时观察环境、何时调用工具、何时进行反思以及何时输出最终答案。

打破大模型推理天花板:DSRL双空间强化学习,反思能力暴涨14倍

以DeepSeek-R1为代表的卓越模型,将基于可验证奖励的强化学习(RLVR)推向了整个行业的聚光灯下。然而,这种后训练范式隐藏着一个不容忽视的致命瓶颈。它通过优化条件分布来提升推理能力,这意味着其潜力被基座模型现有的输出分布严格锁死。

Evaluating Parameter Efficient Methods for RLVR

LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation

本文识别并解决了多智能体 LLM 推理框架中的“懒惰智能体”问题,通过理论分析揭示其源于现有强化学习目标的内在偏差,并提出了一种名为 Dr. MAMR 的新框架,该框架利用夏普利启发的因果影响测量和一种可验证的深思熟虑(deliberation)奖励机制,以促进智能体之间更均衡、更有效的协作。

Data-Efficient RLVR via Off-Policy Influence Guidance

本文提出了一种名为CROPI的数据高效强化学习框架,通过一种新颖的离策略影响函数估计方法,以极低的计算成本识别并挑选对模型训练最有价值的数据,从而在大型语言模型的推理能力训练中实现显著的加速。

FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning

本文提出了一种名为缺陷感知策略优化 (FAPO) 的方法,通过训练一个生成式奖励模型(GenRM)来识别并惩罚那些最终答案正确但推理过程有误的“缺陷正样本”,从而在不增加Token预算的情况下,提升大型语言模型在强化学习训练中的推理可靠性、效率和稳定性。

DeepAgent: A General Reasoning Agent with Scalable Toolsets

本文提出DeepAgent,一个通用的端到端深度推理智能体(Agent),它将思考、动态工具发现和动作执行统一在单个连贯的推理流中,并通过自主记忆折叠机制和专门的强化学习方法ToolPO,使其能够高效利用规模可变的工具集解决复杂真实世界任务。

Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding

本文提出了一种名为 Mixture-of-Minds (MoM) 的多智能体框架,它将表格理解任务分解为规划、编码和回答三个专门的角色,并引入一个基于蒙特卡洛树搜索(MCTS)和强化学习(RL)的自提升训练框架,从而显著提升了模型的表格推理能力。

Dual-Weighted Reinforcement Learning for Generative Preference Modeling

本文提出了一种名为双重加权强化学习(Dual-Weighted Reinforcement Learning, DWRL)的新框架,该框架通过一个保留了偏好建模归纳偏置的双重加权强化学习目标,将思维链(CoT)推理与Bradley-Terry(BT)模型相结合,从而在不依赖可验证奖励的通用任务...

What is the objective of reasoning with reinforcement learning?

本文通过一个统一的数学框架证明,多种用于大型语言模型的流行强化学习算法(如REINFORCE、拒绝采样和GRPO),在处理二元奖励时,都可以被看作是在给定提示下获得正确答案概率的某个单调变换函数上的随机梯度上升,从而揭示了这些算法内在的深刻关联。

The Art of Scaling Reinforcement Learning Compute for LLMs

本文通过大规模系统性研究,首次为大语言模型(LLMs)的强化学习(RL)训练提出了一个可预测的规模化框架,并基于此提出了一套名为 的最佳实践方法,旨在将RL训练的规模化从“艺术”转变为可预测的“科学”。

DocReward: A Document Reward Model for Structuring and Stylizing

本文提出了一种名为 DocReward 的文档奖励模型,它通过在一个包含117K对文档的大规模数据集上学习,专门用于评估文档的结构和风格专业性,并在该任务上显著优于 GPT-5 等强大的基线模型。

LiveThinking: Enabling Real-Time Efficient Reasoning for AI-Powered Livestreaming via Reinforcement Learning

本文提出了一种名为 LiveThinking 的两阶段优化框架,旨在解决AI直播等实时场景中推理质量与延迟之间的权衡问题。该框架首先通过知识蒸馏将大型推理模型的能力压缩到轻量级模型中,然后利用强化学习进一步优化推理路径的效率,最终实现了在大幅降低延迟和计算成本的同时,提升响应的正确性与帮助性。

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

本文提出并形式化了“智能体强化学习(Agentic Reinforcement Learning, Agentic RL)”这一新兴范式,将其定义为将大语言模型(LLM)从被动的序列生成器转变为在复杂动态环境中进行自主决策的智能体,并通过一个围绕智能体核心能力(规划、工具使用、记忆、推理等)的...

MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement Learning

本文提出了一种名为 MARS 的双系统多智能体强化学习框架,该框架通过模拟人类认知的双系统(系统1的快速直觉与系统2的审慎推理),让两个智能体协同解决需要外部知识的复杂推理任务,显著提升了模型在动态信息环境下的深度研究和推理能力。

CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling

本文提出 CALM 框架,通过专家智能体注入轻量级提示来修正大型推理模型 (LRM) 的原生推理缺陷,从而生成高质量数据,并通过监督微调和强化学习两阶段训练,打造出在优化建模任务上达到业界顶尖水平且参数高效的模型 STORM。

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

本文通过将多轮智能体强化学习(multi-turn agentic reinforcement learning)的设计空间分解为环境、奖励和策略三大支柱,系统性地进行了实证研究,并最终提炼出一套用于训练大型语言模型(LLM)智能体的实用方法配方。

Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code

本文提出了一个名为“可执行反事实 (Executable Counterfactuals)”的框架,通过生成需要溯因、干预和预测三个步骤的编程和数学问题,系统地评估和提升大语言模型的反事实推理能力,并实验证明强化学习(RL)比监督微调(SFT)更能实现这种能力的泛化。

BroRL: Scaling Reinforcement Learning via Broadened Exploration

本文提出了一种名为 BroRL 的强化学习扩展范式,它通过显著增加每个样本的探索次数 (rollouts) 来拓宽探索范围,从而有效克服了传统按训练步数扩展方法遭遇的性能瓶颈,实现了持续且高效的模型性能提升。

Tree Search for LLM Agent Reinforcement Learning

本文提出了一种名为 Tree-GRPO (Tree-based Group Relative Policy Optimization) 的方法,通过将传统强化学习中独立的链式轨迹采样替换为树搜索采样,从而在有限的 rollout 预算下为多轮智能体任务生成更多、更高质量的轨迹,并利用树结构从稀...

Online Process Reward Leanring for Agentic Reinforcement Learning

本文提出了一种名为在线过程奖励学习 (Online Process Reward Learning, OPRL) 的智能体强化学习信誉分配策略,该策略通过在线交替优化一个过程奖励模型和智能体策略,将轨迹级别的偏好无缝转化为密集的步骤级奖励,从而在不依赖额外数据或步骤标签的情况下,高效稳定地训练...

BaseReward: A Strong Baseline for Multimodal Reward Model

本文通过一系列详尽的实验,系统性地探究了构建高性能多模态奖励模型的关键要素,总结出一套清晰的“配方”,并基于此提出了一款名为 BaseReward 的强大基线模型,在多个主流基准测试中达到了新的SOTA水平。

ΔL Normalization: Rethink Loss Aggregation in RLVR

本文提出了一种名为 的新型损失聚合方法,通过构建一个无偏且方差最小的策略梯度估计器,有效解决了在带可验证奖励的强化学习(RLVR)中因响应长度变化巨大导致的高梯度方差和训练不稳定问题。

FlowRL: Matching Reward Distributions for LLM Reasoning

本文提出了一种名为 FlowRL 的强化学习算法,它通过匹配完整的奖励分布而非简单地最大化奖励,来提升大型语言模型(LLM)的推理能力,从而解决了现有方法容易陷入模式崩溃、探索多样性不足的问题。

Reinforcement Learning for Machine Learning Engineering Agents

本文证明,通过强化学习(RL)对一个较小的语言模型(如 Qwen2.5-3B)进行梯度更新,可以在机器学习工程(MLE)任务中超越比它大得多的静态模型(如 Claude-3.5-Sonnet),其核心贡献是提出了两种关键技术来克服RL在智能体(Agent)设置中的挑战:时长感知梯度更新(dur...

Outcome-based Exploration for LLM Reasoning

本文提出了一种“基于结果的探索”(Outcome-based Exploration)方法,通过在强化学习训练中根据最终答案(而非整个推理过程)给予探索奖励,有效提升了大型语言模型在推理任务上的准确率,同时缓解了传统RL训练导致的生成多样性下降问题。

Dynamic Speculative Agent Planning

本文提出动态推测规划 (Dynamic Speculative Planning, DSP),一个通过在线强化学习自适应调整推测步骤(speculation step)的智能体规划框架,旨在实现无损加速的同时显著降低成本,并允许用户控制延迟与成本之间的权衡。

Reinforcement learning

强化学习 (Reinforcement Learning, RL),在深度神经网络的推动下,已在多个学科取得重大突破,例如在计算机游戏、棋类对弈、机器人技术以及矩阵乘法和排序等高效算法开发中都展现了卓越能力。

Reflexion: Language Agents with Verbal Reinforcement Learning

本文提出 Reflexion 框架,通过让语言智能体对过去的试错经验进行口头反思(verbal reflection)并形成文本记忆,从而在无需更新模型权重的情况下实现强化学习,显著提升了其在决策、推理和编程等任务上的表现。

Kimi k1.5: Scaling Reinforcement Learning with LLMs

本文提出了一种通过强化学习(RL)扩展大型语言模型(LLM)能力的方法,其核心是利用长上下文(long context)和改进的策略优化算法,构建了一个无需蒙特卡洛树搜索等复杂技术的简化框架,从而在多项推理基准上取得了顶尖性能。

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

本文提出了一种名为直接偏好优化(DPO)的新算法,它通过一个解析性的映射关系,将传统强化学习中带约束的奖励最大化问题,巧妙地转化为一个简单的分类损失函数,从而无需显式训练奖励模型或进行复杂的强化学习,就能高效地使语言模型与人类偏好对齐。

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

本文通过大规模强化学习(无论是纯粹应用于基础模型还是结合少量冷启动数据),成功地激发并显著增强了大型语言模型的推理能力,推出了DeepSeek-R1系列模型,并验证了可以将这种高级推理能力通过蒸馏有效地迁移到更小的模型中。

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

本文提出了一种名为DAPO的强化学习算法,通过解耦裁剪范围、动态采样、Token级损失计算和超长奖励塑造这四项关键技术,成功解决了大语言模型在长思路链(long-CoT)推理任务中遇到的熵崩溃、训练不稳定和效率低下等问题,并开源了整个大规模强化学习系统。