强化学习 第2页

SeekJudge:解耦定位与提取,首个在强化学习中超越规则奖励的智能体裁判

在图形用户界面(GUI)中执行长流程任务的计算机操作智能体(Computer-UseAgents,CUA),正在成为大模型走向通用落地的关键路径。然而,在这个充满未知动作与动态界面的领域中,强化学习(RL)长期受困于一个底层瓶颈:系统如何客观判定智能体的一长串操作到底有没有真正完成人类的意图?

WCM:把世界模型塞进Critic,让具身VLA在149项任务上击败全量SFT

在视觉-语言-动作(VLA)模型的后训练阶段,强化学习(RL)正在成为突破模仿学习天花板的关键路径。然而,当前主流的Actor-Critic范式在机器人操控任务中遭遇了一个隐蔽却致命的瓶颈:大多数Critic模型要么只基于单帧视觉观测,要么直接依赖预训练VLM的单帧隐层特征来估计状态价值。

清华等提出 TideRL:就绪感知破除 Agent 强化学习死等,训练吞吐提升 5.6 倍

大语言模型(LLM)正迅速从“单轮对话的文本生成器”迈向“多轮自主行动的智能体(Agent)”。在浏览网页(WebArena)、操控操作系统(OSWorld)或执行复杂代码任务时,模型需要不断输出动作指令、调用工具或系统API,并在等待外部环境反馈后将新的观察结果追加进历史上下文,开启下一轮推理。

LEGO-RL:无缝桥接代码脚手架与强化学习,SWE-bench达70.4%!

随着大模型在复杂软件工程任务中的应用日益深入,针对代码智能体(CodingAgents)的强化学习正在成为前沿焦点。这类智能体在执行任务时,高度依赖长时间运行的智能体脚手架(AgentHarnesses)来管理工具集成、代码仓库上下文以及执行反馈。

Google DeepMind提出ResidencyRL:多轮RL训练临床AI,遗漏风险降低31%

在现实世界的医学教育中,医学生将书本上的学术知识转化为真正的临床专业能力,必须经历漫长而高压的住院医师规范化培训阶段(Residency)。在这个过程中,他们需要在数千次真实的医患互动中积累经验,接收来自上级医生和患者的多样化反馈,并逐渐承担更大的独立决策权。

OpenForgeRL:破解Agent端到端强化学习难题,GUI基准达72.3

在当今的人工智能前沿,顶尖的AIAgent(智能体)极少只是一个“裸”的大语言模型或视觉语言模型。为了在复杂的真实环境中执行诸如软件开发、网页浏览和日常工具调度等任务,这些模型通常会被包裹在一个极其复杂的推理框架(InferenceHarness)中。

TCER:相对信息增益破解平庸偏置,阿里无监督强化学习新突破

在当今大语言模型(LLM)的训练范式中,对齐技术已经成为决定模型最终表现的胜负手。在有监督微调(SFT)阶段之后,强化学习微调(RFT)被广泛用于进一步优化模型行为。然而,当我们把目光从数学推理或代码生成转向开放式文本生成(如长文写作、创意生成)时,强化学习面临着一个极为棘手的瓶颈:缺乏可验证...

自动搜索奖励函数!单卡40小时跑通GRPO闭环,模型F1提升0.19

最近,强化学习(RL)在提升大型语言模型(LLM)复杂推理能力上的表现令人瞩目。特别是DeepSeekMath引入的组相对策略优化(GRPO)算法以及后续引发热潮的各类推理模型,证明了后训练(Post-training)阶段不仅能让模型学会说话,还能让模型学会思考。

SEED:自我进化同策略蒸馏,40%数据即可匹敌全量强化学习

随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。

打破大模型推理天花板:DSRL双空间强化学习,反思能力暴涨14倍

以DeepSeek-R1为代表的卓越模型,将基于可验证奖励的强化学习(RLVR)推向了整个行业的聚光灯下。然而,这种后训练范式隐藏着一个不容忽视的致命瓶颈。它通过优化条件分布来提升推理能力,这意味着其潜力被基座模型现有的输出分布严格锁死。

告别手写规则:离线强化学习让LLM Agent自主掌控工作流

现阶段在开发大语言模型智能体时,开发者们往往将绝大部分精力投入于调优提示词、微调模型,或是费力编写错综复杂的固定代码逻辑。这些包围在模型外围的代码框架,被称为外围控制层(Harness),它决定了Agent何时观察环境、何时调用工具、何时进行反思以及何时输出最终答案。

统治大模型的RLHF完美吗?深度揭秘其3大环节的核心缺陷

当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。

阿里Qwen深度技术解密:3万亿Token与全面对齐的工程实践

大语言模型赛道早已不再是简单的参数堆砌游戏。如何在复杂的逻辑推理、代码生成与工具调用上硬刚闭源巨头?阿里云正式披露了其大规模语言模型系列的核心技术细节。该研究推出的Qwen模型不仅在基础通用能力上表现惊艳,其实验室数据的详细披露更是干货满满。本文将深入解析其背后的预训练机制、上下文扩展技巧及强...

RAGEN-2揭秘:打破Agent强化学习“模板坍塌”,SNR过滤机制破局

当你满怀期待地用强化学习训练多轮大语言模型Agent时,监控大屏上的指标可能正在欺骗你。通常业界习惯用“熵”来衡量模型推理的多样性与稳定性。当熵稳如泰山时,你以为模型正在积极探索不同的解题路径。然而在实际测试中,Agent却常常表现得像一个背诵万能公式的机器人。

ReSum揭秘:大模型学会自我总结,推理提升4%且输出缩减18%

最近,强化学习在大语言模型复杂任务中大放异彩。但随之而来的是一个恼人的副作用:模型极易陷入过度思考。它们生成的推理链条越来越长。这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。甚至让模型陷入重复验证同一子问题的死循环。针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。

告别纯反应式VLA:全面解析机器人世界模型进化密码

当前具身智能与机器人学习正经历一场深度的范式革命。以往大放异彩的视觉-语言-动作模型(Vision-Language-Action,VLA)正逐渐暴露出其在物理世界中的局限性。以直接将多模态观察映射为底层动作为核心,这些模型本质上仍是“纯反应式”的系统。

Evaluating Parameter Efficient Methods for RLVR

LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。