强化学习

AgentOPSD:清华美团提出递归自蒸馏,ALFWorld成功率达89.1%

针对这一困境,美团、清华大学与浙江大学的研究团队提出了 AgentOPSD 。该方法不增加任何独立的 Critic 价值网络,也不引入额外的环境采样交互(Rollouts),而是通过在对数几率(Log-odds)空间内递推更新贝叶斯信念状态,将稀疏的轨迹级奖励重塑为细粒度的轮次级信用。

VulAgentRL:以代码图为验证器,7B模型跨过程漏洞检测超越Opus

为了打破这一僵局,来自新加坡政府技术局(GovTech)、哈尔滨工业大学与新加坡管理大学的研究团队提出了 VulAgentRL。该框架没有盲目依赖更长的上下文窗口去粗暴内联调用图,而是将漏洞挖掘形式化为一个具备主动工具探索能力的智能体强化学习任务。

SkillRise:单一策略边解题边进化技能,智能体RL性能提升达8.5%

针对这一困境,来自美团、新加坡国立大学(NUS)、上海交通大学与浙江大学的研究团队提出了一套端到端强化学习框架—— SkillRise 。这项工作摒弃了复杂的外部记忆库与检索中介,仅用 单一策略 在连续递进的任务序列中交替执行“任务求解”与“技能文档提炼”,并提出了跨任务解耦的信用分配机制。

Trident:不是防御不够强,而是7B模型把DRL安全防线击溃522%

令人震撼的实验结果表明:仅依靠一个经过训练的 7B 参数轻量模型(Qwen2.5-7B-Instruct),Trident 就让当前最顶尖的 DRL 蓝队防御性能平均断崖式暴跌 522%,并自主涌现出诸如规避蜜罐诱饵、自适应关键节点优先渗透等高阶攻击行为。

华为HiFloat4:首个端到端FP4强化学习,将BF16差距缩至1.1%

在此诊断之上,团队提出了带有硬件感知稀疏特性的残差量化机制 Rollout-ResQ,并结合三级层次缩放的 HiFloat4(HiF4)格式,在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,将全链路 FP4 与全精度 BF16 的准确率差距从 4.9% 缩小至仅 1.1%。

HyGAE:统一Critic兼顾Token与轮次,多轮VLM决策胜率达到91%

研究者从理论上严格证明了 Token 级与轮次级强化学习在策略梯度目标上的数学等价性,并在此基础上提出了全新的 HyGAE 框架。该框架不仅巧妙融合了两者的优势估计,还通过理论证明消解了训练两个独立价值网络的算力负担。

Fisher-R1:用可验证强化学习终结大模型统计推断假象,复杂任务提升26%

为此,研究团队设计了一套可执行的合成任务生成引擎,并提出了 Fisher-R1 智能体训练范式。该框架从统计检验方法、应用领域情境、样本规模、效应量大小、提示词风格和随机种子六个正交维度出发,程序化生成了 8,642 个包含可执行数据生成过程(DGP)的合成任务,并人为注入了缺失值与极端异常点。

SocialRL:微软用强化学习把4B小模型训成谈判专家,博弈表现追平GPT-5

研究团队提出了名为 SocialRL 的完整训练架构,仅用一个 4B 参数规模的小语言模型,在六大典型博弈环境中展开训练。实验结果表明,经过领域内博弈训练的 4B 模型不仅在多项谈判指标上超越了未微调的基线,甚至在平均效用上追平了 GPT-4.1 以及 GPT-5 系列模型。