ADRS:阿里提出自蒸馏奖励重塑,破解Agent长程强化学习信用分配难题
来自阿里巴巴和中国科学技术大学的研究团队在最新论文中提出了 ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping) 。
来自阿里巴巴和中国科学技术大学的研究团队在最新论文中提出了 ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping) 。
针对这一困境,美团、清华大学与浙江大学的研究团队提出了 AgentOPSD 。该方法不增加任何独立的 Critic 价值网络,也不引入额外的环境采样交互(Rollouts),而是通过在对数几率(Log-odds)空间内递推更新贝叶斯信念状态,将稀疏的轨迹级奖励重塑为细粒度的轮次级信用。
针对这一瓶颈,研究者们提出了 OAT (Ordered Action Tokenization,有序动作离散化)。OAT 的核心洞察在于,一个优秀的机器人动作分词器不能仅仅充当离线的无损压缩工具,而必须成为深度契合策略生成与监督特性的“交互接口”。
为此,他们提出了 ICSD(Influence Calibration for Self-Distillation) 。在 7B 模型上,ICSD 将 ALFWorld 成功率提升至 96.1%,WebShop 得分提升至 93.1;更重要的是。
针对这一本质缺陷,本文提出了对比强化策略优化(Contrastive Reinforced Policy Optimization,简称 CRPO)。CRPO 彻底跳出传统蒸馏单纯拟合分布的旧思路,将智能体自蒸馏重构为一个对比学习问题。
为此,本文提出了 HL-Gauss PPO :彻底放弃标量的 MSE 回归头,改用带有高斯平滑的离散分类头来学习价值分布,最后仅通过求期望还原出标量值供 PPO 使用。
为了打破这一僵局,来自新加坡政府技术局(GovTech)、哈尔滨工业大学与新加坡管理大学的研究团队提出了 VulAgentRL。该框架没有盲目依赖更长的上下文窗口去粗暴内联调用图,而是将漏洞挖掘形式化为一个具备主动工具探索能力的智能体强化学习任务。
来自 ELLIS、UIUC、Together AI 以及德克萨斯大学奥斯汀分校等机构的联合研究团队,在最新论文中揭开了这一缺失的优化层,并提出了一种专为后训练量身定制的新范式:等谱优化(Isospectral Optimization,简称 ISO)。
最新提出的 PATS (Policy-Aware Training Scaffolding)框架提供了一种截然不同的解法:它不再把外部技能当成推理资产,而是将其重构为 随模型能力演化、在部署时完全剥离的“动态训练脚手架” 。
针对这一核心痛点,来自阿里巴巴集团、厦门大学、浙江工商大学和浙江大学的研究团队提出了 Search2Skill 框架。该研究一改过去闭门造车式的反思路线,转向“向外看”(Outward-Looking)的主动探索机制:让模型在感知到自身能力短板时主动调用外部搜索。
Ant:作者将这一现象形式化为 奖励公平性问题(Reward Fairness Problem) ,并提出了系统性的解决方案 ARC(Advantage Regularization via Conditioning) 。
团队提出了 GCPO(Geometrically Constrained Policy Optimization,几何约束策略优化) ,通过在参数空间施加严格的双侧正交硬约束,阻止强化学习梯度破坏预训练模型的关键流形结构。
针对这一困境,来自美团、新加坡国立大学(NUS)、上海交通大学与浙江大学的研究团队提出了一套端到端强化学习框架—— SkillRise 。这项工作摒弃了复杂的外部记忆库与检索中介,仅用 单一策略 在连续递进的任务序列中交替执行“任务求解”与“技能文档提炼”,并提出了跨任务解耦的信用分配机制。
针对这一根本性矛盾,来自微软亚洲研究院与北京大学的研究团队提出了一种名为 BCP(Bernoulli-Continuation Policy) 的轻量级即插即用框架。
近期来自清华、北大、复旦、浙大等机构的研究团队提出了一种解耦机制 FACTOR (Factorizing Action Credit and Token Responsibility),直击当前多轮 Agent 强化的隐性缺陷。
令人震撼的实验结果表明:仅依靠一个经过训练的 7B 参数轻量模型(Qwen2.5-7B-Instruct),Trident 就让当前最顶尖的 DRL 蓝队防御性能平均断崖式暴跌 522%,并自主涌现出诸如规避蜜罐诱饵、自适应关键节点优先渗透等高阶攻击行为。
研究团队借鉴自监督学习(Self-Supervised Learning, SSL)“从无监督数据中构造辅助代理任务(Pretext Task)以获取标签”的核心思想,提出了 RLSVR(Reinforcement Learning with Self-Verifiable Rewards) 框架。
在此诊断之上,团队提出了带有硬件感知稀疏特性的残差量化机制 Rollout-ResQ,并结合三级层次缩放的 HiFloat4(HiF4)格式,在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,将全链路 FP4 与全精度 BF16 的准确率差距从 4.9% 缩小至仅 1.1%。
研究者从理论上严格证明了 Token 级与轮次级强化学习在策略梯度目标上的数学等价性,并在此基础上提出了全新的 HyGAE 框架。该框架不仅巧妙融合了两者的优势估计,还通过理论证明消解了训练两个独立价值网络的算力负担。
针对这一困境,华南理工大学的研究团队提出了 CoRL(Co-Evolutionary Reinforcement Learning)框架,尝试从博弈论和动态演化的视角彻底重塑防御体系。
针对这一根本隐患,研究团队提出了 观察校准自蒸馏(Observation-Calibrated Self-Distillation, OCSD) 。该方法通过构建两套结构完全对齐、仅差真实环境观测的回放视图,精准剔除回放脚手架引起的固有偏移,提取出纯粹的“环境观察残差”。
为此,研究团队设计了一套可执行的合成任务生成引擎,并提出了 Fisher-R1 智能体训练范式。该框架从统计检验方法、应用领域情境、样本规模、效应量大小、提示词风格和随机种子六个正交维度出发,程序化生成了 8,642 个包含可执行数据生成过程(DGP)的合成任务,并人为注入了缺失值与极端异常点。
为了解决这种典型的“模型不匹配”(Model-Mismatch)难题,来自哈工大、上海人工智能实验室、上海交通大学以及清华大学的研究团队提出了 SKILLER 。
研究团队提出了名为 SocialRL 的完整训练架构,仅用一个 4B 参数规模的小语言模型,在六大典型博弈环境中展开训练。实验结果表明,经过领域内博弈训练的 4B 模型不仅在多项谈判指标上超越了未微调的基线,甚至在平均效用上追平了 GPT-4.1 以及 GPT-5 系列模型。