ADRS:阿里提出自蒸馏奖励重塑,破解Agent长程强化学习信用分配难题
来自阿里巴巴和中国科学技术大学的研究团队在最新论文中提出了 ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping) 。
来自阿里巴巴和中国科学技术大学的研究团队在最新论文中提出了 ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping) 。
针对这一困境,美团、清华大学与浙江大学的研究团队提出了 AgentOPSD 。该方法不增加任何独立的 Critic 价值网络,也不引入额外的环境采样交互(Rollouts),而是通过在对数几率(Log-odds)空间内递推更新贝叶斯信念状态,将稀疏的轨迹级奖励重塑为细粒度的轮次级信用。
为了系统性诊断并逆转这一现象,研究团队提出了一个包含五大维度的“规划对齐失败”(Planning-Grounding Failure)分类体系,并在此基础上设计了轻量级缓解协议 TART(Taxonomy-Guided Actionable Representation)。
来自北京通用人工智能研究院(BIGAI)与北京大学的研究团队在最新工作中,通过构建动态评测基准 ContinualSkillBench ,对这一假说进行了严格检验。
CRISP 提出的核心破局点是“因果证据关联”。一个工具交互步骤是否关键,不取决于它所处的位置或语法结构,而取决于它所获得的观测内容(Observation)是否在因果上直接支撑或促成了最终正确答案的生成。
他们提出的 HLSmith 框架将 C 到 HLS 的转换重新定义为“硬件微架构演进”,而非单纯的“代码翻译”。该框架不仅提炼了硬件专家优化技巧并将其模块化、守卫化(guarded recipes),还通过分阶段编译反馈与模型适配策略,让 LLM 能够像资深硬件工程师一样逐步重构代码。
由中国科学院空天信息创新研究院、目标认知与应用技术重点实验室以及上海交通大学人工智能学院等机构组成的研究团队,提出了名为 Lingjing (灵境)的开放城市异构多智能体具身仿真评测平台。
为此,研究团队提出了“以智能体为中心的世界代理”(Agent-Centric World Proxy)这一新范式,将世界模型从单调的“物理状态预测器”升级为能够处理执行、记忆、技能与校验的“信息状态转移器”。
为了打破这一僵局,研究团队提出了轻量级的句子级检测框架 CAD (Context-Aware Detection,上下文感知检测)。CAD 不仅通过联合建模用户查询、上下文及目标句子的边缘影响来判断其恶意程度。
这项工作提出了首个专门评估渐进式披露机制下智能体技能调用能力的基准—— Skill-Use 。在覆盖 9 大领域的 177 个真实任务测试中,即便集结了业内最顶尖的前沿模型(包括 GPT-5.5、Claude Opus 4.8 等),最强组合下的综合技能使用评分(SU Score)也仅达到 。
来自南开大学的研究团队提出了 SkillConsist,专门针对 Agent 技能包中“文档声明”与“代码实现”的一致性检测与代码级精确定位。该研究跳出了过去将文本与代码做简单匹配或死板套用安全分类树的思路。
针对这一顽疾,来自微软、不列颠哥伦比亚大学、加州大学圣迭戈分校与中国科学技术大学的研究团队提出了名为 SkillHEX 的全新闭环自演化框架。该方案打破了传统的单线盲目试错范式,将科学研究中的“假设检验”思想引入技能排错,并结合非对称的树搜索机制。
为了从根本上消除这种被称为“记忆污染(Memory Pollution)”的退化现象,作者团队提出了 TEPA。这套机制改变了以往只管存入、不管注销的记忆范式,将“先例(Precedent)”的有效性(Validity)升级为记忆生命周期中的显式状态。
针对这一困境,研究人员提出了 TraceCompiler 。这项工作的核心构想是将 Agent 在多次探索中留下的嘈杂、混乱的执行轨迹(Traces),通过无监督聚类、行为去噪和严格的数据流依赖分析,“离线编译”为结构清晰、高确定性且可直接执行的工作流代码。
来自亚利桑那州立大学(ASU)、卡耐基梅隆大学(CMU)与南加州大学(USC)的研究团队联合提出了 WeClawArena 。这是首个面向以人为中心的智能体网络、针对跨用户私有工作区协作与安全性展开全链路评测的可审计基准与运行时沙箱。
为了解开这个黑盒,来自微软、南京航空航天大学、合肥大学与鹏城实验室的联合研究团队提出了 SkillSV (Structure-Aware Shapley Valuation)。该框架首次将结构感知引入博弈论中的 Shapley 值定价体系,把复杂的技能文档编译为受约束的合作博弈结构。
该研究提出了一种名为 SpeedRunner 的代码化技能归纳框架,通过将轨迹分析本身定义为编码任务,使智能体能够在纯在线(Online)交互中自动提炼、重构高阶可执行代码技能。实验表明,SpeedRunner 在保持极高任务成功率的同时,将智能体的推理 Token 消耗降低到了基线方案的 到 。
研究提出了一个名为 WarehouseReliabilityBench(WRB)的全新评测基准,并设计了一个名为 QueryProof 的 7B 级别分析 Agent。
为此,他们提出了 叙事承诺保持 (Narrative Commitment Preservation,简称 NCP)的形式化框架,并构建了包含 100 个基于经典电影情节的环境基准 NCP-Bench 。评测结果揭示了一个残酷的事实:文笔出众并不等于具备长程逻辑鲁棒性。
针对这一脱节现状,来自华为技术有限公司与伦敦玛丽女王大学的研究团队提出了专门针对电信网络排障能力的智能体基准评测集 CTBench 。这项包含 234 个由一线电信专家深度构建与验证的任务评测揭示了一个耐人寻味且值得警惕的现实:当前最前沿的智能体组合在简单的端点识别上表现亮眼。
来自中国科学院与重庆大学的研究团队提出了 GeoForge ,这是一个 免微调(Training-free)、非参数化自进化的地球观测智能体框架 。该研究的核心转变在于:放弃代价高昂且难以持续迭代的模型权重微调,转而在大模型外部构建一套结构化的“三层非参数执行记忆”。
GitSkills:就在这套极简规范提出短短 9 个月后,来自英国伦敦大学学院(UCL)、德国霍恩海姆大学与意大利卡利亚里大学的联合研究团队展开了一次全面地毯式普查。结果令人震惊:仅仅在 GitHub 的公开仓库中,就已经散落着数以百万计的 。
针对这一结构性缺陷,这篇研究提出了 MAP-Graph (Provenance-Aware Shared Memory)。其核心思想可以概括为一句话: 检索不等于授权(Retrieval is not authorization) 。
针对这一困境,研究团队提出了 MESA (Multi-structure Evidence Selection framework for long-horizon Agent)。