LoongReflect:把反思做成内存控制,长程Agent检索基准提升12.6分
为此,研究团队提出了全新的训练框架 LoongReflect 。该方法跳出了将反思视为自由文本批判的传统思路,将反思形式化为一种显式的 内存控制策略(Memory-Control Policy) 。
为此,研究团队提出了全新的训练框架 LoongReflect 。该方法跳出了将反思视为自由文本批判的传统思路,将反思形式化为一种显式的 内存控制策略(Memory-Control Policy) 。
这项来自 Anthropic 与 EPFL 的先驱性研究给行业敲响了警钟:在构建大规模自主多智能体系统时,安全框架绝不能仅停留在单体模型的输入输出过滤与工具权限白名单上。
针对这一困境,研究团队提出了首个以智能体玩家模拟人类闭环交互的世界模型评测基准——PlayWorld。该基准构建了 171 个带有明确长程目标的交互场景,引入具备多模态感知能力的 Agent Player 实时调整控制策略,并设立了多维度的视觉问答打分规程(VQA Rubric Verifier)。
为了系统衡量这种穿越任务周期的暗流,研究团队搭建了首个贯穿“生成—检索—执行”全生命周期的评估套件 SkillMisevo-Gym 与基准 SkillMisevo-Bench,并提出了一套即插即用的防御封装方案 SafeEvolve。
针对这一瓶颈,来自东方理工大学、上海交通大学与西安交通大学的研究团队提出了 ReCache 。该框架通过三大递进机制打破了工具调用的缓存困局:用“资源级注意力”切断不同工具之间的横向交互,赋予每个工具完全独立的局部坐标,使其 KV 块具备天然的组合不变性。
针对这一落地痛点,来自亚马逊(Amazon)的研究团队提出了名为 BENCH2ROBUST 的通用注入评测与训练框架。该研究的核心价值在于两点:首先,它打破了传统随机注入噪声的含糊性,构建了“场景可控求解度”(Scenario-Controlled Solvability)。
针对这些根本缺陷,来自 MBZUAI、麦吉尔大学等机构的研究团队提出了 SCAFFOLD 框架。通过多实例参数化抽象、递归组合、基于最小描述长度(MDL)的库压缩,以及周期性的权重蒸馏,SCAFFOLD 彻底打通了从“动作轨迹”到“深层程序抽象”再到“模型内生能力”的自进化闭环。
针对这一问题,本文提出了无需额外训练的推理期框架 Second Thought 。该方案巧妙地在每个 Thought 阶段收尾的瞬间分叉出 4 个轻量级辅助分支,利用执行与等待环境反馈的时间差并行推演,并在 Observation 抵达时瞬间回收成果、拼入上下文。
针对这一矛盾,上海交通大学的研究团队提出了一种名为 ReTree 的自纠错树状工作记忆机制。ReTree 并没有将搜索历史简单视为线性文本流或单向压缩的草稿,而是将搜索过程建模为带有依赖演化关系的证据树。
来自微软研究院和东北大学的研究团队在最新论文中提出了一个跳出传统思路的解法: SHAPER 。该框架指出,现代具身智能体本质上是一个围绕基座模型构建的复杂系统,其执行表现不仅由模型权重决定,更受外部程序化指导(技能 Skill)以及上下文组织代码(脚手架 Harness)的直接制约。
针对这一困境,来自北京邮电大学、哈尔滨工业大学、北京大学与腾讯的研究团队提出了 ToolHazard ——一个能够端到端、规模化合成可执行有状态对抗环境的自动化框架。
清华大学与蚂蚁集团的联合研究团队指出了现有记忆基准的这一结构性盲区,并提出了全新的评测基准 TANGLE (Testing Agents’ Navigation of Genuine, Latent, and Entangled Memory Conflicts)。
针对这一前沿交叉地带,一项名为 ABLE (Agentic BAIM–LLM Evaluation)的评估基准正式提出。该基准专门设计用于测试大模型智能体调用专业生物 AI 工具完成蛋白质设计全流程的能力。
针对这一瓶颈,该团队提出了 AutoMem ——一个基于“文本梯度”(Text-Gradient)递归自优化的自动化记忆架构搜索框架。该方法将记忆系统解耦为编码(Encode)、存储(Store)、检索(Retrieve)和管理(Manage)四个核心维度,并通过反思累积与失败归因,让智能体在...
为了兼顾环境的逼真度与评测的完全可控性,E-Bench 采取了“全合成(Fully Synthetic)”的底层设计方案,并提出了核心原则: 将环境合成与任务合成彻底解耦 。许多传统合成评测往往采用“为任务定制快照”的做法,每个问题只拼装一组恰好够用的局部模拟数据。
由蚂蚁集团、北京邮电大学与中国移动研究院联合提出的 HiSkill 框架,为这一难题提供了一套系统性的图结构解决方案。该研究打破了将经验视为纯文本片段的传统范式。
研究者从理论上严格证明了 Token 级与轮次级强化学习在策略梯度目标上的数学等价性,并在此基础上提出了全新的 HyGAE 框架。该框架不仅巧妙融合了两者的优势估计,还通过理论证明消解了训练两个独立价值网络的算力负担。
这一发现为当下狂热的 Agent 架构设计泼了一盆清醒的冷水。要把一本数十万字的长篇书籍交给 Agent 解答,工程上有多种不同的组织形态。以往的经验分享往往将文件切分颗粒度、目录索引存放位置与递归深度混为一谈。
为了解决长程机器学习工程中的上下文膨胀与搜索效率低下问题,来自佐治亚理工学院(Georgia Institute of Technology)的研究团队提出了名为 Matryoshka Agent 的全新分层智能体框架。
作者团队提出了模型无关的中间件协议 MemTX ,首次将数据库经典的事务机制、隔离级别与信念提交管线引入智能体记忆架构,实现从未成熟记忆到动作执行、再到撤销级联修复的全生命周期治理。
华为与独立研究者共同提出的 SAP(State-Guided Data Synthesis with Argument Provenance) 框架,正是为了补齐这块拼图。
来自新加坡国立大学(NUS)、Sea AI Lab 等机构的研究团队提出了名为 STP(State Transition Pretraining,状态转移预训练) 的全新扩展范式。该方法巧妙地绕开了对端到端任务指令的依赖,将现存轨迹拆解为最底层的单步视觉状态转移三元组 。
针对这一系统性难题,该研究团队提出了 Self-speculating Agent(自推测智能体) 。他们放弃了外部小模型,直接让部署的目标智能体自身兼任“推测者”,在单一模型内通过联合强化学习(Joint Agent-Speculator RL)同时学会“任务解决”与“自我预测”。
清华大学与北京邮电大学的研究团队打破了这种“预训练管通用常识,后训练才学工具调用”的惯性思维,提出了名为 SPT (Skill Pre-Training)的中间训练(Mid-Training)范式。