AGRI:大模型早知被入侵,探测潜层表征将注入成功率降至0%
基于此,作者团队提出了一种轻量且高效的防御范式 AGRI(Action-Guiding Reasoning Intervention),通过实时探测模型的隐层状态动态激活思维链干预,在极难的 AgentDojo 基准上,直接将多个前沿开源模型的注入攻击成功率(ASR)压缩至接近 0%。
基于此,作者团队提出了一种轻量且高效的防御范式 AGRI(Action-Guiding Reasoning Intervention),通过实时探测模型的隐层状态动态激活思维链干预,在极难的 AgentDojo 基准上,直接将多个前沿开源模型的注入攻击成功率(ASR)压缩至接近 0%。
来自上海交通大学的研究团队提出了名为 ABC(Answer-Backtracked Credit Assignment,答案倒推信用分配) 的全新框架,并基于 Qwen3.5-4B 训练出了长程搜索智能体 ABSeeker 。
为了攻克这一难题,来自韩国科学技术院(KAIST)与 DeepAuto.ai 的研究团队提出了一种无需重新训练参数的全新框架:Agent Memory Distillation(AMD,智能体记忆蒸馏)。
为了打破单次判决的局限,来自南京大学、南洋理工大学与新加坡管理大学的研究团队提出了 AgentAntibody 。该工作借鉴生物学中的自适应免疫系统(Adaptive Immune System),首次为大模型智能体建立了一套不依赖模型微调、跨任务持续演进的运行时免疫记忆。
针对这一根本隐患,研究团队提出了 观察校准自蒸馏(Observation-Calibrated Self-Distillation, OCSD) 。该方法通过构建两套结构完全对齐、仅差真实环境观测的回放视图,精准剔除回放脚手架引起的固有偏移,提取出纯粹的“环境观察残差”。
来自范德堡大学(Vanderbilt University)的研究团队提出了名为 PMCoder 的软件修复智能体,核心机制在于将分层阶段规划器(Hierarchical Phase Planner)与情境记忆(Episodic Memory)进行深度双向耦合。
针对这一核心断层,Meta AI 联合伊利诺伊大学厄巴纳-香槟分校(UIUC)提出了 EvoHarness-RL 框架。这项研究不再把外部支架看作不可修改的环境包装或静态脚手架,而是将其抽象为可由策略直接调度的元动作空间。
为此,研究团队设计了一套可执行的合成任务生成引擎,并提出了 Fisher-R1 智能体训练范式。该框架从统计检验方法、应用领域情境、样本规模、效应量大小、提示词风格和随机种子六个正交维度出发,程序化生成了 8,642 个包含可执行数据生成过程(DGP)的合成任务,并人为注入了缺失值与极端异常点。
基于这一观察,作者提出了名为探针过滤引导训练(Probe-Filtered Bootstrapped Training, PBT)与探针引导重排(Probe-Guided Reranking, PGR)的完整框架,并构建了难度分级的真实评测基准 ParamBench。
为了精确刻画风险在系统内部渗透的深度,HarnessSafe 提出了一套基于客观执行证据的七阶段评估阶梯(N0 到 N5b): N0(未接触) :系统在执行中甚至未与受污染的载体表面产生任何交互; N1(接触未驻留) :系统读取或接触了注入入口,但未将其写入持久化载体。
针对这种“高开销”与“信息丢失”的死锁,合肥工业大学的研究团队提出了轻量级长期记忆框架 LeanMem。该方案的核心洞察在于: 人类对话产生的信息天然具有异构性,试图用单一、均匀的“摘要-检索”流水线去处理所有对话历史,在底层逻辑上就是行不通的。
针对这一瓶颈,研究团队提出了全局化技能演化框架 GSE ( Globalized Skill Evolution )。该方案不再将技能视为孤立文本的线性堆叠,而是引入 技能关系图 ( Skill Relation Graph , SRG )来显式建模与协同演化技能间的依赖、共用与冲突。
由北京邮电大学、复旦大学、南洋理工大学、北京大学、上海交通大学等多所高校联合提出的最新研究 MemPrism ,指出了一个长期被忽视的底层瓶颈: 检索后表征失配(Post-retrieval Representation Mismatch) 。
为了厘清这一因果机制,研究人员构建了专门面向持久化个人 Agent 的归因基准 PAST-Bench,并在其诊断指导下设计了增强运行时框架 Hermes+。这项研究不仅揭示了当前主流大模型与智能体框架在跨会话经验复用上的严重失衡。
与以往只在玩具数据集或单机沙盒中跑代码的 Agent 不同,RecEvolve 直接接入了分布式仓储计算集群与生产级版本控制系统,端到端接管了“提出假设、编写代码、拉起分布式训练、指标评估到沉淀经验”的完整研发闭环。
来自美国东北大学与明尼苏达大学的研究团队提出了全新解决方案 SparseDitto 。该系统将大语言模型(LLM)的开放代码生成能力与基于真实硬件测量的闭环反馈相结合,为任意给定的稀疏矩阵、算子和目标 GPU 动态定制最优的底层 CUDA 内核。
针对这一痛点,康考迪亚大学(Concordia University)的研究团队提出了 StepReflect。这项工作打破了“用昂贵前沿大模型做开放式单步反思”的传统路径,首次将移动界面的单步动作反思形式化为一种 基于显式状态转移规格与视觉证据对齐的监督结构化预测问题 。
在这一步,SynthEx 彻底抛弃了易造成格式错误或化学语义模糊的传统反应 SMILES 文本,创新性地提出了 ReactionJSON 结构化表达机制。在 ReactionJSON 中,化学反应不再被视作死板的字符串匹配,而是被形式化定义为一组原子级别的图编辑操作(Graph Edits)。
面对“又要低延迟响应、又要小时级记忆、还要主动警觉”的“不可能三角”,研究团队提出了 StreamMind。其核心系统哲学非常明确: 不能把长时间尺度的记忆沉淀与复杂推理,堆死在用户交互的延迟敏感路径上。
针对这一痛点,来自南洋理工大学、中山大学与腾讯的研究团队提出了统一记忆管理框架 VerMem (Verifiable Memory)。该工作打破了长短期记忆的割裂设计,通过一个统一的策略网络调度 7 种原子级记忆操作。
针对这一严峻挑战,来自香港城市大学、伦敦大学学院(UCL)、小米集团以及浙江大学的研究团队正式提出了 ActBench 。这是首个专门针对协同智能体“行为安全”(Behavioral Safety)的自演化评测基准。
来自 KAIST、首尔大学、伦敦大学学院(UCL)、阿姆斯特丹大学、海法大学与耶鲁大学的研究团队提出了首个端到端自动化开展 AI Agent 行为科学研究的多智能体系统 AEROBAT (Automated Experimental Research on Behaviors of AI Ag...
MobileJudgeBench:研究团队提出的第一个现实检验场景是: 裁判质量的提升,是否能真实保全 Agent 之间的排名关系?如果在基准测试中,裁判给出略带偏差的分数,是否会导致排行榜名次完全颠覆?
通过引入阿里真实的跨境贸易数据、构建涵盖 60 多种真实经营行为的 MCP 工具链,并结合基于贝叶斯策略的上限对齐与状态分叉因果归因,Business Arena 为下一代面向真实经济生产力的 Agent 训练提供了极为珍贵的高密度反馈信号。