TART:拆解多语言Agent规划塌陷,跨11种语言准确率提升5.6%
为了系统性诊断并逆转这一现象,研究团队提出了一个包含五大维度的“规划对齐失败”(Planning-Grounding Failure)分类体系,并在此基础上设计了轻量级缓解协议 TART(Taxonomy-Guided Actionable Representation)。
为了系统性诊断并逆转这一现象,研究团队提出了一个包含五大维度的“规划对齐失败”(Planning-Grounding Failure)分类体系,并在此基础上设计了轻量级缓解协议 TART(Taxonomy-Guided Actionable Representation)。
IBM:优化器针对一批训练错题提出改写提案后,必须严格在该训练批次上超过原节点得分才会被系统接纳;一旦被接纳,才会在完整验证集上计算 并向祖先节点回传分数累加 与样本计数 。如果提案未能通过初筛,算法只给祖先节点的总访问数 加一,并不污染 和 。
CRISP 提出的核心破局点是“因果证据关联”。一个工具交互步骤是否关键,不取决于它所处的位置或语法结构,而取决于它所获得的观测内容(Observation)是否在因果上直接支撑或促成了最终正确答案的生成。
来自香港大学与清华大学的研究团队提出了 PhysMind 。这套完全免训练(Training-Free)的智能体框架改变了以往直接让 VLM 端到端脑补的做法:它 为每段视频仅构建一次可复用、与具体问题无关的“可执行物理世界” ,随后借助解析动力学系统辨识。
这一结果直接穿透了此前由各类前沿大模型与递归求解器构建的成本-精度帕累托前沿(Pareto Frontier),在基准测试的经济性与计算效率上立下了新的标杆。理解 BDH-CQ 的核心,在于厘清它如何打破“上下文适应”与“隐空间深度计算”之间的长期割裂。
该研究提出了一种名为 SpeedRunner 的代码化技能归纳框架,通过将轨迹分析本身定义为编码任务,使智能体能够在纯在线(Online)交互中自动提炼、重构高阶可执行代码技能。实验表明,SpeedRunner 在保持极高任务成功率的同时,将智能体的推理 Token 消耗降低到了基线方案的 到 。
来自中国科学院与重庆大学的研究团队提出了 GeoForge ,这是一个 免微调(Training-free)、非参数化自进化的地球观测智能体框架 。该研究的核心转变在于:放弃代价高昂且难以持续迭代的模型权重微调,转而在大模型外部构建一套结构化的“三层非参数执行记忆”。
为了抹平这一因模态切换带来的能力损伤,研究团队提出了名为 CAPS (Cross-modal Agentic Policy Self-distillation,跨模态智能体策略自蒸馏)的统一训练框架。
针对这一洞察,本文提出了无需额外训练的解码算法 Ripple-Pivot Search(RPS) 。该方法不仅在空间上精确定位中熵枢纽(Where),更通过轻量前瞻评估在候选词集合中自适应搜索最优 Token(What)。
DelegSearchBench:为了从根源上确立诊断标准,论文正式提出了 委派智能(Delegation Intelligence) 的概念。在深层信息搜寻场景中,模型不应被预设为盲目开启检索的无脑搬运工,检索工具实质上是一种需要权衡调度的外部认知资源。
针对这一两难困境,字节跳动与华东师范大学的研究团队提出了全新框架 ERR+ 。与以往试图压制熵的做法不同,ERR+ 敏锐地捕捉到一个全新现象: 真正优质且正确的推理链,并不是从头到尾保持低熵,而是在探索之后发生频繁且剧烈的“熵降”(Entropy Drop) 。
针对这一长期存在的系统瓶颈,来自阿肯色大学小石城分校(University of Arkansas at Little Rock)的研究团队提出了 NeuRoute 。这项工作没有试图将哈希打造成终极检索工具,而是退后一步, 将短二进制哈希编码重构为一种极高效的“神经路由原语” 。
面对这种“个性化智能体推理”(Personalized Agentic Reasoning)挑战,格里菲斯大学与昆士兰大学的研究团队提出了强化微调框架 ODYSSE ,其核心是面向整段交互轨迹的强化学习算法 ESPO (Episode-wise Policy Optimization,剧集级策...
基于此,研究团队提出了 PowerSlider 运行时系统,通过将流水线解耦为 Prefill-Think-Answer 三阶段、引入带容忍裕度的 Flex SLO 契约,并借助极速 KKT 在线求解器在毫秒级内完成功率重分配,彻底打破了电网限电与服务质量不可兼得的死结。
来自上海人工智能实验室(Shanghai Artificial Intelligence Laboratory)等机构的研究团队提出了全新的蒸馏框架 SimpleOPD 。
针对这一困境,研究者提出了 AGT(Agentic Graph Token Reasoning,智能体图 Token 推理) 框架。这项工作的突破之处在于:它没有继续在“如何把子图压缩得更紧凑”上打转,而是从底层将图的 Token 化(Tokenization)过程重构为大模型自主推理闭环的一部分。
针对这一系统性缺陷,本文提出了 Harness-G 框架。它彻底重构了策略与检索环境之间的交互接口,将开放式的“自由写 Query”转变为在“段落-句子-实体”三部图上的“有限离散动作选择”。
针对这一问题,最新研究提出了 “听、调用、理解” (Hear–Invoke–Understand,简称 HIU )的全新范式,并开发了具备技能调度能力的多模态音频 Agent —— SpeechAgent-R 。
针对这一系统瓶颈,东北大学(Northeastern University)的研究团队提出了 InferScale 。InferScale 抛弃了在文本层(Token Layer)机械拼接记忆的做法,改为直接在注意力层(Attention Layer)进行原生 KV 注入(KV Injecti...
针对这一本质瓶颈,中国科学院自动化研究所(CASIA)多模态人工智能系统全国重点实验室(NLPR)提出了全新的物理世界模型框架 PhiZero 。PhiZero 的核心逻辑是摒弃直接在像素空间做隐式预测的旧范式,转而构建一套紧凑且离散的“物理语言(Physical Language)”。
本文提出了因果评估框架 BACKTRACE,并构建了包含逻辑推理与竞赛数学等任务的基准测试集 BACKROOMBench,横跨 Qwen、DeepSeek 以及 GPT 系列的 12 款主流模型,涵盖单智能体与多智能体系统。
北航、快手、南洋理工、港理工与莱斯特大学等机构联合提出的 Branch2Skill ,试图打破这一恶性循环。这项研究的核心直觉非常纯粹: 比起反复跑完整的长链条,不如在推理树的同前缀兄弟分支(Sibling Branches)中就地提炼正反对比 。
腾讯与厦门大学联合提出的 CommitKV 指出,现存算法的根本症结在于采用了“单点快照式”的重要性评估逻辑:当前轮次注意力权重低的上下文,不代表未来就永远用不上。将“暂时休眠”的背景事实与“已彻底完结”的工具调用混为一谈,会导致关键记忆被过早误删。
Canary:这项研究表明,工具描述中的“吹嘘”行为是一种极其危险的系统性隐患。哪怕是公认最聪明的基础模型,也会被带有“高级”、“全功能”标签的工具误导。因此,在平台层对工具的描述进行格式化清洗、限制夸大修辞,并对重叠功能的工具实行严格的颗粒度约束,应当成为基础设施建设的标准规范。