MoRSE:耶鲁破解多Agent同质化,以双层混合专家实现参数特化
针对这一瓶颈,耶鲁大学的研究团队提出了名为 MoRSE (Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts)的新型多智能体框架。
针对这一瓶颈,耶鲁大学的研究团队提出了名为 MoRSE (Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts)的新型多智能体框架。
无论是各类商业化的研究助手,还是开源社区构建的自动化研究流水线,都在尝试让大语言模型处理极其开放且复杂的调研任务。然而,这类长程(Long-horizon)任务普遍伴随着极其高昂的计算代价:智能体沿着分解出的子问题不断发起检索、抽取网页、发散分支,上下文体积呈现雪崩式膨胀。
清华大学团队提出的 OpenLoopEvolve (简称 OLE )试图从底层逻辑上改变这一现状。该研究不再把交互控制视为不可分割的代码黑盒或易受干扰的纯文本上下文,而是首次提出了可治理、可验证的“循环策略”( Loop Policy )资产概念。
该工作不仅建立了一个包含 3,000 个经过真实 API 执行验证的高质量中文测试集,更首次提出了能够实现自我迭代演进的双阶段闭环构建框架 PCCF(PluginEval Closed-Loop Construction Framework)。
为了抹平这一因模态切换带来的能力损伤,研究团队提出了名为 CAPS (Cross-modal Agentic Policy Self-distillation,跨模态智能体策略自蒸馏)的统一训练框架。
针对这一瓶颈,复旦大学、上海人工智能实验室、上海交通大学与香港科技大学联合提出了安全脚手架演化框架—— SHE (Safety Harness Evolution)。该研究首次将 Agent 的安全外围系统确立为能够通过历史执行轨迹自主迭代进化的动态系统。
” 然而,由 Eigenforma 与 Freemind Labs 联合开展的一项最新测量学审计研究表明,这套遍布生产环境的机制在回答的其实是另一个截然不同的问题:“这段文本的字面措辞改变了多少?
来自哥伦比亚大学、约翰斯·霍普金斯大学、加利福尼亚大学洛杉矶分校(UCLA)等多所高校与机构的研究团队,针对这一长期困扰业界的工程痛点,提出了 Agentic Real2Sim 框架。
AhaBench:研究团队设计了一个三联记分卡机制: 1. 初始得分(Initial Score, ) :模型在没有经验时的“冷启动”能力。2. 经验后得分(Post-Experience Score, ) :经历过相关教学、过往解题轨迹或经营历史后,在 去除了显式提示或改变了测试条件 的新环...
针对这一空白,研究人员提出了 ArbiGraph ,一个能够任意扩展、拓扑结构可控且完全可自动验证的评测基准生成器。通过将任务形式化为强类型的有向无环图(DAG),ArbiGraph 能够剥离单任务解题能力的干扰,专门诊断智能体在不同数据流拓扑下的上下文管理瓶颈。
他们提出了名为 ATLAS(Automata Learning for Agent Trajectory Analysis and Strategy Discovery)的全新框架,首次将大语言模型的语义抽象能力与形式化方法中的“自动机学习”(Automata Learning)结合起来。
针对这一症结,来自亚马逊、字节跳动、纽约大学与华盛顿大学的研究团队提出了名为 CodeRescue 的后失败恢复路由框架。该工作颠覆了“失败即升级”的固有认知,将代码执行失败后的应对机制建模为跨异构动作的决策路由,并引入共形风险控制(Conformal Risk Control, CRC)实现...
近期发表的研究提出了 EvoDRC 框架,试图打破这一僵局。该方案将大模型(LLM)驱动的智能体系统引入块级(Block-level)DRC 自动化修复,并提出了一套“技能自演化”(Skill-Evolution)机制:利用外部不相关设计冷启动初始经验,并在目标芯片的实际修复中沉淀、筛选与重构...
为了打破这一困局,来自星尘智能(Astribot)、云天励飞、聚溪科技、香港中文大学与清华大学的研究团队提出了一种名为 ART(Agentic Robot with Tool-use)的全新工具注入微调框架。
针对这一长期被忽视的瓶颈,来自香港科技大学、华中科技大学以及 Lightspeed 等机构的研究团队提出了 EvolvingWorld 。这是一个面向交互式文学世界模拟的开放架构(Open-Schema)协同演化框架与基准。
由中国科学技术大学与 Metastone Technology 联合提出的最新研究《Keep It InMind》,揭示了隐藏在几乎所有大模型记忆架构深处的“隐式关联盲区”(Implicit-Association Blind Spot)。
近期提出的黑盒自动化渗透测试框架 Know Your Agent(KYA) 首次打破了这种以 Payload 变异为中心的狭隘思路。研究表明,面对具备多步规划和工具调用能力的复杂智能体,盲猜 Prompt 的有效性会断崖式下跌;唯有像人类高级黑客一样。
面对这种“个性化智能体推理”(Personalized Agentic Reasoning)挑战,格里菲斯大学与昆士兰大学的研究团队提出了强化微调框架 ODYSSE ,其核心是面向整段交互轨迹的强化学习算法 ESPO (Episode-wise Policy Optimization,剧集级策...
伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究团队提出的 SlotGuard ,试图从根源上打破“要隐私就丧失能力”的零和博弈。该方案在本地运行时与云端模型之间构建了一道极轻量的拦截边界:它既不依赖云端合规承诺,也不搞破坏语义的粗暴打码。
为此,他们提出了 ICSD(Influence Calibration for Self-Distillation) 。在 7B 模型上,ICSD 将 ALFWorld 成功率提升至 96.1%,WebShop 得分提升至 93.1;更重要的是。
为此,作者提出了专为噪声循环设计的停止框架 VRR-Stop 以及无参数估计保底策略 VRR-Guard。在 GSM8K 压力测试下,VRR-Stop 相比固定五轮修复将最终真实有效性提升了 60.6 个百分点,平均仅消耗 0.72 轮修复就果断锁定了正确结果。
为了拨开这层迷雾,研究团队在图 2 所示的评测流中提出了一个极具穿透力的分解公式,将最终的攻击成功率解耦为两个独立子指标的乘积: {% raw %} {% endraw %} 公式中的 代表 可达率(Reachability) ,即在所有自主执行的会话中。
从地面到天空,具身智能的技术演进并非仅仅多了一个 轴的高度维度,它实质上对大模型的视点自适应选择、连续位姿动态控制和多阶段任务闭环提出了前所未有的严苛要求。MissionBench 的出现,如同一面清晰的棱镜。
针对这一困境,研究者提出了 AGT(Agentic Graph Token Reasoning,智能体图 Token 推理) 框架。这项工作的突破之处在于:它没有继续在“如何把子图压缩得更紧凑”上打转,而是从底层将图的 Token 化(Tokenization)过程重构为大模型自主推理闭环的一部分。