微软提出OEO:自进化Agent无需预设流程,GPT-5.5在线编排省下65%交互Token
为此,他们提出了一种名为 OEO (Open-Ended Optimization,开放式优化)的极简范式:框架仅负责严格锁定目标、预算、权限和评测红线,而把“何时收集证据、如何诊断失败、提出何种粒度的修改以及何时停止”的全部过程控制权,彻底交给前沿优化器在线自主编排。
为此,他们提出了一种名为 OEO (Open-Ended Optimization,开放式优化)的极简范式:框架仅负责严格锁定目标、预算、权限和评测红线,而把“何时收集证据、如何诊断失败、提出何种粒度的修改以及何时停止”的全部过程控制权,彻底交给前沿优化器在线自主编排。
为了打破被动排名的局限,Meta 提出了名为 Shape Your Feed (简称 SYF )的大模型主动推荐系统。该系统让大语言模型扮演结构化控制器的角色,构建了包含感知、在线服务与自我进化的三层架构,打通了用户显式意图到传统重排流水线的端到端链路。
针对这一问题,该研究提出了包含 61,228 个技能的新基准 SkillReason-Bench ,并设计了名为 SkillReason 的双阶段推理增强框架。
针对这一长期记忆难题,来自北京大学的研究团队提出了 SodaMem 。该工作将 Agent 的长期记忆重新定义为一种强证据溯源的时序知识图谱(Evidence-Grounded Temporal Graph Memory)。
面对这一困局,来自阿里巴巴和清华大学的研究团队提出了全新的解决思路: State2State 。这项研究不再纠结于“如何让人类或更强的大模型生成更多任务”,而是退回智能体交互的最本质关系——智能体与环境。
这项研究正式提出了“多步间接提示注入”攻击范式,并开源了专门针对 CUA 评估的基准测试框架 StepJack 。实验揭示了一个令人警惕的结论:拆解并非削弱了攻击威力,反而是绕过安全机制的倍增器。
针对这一核心冲突,最新研究提出了名为 SyncPlan 的“规划-执行-修正”(Plan-Execute-Correct)长程多智能体协同框架。该框架让中心化 LLM 在单次调用中生成带有显式同步原语的长程动作链,在底层由执行器通过等待原语和有向图死锁检测维护时序依赖。
针对这种执行失真,研究团队提出了 TRACE ( Trajectory-Relative Agent Context ComprEssion )框架。该方法抛弃了依靠终局任务成败做逆向归因的粗粒度反馈逻辑,转而在发生压缩的“截断边界”处,通过成对的闭环局部续写来直接度量压缩带来的额外执行退化。
该团队联合推出了首个面向无人机多任务综合推理的评测基准 UAVQA-Bench ,并设计了一套免训练的航拍多智能体系统 UAV-MAS 。这套系统无需改动底层模型权重,仅依靠 Qwen3-VL-32B 开源底座,便在 UAVQA-Bench 综合准确率上达到 77.0%。
此外,研究还开源了自动化归因工具 SkillTriage,并提出了一系列兼顾安全与成本的技能复用原则。评估智能体系统的失效历来存在归因难题。Agent 在复杂仓库和动态命令行中的交互轨迹充满不确定性,一个任务没有跑通,究竟是因为底层大模型的推理能力不足、随机采样波动、环境存在临时 Bug。
来自香港大学(The University of Hong Kong)的研究团队提出了名为 AgentBrew 的知识酿造框架,尝试从根本上重塑强教师与弱学生之间的经验传递逻辑。
DRNoise:为了排除检索框架与工具协议差异对实验结果的干扰,研究团队将所有参评模型置于完全相同的 BrowseComp-Plus 智能体框架内,采用标准的 ReAct(Reasoning + Acting)交互模式,并统一提供基于单接口的搜索引擎。
针对这一痛点,一项最新研究正式提出了 故障后记忆恢复 (Post-failure Memory Recovery)任务,并设计了一套 依赖引导的回滚修复 (Dependency-Guided Rollback Repair)机制。
针对这一核心痛点,香港科技大学与华为的研究团队提出了 InSight-doc 。该工作颠覆了以往默认必须把全量高分辨率图像一次性灌入模型的做法,将“视觉分辨率”重新定义为一种在推理阶段可被模型主动调度的计算资源。
针对这一瓶颈,研究团队提出了一种轻量级的上下文提纯器(Context Refiner),并通过强化学习框架 CRRL 将动态提问提纯机制无缝融入 Agent 训练全流程,实现了在显著降低检索频次与上下文长度的同时,大幅拉升问答准确率。
该团队构建了针对智能体可靠性度量的评测基准 AgentRelBench ,在企业运维仿真环境 EnterpriseOps-Gym 上对 6 个主流模型家族的 9 款代表性模型进行了多达 2,128 次独立运行测试。
针对这一矛盾,ProEvent 提出了一套“先定骨架、逆向推导、层层加噪”的数据合成流水线。整个流程如图 2 所示,主要划分为四个系统化阶段: 第一阶段是 联系人画像池构建 。
来自哥伦比亚大学、乔治城大学与 Capital One 的研究团队在深入解剖这一现象后,提出了一套全新的系统性解决方案。在底层大模型完全固定为 GPT-5-mini、不改动任何模型权重的严苛前提下,仅通过对智能体架构(Scaffold)的系统重构与算力回收。
这项研究提出了轻量级学习机制 OAS(Offline Abstraction-Safety) ,不仅在理论上将“何时整合(When)”与“用何种算子整合(Which)”统一到一个效用决策框架中,更证明了记忆管理的最优策略并非由某个固定的 Token 阈值决定。
SteerBench-Work 最具突破性的设计在于其构建的“证据翻转镜像”(Evidence-Reversed Mirrors)。研究团队选取了最典型的真实事故场景,完整保留其表层的操作危险特征,但将背后的验证状态彻底翻转——补充具备法律效力的授权凭单、合规部门的签名确认、审计日志或明确的业...
香港科技大学(HKUST)的研究团队在最新论文中提出了 SynWeaver 框架。这项研究的核心洞见在于: 高质量的 Web Agent 训练数据不能由离散的任务和孤立的轨迹拼凑而成,而必须将“目标网站的拓扑先验”与“任务-轨迹的协同演化”结合起来。
来自浙江大学、蚂蚁集团(Inclusion AI / AWorld 团队)、上海创新研究院、西湖大学与南京大学的研究团队提出了全新框架 CrEST (Hierarchical Credit Assignment via Entropy-Gated Self-Teacher)。
针对这一瓶颈,南京理工大学团队在论文中提出了一套 测试时自演化框架(Test-Time Self-Evolving Framework) ,通过引入“反思引导的策略内自蒸馏”(Reflection-Guided On-Policy Self-Distillation, R-OPSD)。
为此,研究团队设计了黑盒推断框架 SigLeak 。实验表明,该方法在五个任务场景、三个模型家族与三个 Agent 框架下,均能高保真地逆向出私有技能,并使下游任务执行成功率相比未挂载技能的基准平均提升 6.88 个百分点。这一发现从根本上动摇了依靠“黑盒托管”即可保护 Agent 核心资产的...