AI Agent 第4页

微软提出OEO:自进化Agent无需预设流程,GPT-5.5在线编排省下65%交互Token

为此,他们提出了一种名为 OEO (Open-Ended Optimization,开放式优化)的极简范式:框架仅负责严格锁定目标、预算、权限和评测红线,而把“何时收集证据、如何诊断失败、提出何种粒度的修改以及何时停止”的全部过程控制权,彻底交给前沿优化器在线自主编排。

Shape Your Feed:Meta大模型主动推荐框架,对齐准确率达98.85%

为了打破被动排名的局限,Meta 提出了名为 Shape Your Feed (简称 SYF )的大模型主动推荐系统。该系统让大语言模型扮演结构化控制器的角色,构建了包含感知、在线服务与自我进化的三层架构,打通了用户显式意图到传统重排流水线的端到端链路。

SyncPlan:显式同步与自适应修正,多智能体协同耗时降至0.05%

针对这一核心冲突,最新研究提出了名为 SyncPlan 的“规划-执行-修正”(Plan-Execute-Correct)长程多智能体协同框架。该框架让中心化 LLM 在单次调用中生成带有显式同步原语的长程动作链,在底层由执行器通过等待原语和有向图死锁检测维护时序依赖。

TRACE:长程Agent压缩为何频遭退化?配对闭环验证破解执行不稳定性

针对这种执行失真,研究团队提出了 TRACE ( Trajectory-Relative Agent Context ComprEssion )框架。该方法抛弃了依靠终局任务成败做逆向归因的粗粒度反馈逻辑,转而在发生压缩的“截断边界”处,通过成对的闭环局部续写来直接度量压缩带来的额外执行退化。

UAV-MAS:无需训练的多智能体系统,让32B模型反超Gemini 3 Pro

该团队联合推出了首个面向无人机多任务综合推理的评测基准 UAVQA-Bench ,并设计了一套免训练的航拍多智能体系统 UAV-MAS 。这套系统无需改动底层模型权重,仅依靠 Qwen3-VL-32B 开源底座,便在 UAVQA-Bench 综合准确率上达到 77.0%。

微软揭秘Agent技能反噬效应:近7成功能失效并非无关,而是盲信对口模板

此外,研究还开源了自动化归因工具 SkillTriage,并提出了一系列兼顾安全与成本的技能复用原则。评估智能体系统的失效历来存在归因难题。Agent 在复杂仓库和动态命令行中的交互轨迹充满不确定性,一个任务没有跑通,究竟是因为底层大模型的推理能力不足、随机采样波动、环境存在临时 Bug。

算力全浪费在重复Debug?哥大等重构科研Agent:金牌数翻倍至38枚

来自哥伦比亚大学、乔治城大学与 Capital One 的研究团队在深入解剖这一现象后,提出了一套全新的系统性解决方案。在底层大模型完全固定为 GPT-5-mini、不改动任何模型权重的严苛前提下,仅通过对智能体架构(Scaffold)的系统重构与算力回收。

SteerBench-Work:大模型不是太冒进,而是过度拦截率高达28.1%

SteerBench-Work 最具突破性的设计在于其构建的“证据翻转镜像”(Evidence-Reversed Mirrors)。研究团队选取了最典型的真实事故场景,完整保留其表层的操作危险特征,但将背后的验证状态彻底翻转——补充具备法律效力的授权凭单、合规部门的签名确认、审计日志或明确的业...

SynWeaver:港科大打破任务轨迹割裂,仅822条合成数据登顶WebArena

香港科技大学(HKUST)的研究团队在最新论文中提出了 SynWeaver 框架。这项研究的核心洞见在于: 高质量的 Web Agent 训练数据不能由离散的任务和孤立的轨迹拼凑而成,而必须将“目标网站的拓扑先验”与“任务-轨迹的协同演化”结合起来。

SigLeak:无需恶意提示词,仅凭良性交互即可逆向私有Agent技能

为此,研究团队设计了黑盒推断框架 SigLeak 。实验表明,该方法在五个任务场景、三个模型家族与三个 Agent 框架下,均能高保真地逆向出私有技能,并使下游任务执行成功率相比未挂载技能的基准平均提升 6.88 个百分点。这一发现从根本上动摇了依靠“黑盒托管”即可保护 Agent 核心资产的...