AI Agent 第8页

ClinLens:代码100%跑通却仅56%正确!首个多模态临床数据Agent基准

山东大学研究团队针对这一核心问题提出了 ClinLens。这是首个面向纵向多模态临床数据科学的长程代码智能体基准评测。通过深度打通并关联 MIMIC 体系下的五大异质医疗数据源,ClinLens 构建了跨越 4 种患者-时间维度与 5 类高频分析能力的 200 项可执行任务。

工具坏了Agent为何闭眼瞎编?一句话把不诚实率从14.1%降至0.87%

研究团队对比了三种不同的提示词防御策略: 第一种策略是彻底剥离从属性指令,仅仅保留纯粹的任务要求; 第二种策略是在保留原有从属要求的同时,用自然语言增加一段核查要求,告诉模型“如果工具返回的内容不满足提问要求,请直接报告失败”; 第三种策略(研究团队提出的新方案),则完全保留原有的提示词。

MTGuard:动静混合分析护航MCP,危险工具调用检测率达48.3%

为了弥合这一巨大的运行时安全缺口,来自阿里巴巴与浙江大学的研究团队提出了 MTGuard。该框架改变了“只在静态消息上做文章”或“把沙箱当成黑盒”的割裂思路,首次在 MCP 工具调用的完整生命周期中,将协议层的静态语义语境与沙箱内的系统级动态行为进行深度协同分析。

OoO-Spec:乱序语义推测破除串行限制,工具调用提速最高达5.34倍

针对这一核心痛点,最新研究提出了 OoO-Spec (Out-of-Order Semantic Speculation,乱序语义推测)。这项工作的核心立意在于打破文本输出顺序对语义计算的禁锢:既然函数的选择与各个参数槽位在逻辑上彼此独立,模型就完全没有必要按照文本展示的先后顺序去串行等待。

中科院SEAL:智能体自己打分必崩?1比特外生审计破解自测幻觉

针对这一系统性内生缺陷,研究团队提出了名为 SEAL (Sealed Exogenous Acceptance Loop,密封外生验收循环)的极简框架,仅凭一个与环境隔离的外部 1-bit(接受/拒绝)验收信号,就在多达六款主流大模型和多款复杂游戏任务上成功筑牢了防线。

SkillRise:单一策略边解题边进化技能,智能体RL性能提升达8.5%

针对这一困境,来自美团、新加坡国立大学(NUS)、上海交通大学与浙江大学的研究团队提出了一套端到端强化学习框架—— SkillRise 。这项工作摒弃了复杂的外部记忆库与检索中介,仅用 单一策略 在连续递进的任务序列中交替执行“任务求解”与“技能文档提炼”,并提出了跨任务解耦的信用分配机制。

医疗多智能体被两个同伴带偏38%?独立裁判用私下质询破解从众陷阱

面对这种隐蔽而危险的群体性误导,传统的过滤门禁与只看讨论记录的法官模型几乎全线失效,而研究团队提出的“独立裁判(Referee)”机制,通过在会后向模型发起一次私下重质询(Private Re-query),以非介入式的干预信号切断了虚假的从众效应,为多智能体系统的临床安全治理提供了极其关键的...

Argus:78%基准背后的长程Agent运行时与自演化机制

由微软、上海交通大学、清华大学、北京大学等机构联合提出的 Argus ,正是为了打破这一长期困境而设计的通用 Agent 运行时。Argus 的核心思想非常直接却极具颠覆性:长程推理的关键不在于更长地维持一个固定计划。

零阶优化破解智能体自进化瓶颈:困难样本成功率从22%跃升至54%

为了打破这一“能力天花板”,来自北京理工大学和深圳北理莫斯科大学的研究团队提出了一种全新的 零阶自进化框架 。该方法彻底跳出了“必须先采出正确轨迹才能训练”的传统思维,而是对大模型的 LoRA 参数施加微小扰动,仅依据最终答案计算连续的困惑度损失差。

ACH:面包屑伪造互证链诱捕搜索Agent,攻击成功率达71.4%

研究提出的“权威链劫持”(Authority-Chain Hijack, ACH)策略,通过在智能体推进检索时动态投喂看似来自不同独立信源、实则彼此印证的协同证据,直接破解了智能体的多源交叉验证防线,在 SafeSearch 基准测试上的攻击成功率比既有基线高出 13.0 至 36.1 个百分点。

Earth-Agent-Pro:全链条遥感Agent,解耦规划与执行提升20.95分

为了打破这种“纸上谈兵”的困境,来自哈尔滨工业大学、上海人工智能实验室、上海交通大学、中山大学、天津大学与清华大学的研究团队联合推出了针对全链条对地观测的完整解决方案——不仅构建了首个覆盖全流程的评测基准 Earth-Bench-Pro ,还提出了执行自适应的智能体框架 Earth-Agent...

EMAS:冻结模型权重自演化Agent,代码准确率达89%且Token降62%

近期,来自复旦大学、京东以及阿卜杜拉国王科技大学的研究团队提出了名为 EMAS(Evolving Multi-Agent System)的演化多智能体系统。该框架明确提出:不需要更新大模型的底层权重,而是把多智能体系统的拓扑图和提示词本身作为可学习、可演化的程序状态,通过从线上运行轨迹中提炼可...

HarnessCompass:5轮迭代升至66%,Agent外壳为何能真正泛化?

他们提出了 HarnessCompass 框架,通过引入全局泛化约束、Agent 第一人称主动反馈,以及分组件解耦优化三大机制,重新规范了脚手架演化流程。在 SWE-bench Verified 基准测试中,以 GPT-5.4 为底座的 HarnessCompass 仅经历 5 轮迭代。