ClinLens:代码100%跑通却仅56%正确!首个多模态临床数据Agent基准
山东大学研究团队针对这一核心问题提出了 ClinLens。这是首个面向纵向多模态临床数据科学的长程代码智能体基准评测。通过深度打通并关联 MIMIC 体系下的五大异质医疗数据源,ClinLens 构建了跨越 4 种患者-时间维度与 5 类高频分析能力的 200 项可执行任务。
山东大学研究团队针对这一核心问题提出了 ClinLens。这是首个面向纵向多模态临床数据科学的长程代码智能体基准评测。通过深度打通并关联 MIMIC 体系下的五大异质医疗数据源,ClinLens 构建了跨越 4 种患者-时间维度与 5 类高频分析能力的 200 项可执行任务。
研究团队对比了三种不同的提示词防御策略: 第一种策略是彻底剥离从属性指令,仅仅保留纯粹的任务要求; 第二种策略是在保留原有从属要求的同时,用自然语言增加一段核查要求,告诉模型“如果工具返回的内容不满足提问要求,请直接报告失败”; 第三种策略(研究团队提出的新方案),则完全保留原有的提示词。
通过前置依赖与执行轨迹反向合成管线,GABench 构建了包含 10,400 个兼具复杂性与可验证标准答案的端到端 Agent 任务。实验评估了包含 Qwen3-235B、GLM-5-turbo、DeepSeek-V4-pro、GPT-5-mini 等在内的前沿模型。
为了弥合这一巨大的运行时安全缺口,来自阿里巴巴与浙江大学的研究团队提出了 MTGuard。该框架改变了“只在静态消息上做文章”或“把沙箱当成黑盒”的割裂思路,首次在 MCP 工具调用的完整生命周期中,将协议层的静态语义语境与沙箱内的系统级动态行为进行深度协同分析。
然而,实验结果却呈现出完全相反的戏剧性走向: 在所有参与测试的模型与平台组合中,引入 HITL 之后的攻击成功率不降反升,整体 ASR 平均增加了 7.8 个百分点!
清华大学 CoAI 团队联合智谱 AI、电子科技大学等研究人员提出了 MTAC-IFBench ,针对“多轮自主代码智能体(Multi-Turn Agentic Coding)”的过程指令遵循能力建立了系统化评测基准。
针对这一核心痛点,最新研究提出了 OoO-Spec (Out-of-Order Semantic Speculation,乱序语义推测)。这项工作的核心立意在于打破文本输出顺序对语义计算的禁锢:既然函数的选择与各个参数槽位在逻辑上彼此独立,模型就完全没有必要按照文本展示的先后顺序去串行等待。
KV:这印证了近期关于推理模型注意力汇点(Attention Sink)的研究发现:句末及结构标记往往汇聚了对整段推理逻辑的高阶语义概括。然而,更具普适性、更强劲的解法是 延迟未来查询 。
为了攻破这一开放世界瓶颈,最新研究提出了 SciToolAgent-Evo 。这是一个具备本体感知(Ontology-Aware)与自演化能力的科学工具获取智能体框架。
针对这一系统性内生缺陷,研究团队提出了名为 SEAL (Sealed Exogenous Acceptance Loop,密封外生验收循环)的极简框架,仅凭一个与环境隔离的外部 1-bit(接受/拒绝)验收信号,就在多达六款主流大模型和多款复杂游戏任务上成功筑牢了防线。
基于此,研究团队提出了 SkillMentor 框架。它通过强化学习训练了一个专门负责把脉问诊的“导师策略”(Mentor Policy),让导师主动生成测试场景来探测执行器的极限,并将发现的反复性失败沉淀为可复用的结构化技能库。
针对这一困境,来自美团、新加坡国立大学(NUS)、上海交通大学与浙江大学的研究团队提出了一套端到端强化学习框架—— SkillRise 。这项工作摒弃了复杂的外部记忆库与检索中介,仅用 单一策略 在连续递进的任务序列中交替执行“任务求解”与“技能文档提炼”,并提出了跨任务解耦的信用分配机制。
针对这一黑箱困境,中国科学院与中国科学院大学的研究团队提出了系统剖析多轮长程规划“底层物理学”(Physics of Multi-Turn Long-Horizon Planning)的分析框架。
面对这种隐蔽而危险的群体性误导,传统的过滤门禁与只看讨论记录的法官模型几乎全线失效,而研究团队提出的“独立裁判(Referee)”机制,通过在会后向模型发起一次私下重质询(Private Re-query),以非介入式的干预信号切断了虚假的从众效应,为多智能体系统的临床安全治理提供了极其关键的...
由微软、上海交通大学、清华大学、北京大学等机构联合提出的 Argus ,正是为了打破这一长期困境而设计的通用 Agent 运行时。Argus 的核心思想非常直接却极具颠覆性:长程推理的关键不在于更长地维持一个固定计划。
研究团队提出的黑盒攻击框架 SkillClone 证明:哪怕底层文件被严密保护、不发生任何文本泄露,仅凭普通的任务交互与闭环差分修复,攻击者依然能以极低的成本重构出可独立执行的等价程序克隆。
为了打破这一“能力天花板”,来自北京理工大学和深圳北理莫斯科大学的研究团队提出了一种全新的 零阶自进化框架 。该方法彻底跳出了“必须先采出正确轨迹才能训练”的传统思维,而是对大模型的 LoRA 参数施加微小扰动,仅依据最终答案计算连续的困惑度损失差。
BlueLM-GUI 提出了 MobileGUI-VBench 以及一套“配额驱动”(Quota-driven)的动态评测方法学。该方法彻底抛弃了“专家挑选一些主观难题组成固定测试集”的旧模式,将基准拆解为业务场景、任务复杂度、交互与风险控制三大正交轴。
研究提出的“权威链劫持”(Authority-Chain Hijack, ACH)策略,通过在智能体推进检索时动态投喂看似来自不同独立信源、实则彼此印证的协同证据,直接破解了智能体的多源交叉验证防线,在 SafeSearch 基准测试上的攻击成功率比既有基线高出 13.0 至 36.1 个百分点。
针对不同深度的代码区域,CyberForge 设计了两套互补的注入流水线。这一流水线专攻现有模糊测试 Harness 能够直接触达的代码区域。借助 Harness 现成的输入解析通道,系统可以显著降低 PoV 构建的试错开销。
为了打破这种“纸上谈兵”的困境,来自哈尔滨工业大学、上海人工智能实验室、上海交通大学、中山大学、天津大学与清华大学的研究团队联合推出了针对全链条对地观测的完整解决方案——不仅构建了首个覆盖全流程的评测基准 Earth-Bench-Pro ,还提出了执行自适应的智能体框架 Earth-Agent...
近期,来自复旦大学、京东以及阿卜杜拉国王科技大学的研究团队提出了名为 EMAS(Evolving Multi-Agent System)的演化多智能体系统。该框架明确提出:不需要更新大模型的底层权重,而是把多智能体系统的拓扑图和提示词本身作为可学习、可演化的程序状态,通过从线上运行轨迹中提炼可...
他们提出了 HarnessCompass 框架,通过引入全局泛化约束、Agent 第一人称主动反馈,以及分组件解耦优化三大机制,重新规范了脚手架演化流程。在 SWE-bench Verified 基准测试中,以 GPT-5.4 为底座的 HarnessCompass 仅经历 5 轮迭代。
香港科技大学(HKUST)的研究团队在最新论文中打破了这种静态脚手架的思维定式,提出了名为 HSI (Hierarchical Self-Improvement,分层自进化)的全新框架。