ClinLens:代码100%跑通却仅56%正确!首个多模态临床数据Agent基准
ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

在严肃的临床科研与流行病学分析中,一位资深数据分析师往往需要面对极其繁杂的流程:不仅要从成千上万份非结构化电子病历、心电图、胸片和超声报告中抽丝剥茧,还要梳理患者长达数年的时间序列,对齐不同维度的入院记录,并严格防止跨时间窗口的信息泄露。随着大语言模型编码智能体(Coding Agent)的发展,许多人开始憧憬将这一整套多模态、长程的临床数据分析流程完全交由大模型驱动的自动化系统来完成。
ArXiv URL:https://arxiv.org/abs/2607.26155v1
代码能够无报错顺利运行,是否就意味着临床分析的结论必然可靠?山东大学研究团队针对这一核心问题提出了 ClinLens。这是首个面向纵向多模态临床数据科学的长程代码智能体基准评测。通过深度打通并关联 MIMIC 体系下的五大异质医疗数据源,ClinLens 构建了跨越 4 种患者-时间维度与 5 类高频分析能力的 200 项可执行任务。
这项研究揭示出了一个令人警醒的核心事实:在标准化评测套件中,表现最优的模型架构虽然达成了 100% 的代码执行成功率(ExecSuccess),但其严格正确率(StrictPass)却只有 56.3%。换句话说,在将近一半的场景中,智能体看似写出了语法工整、逻辑通畅、毫无报错的 Python 脚本,但在数据清洗逻辑、时间截断对齐或队列统计维度上却错漏百出,最终给出了完全失真的临床结论。这一结果深刻指出了当前大模型在严肃医疗数据科学中所面临的系统性瓶颈。
告别玩具场景:真实临床数据分析需要什么?
过去两年中,大模型在医疗领域的评估主要集中在两个极端。一类是静态的选择题或开放问答,例如各类医学执业医师考试,这类评测本质上测试的是参数化医学常识的记忆与检索,无法衡量模型在真实场景下的动手计算与数据分析能力;另一类则是针对预处理完毕的规整二维单表进行 SQL 查询或代码推理,例如针对结构化电子病历的初级交互。还有部分基准虽然涉及生物信息学或通用科学仓库,却完全脱离了真实的临床诊疗场景与纵向时间轴。
真实的临床真实世界研究(RWS)与观察性队列分析绝非“对一张清洗好的大宽表跑一个回归模型”那么简单。临床数据具有天然的纵向性、碎片化与多模态属性。一位患者可能在数年内多次进出急诊和重症监护室(ICU),在此期间会积累数以百计的实验室化验指标、带有精确时间戳的医嘱事件、非结构化的出院小结、不同时间点采集的 12 导联心电图(ECG)、数张前后位或侧位胸部 X 光片(CXR),以及详尽的超声心动图(ECHO)报告。
当分析人员接到一个具体任务——例如“评估患者在进入 ICU 后 24 至 72 小时内发生急性肾损伤的风险因素”时,模型不仅需要将多模态数据源通过患者 ID、住院 ID 和重症监护 ID 进行准确的多级关联,还必须实施极其严密的时间截断:所有预测特征必须严格限制在入院前 24 小时的时间窗内,一旦混入 24 小时之后的任何检查或医嘱,就会产生严重的时间穿越与数据泄露。现有的智能体评测框架普遍缺乏对这种深层“患者-时间语义”的端到端约束,往往只要代码能够输出一个数字,就被判定为运行成功。这种评估维度的缺失,直接掩盖了模型在处理复杂因果与时序问题时的脆弱性。
ClinLens 的架构设计:4×5 分类学与半原始数据包
为了填补这一空白,研究团队构建了 ClinLens 基准。该基准没有沿用以往将数据预先拼接处理的简化做法,而是选择深度整合并链接了五大核心 MIMIC 资源:MIMIC-IV 结构化临床记录、MIMIC-IV-Note 临床文本、MIMIC-IV-ECG 心电图信号、MIMIC-CXR-JPG 放射影像以及 MIMIC-IV-ECHO 超声心动图。
在数据暴露方式上,ClinLens 拒绝直接向智能体投喂扁平化的宽表,而是为每个任务封装一个有界的半原始数据包(Bounded semi-raw package)。这意味着多表连接、缺失值填补、时序对齐、模态特征提取、聚合计算与统计建模的全套流程,全部作为任务的一环完整留给智能体自主探索与编码。系统内部严格保留了原始数据的层次化标识符体系:通过 subject_id 锁定患者个体,通过 hadm_id 索引单次入院,通过 stay_id 界定 ICU 住院过程,并使用各自的源标识符索引跨模态检查记录。
在此基础上,研究团队提炼出了覆盖临床科研全流程的 $4 \times 5$ 分类学体系。横向的 4 种“患者-时间作用域”(Patient-Time Scopes)从宏观到微观层层递进:
-
全患者尺度(Whole-patient):考察横跨多次就医记录、跨越数年的长期纵向轨迹;
-
入院尺度(Admission):聚焦某一次具体住院期间的事件演进与临床决策;
-
ICU 住院尺度(ICU-stay):专注于以小时甚至分钟为粒度的重症监护高频生理指标监测;
-
单次事件与检查尺度(Event/study):深入到特定影像学检查、心电图采集成像与对应临床发现的细粒度关联。
纵向则交叉了 5 大核心分析能力维度(Analysis Capabilities),包括基础人群画像构建(Profiling)、变量间的临床关联分析(Association analysis)、事件对齐的时序变化估计(Event-aligned change estimation)、前瞻性或回顾性临床结局预测(Prediction),以及复杂疾病的深度表型提取(Phenotyping)。这二十个维度的交叉组合,全方位覆盖了临床数据科学家在日常科研工作中最为核心的技能版图。
代码优先的逆向合成:如何打造无偏且严密的评测闭环?
在设计包含 200 个复杂长程任务的基准时,最大的挑战在于如何确保每一个任务的标注答案(Ground Truth)绝对可重现且具备无可争议的统计严密性。如果完全依赖人工标注,不仅成本高昂,而且在涉及多表关联和复杂时间窗口计算时极易引入人为偏差或代码隐式错误。
ClinLens 采用了一种极其严谨的“代码优先逆向合成”(Program-first reverse synthesis)机制。评测流水线并不是先由人类撰写自然语言需求再去编写参考代码,而是由领域专家首先编写高度确定性的参考程序(Reference workflow)。这些程序作为评测端的私有资产,显式固定了队列定义逻辑、时间窗口切分规则、随机数种子、工件生成契约、中间状态验证断言以及最终的标准答案。随后,评测流水线基于该参考程序反向实例化生成半原始数据包与对应的自然语言任务描述(Request)。
为了杜绝任务本身的漏洞,研究团队建立了一套全自动的质量控制体系。所有 200 个任务的参考工作流均在完全纯净的独立沙箱环境中重新运行执行,针对底层数据文件的可访问性、中间工件的 Schema 结构、样本队列规模、时序边界约束、中间验证字段以及最终结果的复现性进行了逐项自动化检查。经统计,基准中抽样抽检的 240 份心电图、X 光片与超声心动图资产完全可读,基准内部所有任务的参考程序均达到 100% 的可执行性与内部逻辑一致性。
当智能体接受任务时,它只能获得自然语言描述、半原始数据包以及一份明确声明所需产出文件格式的工件规范(Artifact specifications),而无法窥视私有的参考程序与真实标签。智能体必须自主规划分析方案,并在执行完成后向系统提交指定格式的中间工件文件与包含最终计算结论的 final_answer.json。
严格的度量衡:ExecSuccess 与 StrictPass 的本质差异
现有的许多代码智能体基准往往以“代码退出状态码是否为 0”作为核心评估指标,这种粗放的标准在严肃科学计算中极具误导性。在 ClinLens 中,评估标准被赋予了多维度的严格约束,研究团队明确定义了两个关键度量指标:
执行成功率(ExecSuccess)要求智能体在规定的超时时间与交互轮数内完整跑完流程,并在沙箱中生成完整的、可被成功反序列化解析的提交文件。这一指标度量的是智能体的工程鲁棒性、代码基础语法能力以及对基本文件输入输出规范的遵从度。
严格通过率(StrictPass)则设置了极其严苛的五重门槛。一个任务要想被判定为 StrictPass,必须同时满足以下所有条件:
-
规定的所有分析工件(中间数据表、特征集合、预测概率文件等)必须真实生成且结构完备;
-
输出文件的格式必须完全符合预设契约且可正常解析;
-
智能体最终清洗出的患者与样本队列行数必须与任务规范的理论行数严格对齐(用于排查时序切分或连接条件错误引起的队列漂移);
-
内部校验断言全部通过(例如特征计算逻辑、时间截断边界检查等);
-
最终提交的核心数值或分类答案必须在设定的容差区间内与真实参考值完全匹配。
只有当这五重约束同时被激活并满足时,任务才算真正通关。这种将“过程工件可审计性”与“结果数值准确性”相绑定的设计,为甄别智能体是在“真实分析”还是在“虚假拟合”提供了精确的标尺。
实验评测:三大反直觉的核心发现
研究团队选取了涵盖四种主流前沿大模型底座与六种主流智能体脚手架(Scaffold)的 24 种标准化组合,在固定的 126 个核心评测套件上进行了总计 3,024 次严格的任务推演,最终挖掘出一系列具有重要参考价值的技术结论。
发现一:可执行性与临床正确性之间存在巨大的系统性鸿沟
评测数据显示,模型生成“可运行代码”的能力已经高度成熟,但“算对临床问题”的能力却依然步履维艰。在 24 种标准化配置中,表现最好的配置组合是搭载 SelfDebug 机制的 GPT-5.5,其范围宏观(Scope-macro)ExecSuccess 达到了无可挑剔的 100%,但在 StrictPass 上却骤降至 56.3%。这意味着即便拥有目前顶级的工程与代码修复支持,智能体在近一半的任务中仍然无法得出正确的临床分析结论。
在针对 Codex 编程智能体的独立交互式实验中,这一现象体现得更为直观。Codex 在 126 个任务中成功解决了 83 个,而在失败的 43 个任务中,所有未通过任务的代码全部能够完整运行且产出结构完整的 JSON 结果,但计算出来的数值全部与真实答案背道而驰。在医疗场景下,这种“没有报错的静默错误”比显式的语法崩溃具有更高的危险性,它极易给缺乏代码审计精力的临床研究人员带来虚假的安全感。
发现二:脚手架架构不存在绝对最优,且与大模型底座高度绑定
在以往的智能体研发中,人们倾向于认为引入更复杂的规划、检索或自省机制总能无条件提升性能。但 ClinLens 的对比实验粉碎了这一假设:脚手架的效能高度依赖底层模型的内在认知风格。
在 DeepSeek-V4-Pro 与 GPT-5.5 上,强调通过报错追踪反复自我修复的 SelfDebug 表现最为出色;但在 GLM-5.2 上,最基础的 ReAct 反思-执行循环反而以微弱优势领先;更为戏剧性的现象发生在 Claude-Opus-4.8 上——为其配备针对数据包本地文档检索的 RAG-ReAct 架构后,模型的 StrictPass 成绩从原本 ReAct 模式下的 43.5% 跃升到了 53.5%。
然而,这套完全相同的 RAG-ReAct 架构移植到 GPT-5.5 上时,却引发了灾难性的反噬:GPT-5.5 的 StrictPass 表现直接从纯 ReAct 下的 55.3% 暴跌至 28.6%。分析表明,过量的本地文档检索噪声严重干扰了部分模型的底层上下文窗口,诱发了过度规划与幻觉逻辑。这一发现表明,不存在放之四海而皆准的通用 Agent 脚手架,任何针对专业领域的脚手架工程都必须根据基础模型的注意力特性进行定制化适配。
发现三:适配后的传统生物医学 Agent 在真实数据科学任务中几乎全线失效
为了评估现有专用医疗/生物智能体的泛化迁移能力,研究团队在 GPT-4o-mini 底座下对五种代表性的生物医学智能体系统进行了适配评测,包括 BioMedAgent、BixBench 适配系统、BioMaster、EHRAgent 以及 Biomni。
实验结果呈现出压倒性的代差劣势。在这批专有系统中,表现最好的 BioMedAgent 在 ClinLens 上的范围宏观 StrictPass 仅为 2.9%;专门面向电子病历推理设计的 EHRAgent 虽然取得了 62.6% 的执行成功率,但其严格正确率只有微乎其微的 2.2%。造成这一现象的根源在于,早期的医疗智能体绝大多数建立在“工具调用库检索”或“简单结构化查询”的设计范式之上,它们在面对未经清洗、高度异构、具有严密时间因果依赖的长程数据分析任务时,缺乏进行深层数据清洗、多重时序聚合以及复杂统计建模的代码规划能力。
走向可信赖的临床 AI:破除“静默错误”的演进路径
ClinLens 的评测结果为下一代临床计算智能体的架构演进提供了极具操作性的启示。单纯追求更大的模型参数、更长的上下文窗口或更高的代码运行通畅度,并不能从根本上解决纵向医疗数据科学中的时序对齐与队列失真问题。
未来的临床代码智能体系统若要真正应用于严肃科研,必须在架构设计层面做出根本性变革。首先,智能体必须在内部显式建立“患者-时间拓扑表征”,在规划阶段就将时间窗口截断与因果先后顺序确立为代码执行的最高硬性约束,彻底隔绝因表连接导致的隐式数据泄露。其次,智能体运行环境必须内嵌自动化的统计不变量校验机制,在代码生成中间结果后,实时自动重新计算队列行数、缺失率分布与生理学常识范围,从而在执行阶段自主捕获那些“语法正确但数值离谱”的逻辑漏洞。最后,系统需要建立从最终发布的每一个标量指标追溯至具体中间数据文件、代码执行分段乃至原始数据行的全链路端到端审计链路。
ClinLens 的价值不仅在于指出了现有智能体能力的不足,更在于它通过标准化的任务定义与严格的工件校验,将过去模糊不清的“执行成功与临床正确之间的鸿沟”转化成了一个可量化、可复现、可逐步优化的明确工程靶标。这无疑为大模型真正迈入严谨、可信、负责任的医疗科研实用阶段奠定了关键的评测基石。