ClinFusion:级联空间感知融合+原生3D编码,登顶20项医学基准
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

近年来,多模态大语言模型(MLLM)在日常问答、文档理解等领域突飞猛进,但在医疗这种容错率极低的严肃场景中,通用多模态模型依然频繁“翻车”。究其根源,临床医学本质上是一个以视觉为绝对核心(Vision-Centric)的领域。医生的每一次诊断,高度依赖于对 2D 胸片、病理切片以及 3D 体积数据(如 CT、MRI)的微观病灶捕捉与三维空间拓扑理解。
ArXiv URL:https://arxiv.org/abs/2607.24743v2
以往的医疗多模态大模型(如 Hulu-Med、Lingshu 等)大多走“以数据为中心”的路线:拿一个预训练好的通用单体视觉编码器(Monolithic Vision Encoder),在医学图文对上进行多阶段微调。对于 3D 体积数据,要么粗暴地抽帧切片当成 2D 图像处理,丢失了沿切片深度方向的连续空间结构;要么单独硬挂一个 3D 编码器,导致 2D 与 3D 特征的跨模态对齐难度剧增。此外,现有的评估标准也严重脱离实际临床流程——常规的 BLEU、ROUGE 或 RadGraph-F1 极易被“废话连篇”的长文本刷高分,无法有效拆解真实临床诊断中最看重的命中、漏诊与幻觉。
针对这两大瓶颈,来自阿里达摩院、清华大学、浙江大学及北京清华长庚医院等机构的研究团队提出了 ClinFusion。这是一个专门为全景医学理解设计的视觉中心多模态大语言模型系统。通过提出级联空间感知局部融合算子(CaSL Fusion),ClinFusion 真正将多源 2D 专家编码器与原生 3D 体积编码器有机协同,同时重构了面向临床感兴趣区(RoI)的评测体系。在涵盖 2D/3D VQA、医疗报告生成和复杂指令遵循的广泛评测中,ClinFusion 在 24 项基准中击败了主流开源医疗模型,并在 16 项评测中有 13 项超越了 GPT-5.2 与 Gemini-3-Flash 等顶尖商业大模型。
告别单体编码器:CaSL 算子如何打通 2D 与原生 3D?
医学影像异质性极高,单一视觉编码器难以兼顾全局语义对齐与局部微细病灶捕捉。ClinFusion 摒弃了单体编码器思路,设计了一套组合式、级联式的视觉编码架构。
在 2D 图像表征上,模型保留了对齐良好、兼具泛化能力的基础 Vision Transformer(以 Qwen-VL 的视觉底座为核心),同时引入了多个领域专家的 2D 编码器。不同于以往 Cambrian-1 等工作采用的平行拼接聚合,ClinFusion 提出了级联空间感知局部融合算子(Cascade Spatial-Aware Locality Fusion,简称 CaSL)。CaSL 算子采用分层递进机制,让专家编码器的特征在保持空间拓扑约束的前提下,级联式地渗透并富集基础表征,既保留了基座模型原有的语言对齐空间,又注入了医学专用的高敏锐度局部特征。
面对 3D 体积数据(如高分辨率 CT 和 MRI 扫描),传统的切片抽样策略必然造成结构丢失。ClinFusion 引入了专用的原生 3D 编码器,并构建了 2D 锚定的深度感知 CaSL 融合机制(2D-anchored depth-aware CaSL Fusion)。在这套机制中,已经与语言充分对齐的 2D 特征充当“语义锚点”,去引导和约束原生 3D 空间体积特征的映射与对齐。这种设计既避开了 3D 模态从零与语言对齐时的收敛难题,又完整保留了器官与病灶在三维体素层面的连续几何关系。
消融实验验证了原生 3D 编码器的不可替代性:当在推理阶段禁用 3D 编码器、退化为纯稀疏 2D 切片输入时,模型的 3D VQA 平均得分从 65.8 分骤降至 62.8 分;3D 报告生成的平均 F1 值直接从 15.7 分跌落至 11.7 分,其中 CT-Rate 开放式 VQA 跌幅高达 7.2 分(63.6 $\rightarrow$ 56.4)。这一严谨对比说明,空间立体的体素连续性无法仅靠多张抽样切片来拼凑。
告别词面匹配:基于 RoI 与事实拆解的临床级评测
除了视觉表征能力不足,另一个制约医疗大模型落地的问题是“评测基准失真”。在真实的放射科读片流程中,放射科医生绝不是对着一张胶片漫无目的地写作文,而是基于病人的主诉、转诊指征和既往病史,有目的地聚焦在特定的解剖区域和感兴趣区(Region-of-Interest, RoI)。
现有的报告生成评测通常给模型一个笼统的 Prompt(例如“请为此影像生成一份全面报告”),然后用 BLEU、CIDEr 或基于规则的 RadGraph-F1 与参考报告比对。这种机制存在致命漏洞:
-
冗长惩罚失效:模型只要输出大段堆砌术语的废话,就能在 RadGraph-F1 上刷出高分,掩盖实质性误诊;
-
缺乏事实颗粒度:无法清晰界定哪些病灶是真正匹配的(Matched)、哪些是漏诊的(Missed)、哪些是凭空捏造的幻觉(Hallucinated)。
为此,研究团队推出了基于 RoI 锚定的报告生成评估框架。该方法结合临床上下文,将评估注意力约束在具体的解剖结构上,并借助基于 LLM 的裁决机制,将诊断结论细粒度拆解为精准度(Precision)、召回率(Recall)与 F1 分数。对比实验显示,当模型刻意输出冗长文本(Long Output)时,传统的 RadGraph-F1 分数在 IU-XRAY 上直接虚高至 33.0(原本为 16.3),而 RoI 锚定评估框架则识别出其低质实质,给出了恰当的降分惩罚(36.7 降至 33.6)。
为了衡量大模型在专业场景下的指令依从性,研究团队还同步构建了 MedIF-Bench。过去很多开源医疗模型经过垂类微调后,虽然学到了医学词汇,但基础的指令依从能力大幅受损,导致在复杂的临床结构化输出任务中频繁失效。在 MedIF-Bench 的格式合规性测试中,ClinFusion-8B 和 ClinFusion-32B 分别斩获 98.1 和 98.9 的高分,不仅显著甩开 Lingshu-32B(82.6 分),甚至超越了 GPT-5.2(96.0)与 Gemini-3-Flash(96.6)。
24 项基准横扫与盲审医生验证:真实读片胜率如何?
在模型规模上,团队基于 Qwen3-VL 研发了 ClinFusion-8B 与 ClinFusion-32B 两个版本。横跨 2D VQA、3D VQA、临床报告生成和医学文本推理的全面评测表明,该模型在医学领域实现了真正的全能表现。
在最具代表性的 2D 场景下,通用多模态模型常因依赖全局特征而忽略局部病理。例如在一例典型的胸部 X 光片诊断中,面对患者的心脏扩大(Cardiomegaly)与肺血管增粗迹象,Hulu-Med、Lingshu 乃至 Gemini-3-Flash 均误判为“正常胸片”,而 ClinFusion 凭借多专家级联的局部敏锐度,准确给出了“心影轻度增大、肺血管纹理轻度增强”的精准描述。在 3D CT 影像分析中,面对弥漫性、轻微的密度改变,通用模型 Gemini-3-Flash 给出了肝脏大小与密度正常的错误描述,遗漏了重要病灶;ClinFusion 则凭借 3D 原生编码器准确定位出肝脏密度减低,并在最终诊断中给出“轻度脂肪肝”的定论,同时对胆囊、胆管等未见异常的解剖部位进行了严谨的阴性排除(Pertinent Negatives),高度贴合标准放射科书写规范。
在纯医学文本基准(MedXpertQA、PubMedQA、MedQA 等)上,ClinFusion 也打破了“强化视觉必然牺牲文本”的刻板印象。ClinFusion-32B 在 8 项文本基准中的 7 项超越了同尺寸开源医疗模型。例如在 MedXpertQA 上,ClinFusion-32B 达到了 26.7 分(显著高于 Hulu-Med-32B 的 19.8 分),在 MedQA-MCMLE 上达到了 93.8 分。
为了杜绝跑分与实际临床价值脱节,研究团队组织了一项严格的双盲临床实验:邀请 6 位拥有 6 年以上临床经验的执业放射科医生,随机抽取涵盖胸部 X 线、胸部 CT 和腹部 CT 的 300 例真实病案,对 ClinFusion、Gemini-3-Flash 和 Hulu-Med 生成的匿名报告进行盲审排序。
放射科医生围绕事实准确性(Factual Accuracy)、完整性(Completeness)与临床实用性(Clinical Utility)三个维度独立打分。评价者间信度分析表明,肯德尔一致性系数(Kendall’s $W$)在各项指标上均达到 $0.665 \pm 0.275$ 左右(准确性维度达到 0.687),证明了专家评估的高可靠性。统计结果表明:
-
ClinFusion 独立生成的报告在综合质量与准确性上均被放射科专家评为最高级别;
-
当接入包含知识检索(RAG)和外部器官分割/分类感知工具的 Agent 扩展系统后,模型的临床采纳度进一步增强;
-
本文提出的 RoI 锚定评估指标,在所有参评的 11 种自动化评估指标中,与人类资深医生的盲审打分呈现出最强的相关性。
ClinFusion 的技术路径表明,医疗多模态大模型的未来不是通用单体底座的简单微调,而是需要针对高维、异质医学影像重构视觉融合底座,并建立紧贴医生临床决策链路的评测基准。开源权重与评估框架的发布,也为后续开发真正可用、可信的临床级 AI 辅助诊断系统铺平了道路。