诊断推理超93%却找不到病灶?PathAgentBench揭示病理大模型“寻证”困境

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在计算病理学领域,多模态大模型(VLM)正在经历一场看似繁荣的“虚假胜利”。如果仅看现存的学术基准测试,无论是评估单张局部切片(Patch)的视觉问答,还是基于整张切片特征聚合后的分类任务,顶尖模型的准确率动辄突破 80% 甚至 90%。然而,一旦将这些模型真正放进临床诊断流程,要求它们面对一张数十亿像素(Gigapixel)的全视野数字切片(Whole-Slide Image, WSI)独立寻找病灶并给出结论时,整个系统往往会迅速瘫痪。

ArXiv URL:https://arxiv.org/abs/2607.19261v1

这种落差的根源在于:人类病理医生的阅片过程本质上是一个“主动寻证”(Evidence-Seeking)的级联决策过程。医生面对一张巨大的切片,绝不可能在超高倍率下无死角扫视,而是先在低倍镜(如 2.5×)下巡视全貌,锁定可疑区域;随后切换至中倍镜(如 10×)确认组织架构与浸润深度;最后推至高倍镜(如 40×)审视细胞核形态与核分裂象,层层递进完成诊断。但过去绝大多数多模态病理基准测试,都把“怎么找到这个关键视野”的困难步骤省去了——模型拿到的,要么是人类专家精挑细选剪裁好的组织块,要么是已经提炼完毕的特征向量。

动机对比

为了打破这一脱离临床现实的评测范式,来自哈尔滨工业大学、新加坡国立大学、北京协和医院以及 PuzzleLogic 的研究团队构建了专门评测多模态模型“主动寻证能力”的基准体系:PathAgentBench。通过建立多尺度诊断树结构,他们测试了 20 个主流通用、医疗与病理专用大模型。实验揭示了一个惊人的反差:当人类医生把所有关键病灶的文字记录和图像端到模型面前时,顶尖开源模型的多尺度综合推理准确率可以超过 93%;但一旦要求模型依靠自主规划和工具调用在切片里定位病灶时,最强闭源模型的平均交并比(mIoU)甚至达不到 0.09,表现被一个最基础的“截取中心区域”启发式基线彻底碾压。

拆解诊断全流程:基于诊断树的四大能力闭环

要评测模型是否具备像病理医生一样的能力,首先需要把临床阅片的认知链路进行形式化解构。在数学上,全视野切片诊断的联合概率可以被分解为两个核心乘积项:在给定特定证据路径下的推理能力,以及从整张切片海量候选视野中精准找到这条证据路径的获取策略。

诊断树建模框架

PathAgentBench 将这一过程建模为一棵层级化的“诊断树”(Diagnostic Tree)。以切片缩略图为根节点,每一层子节点分别对应 2.5×、10× 和 40× 放大倍率下的局部视野边界框。顺着父子节点的包含关系,从根到叶的一条路径就代表了一次完整的由粗到细的显微镜检路线。十位持证病理专家基于来自 TCGA 的 1,822 张真实病理切片,标注了 17,135 条完整的诊断树路径,并撰写了 51,363 条尺度特异性的文字描述,最终形成了一个覆盖 16 个主要器官系统的庞大基准。

依托这套诊断树,研究团队将评估轴线拆分为四个层层相扣的互补任务:

第一个任务是证据解释(Task 1, 图像到文本匹配)。系统提供诊断树上某一特定节点的病理图像,要求模型从四个候选描述中挑出真实的病理发现。为了防止模型通过倍率前缀或器官类型投机取巧,所有混淆选项均经过语义嵌入向量筛选,严格限制在同器官、同倍率但不同病理语义的切片描述中。

第二个任务是证据验证(Task 2, 文本到图像检索)。该任务与任务一构成对称,给定一段病理文本描述,要求模型在一组图像候选中识别出真正包含该形态学特征的切片。这一任务对应着临床上的“假设验证”过程——医生怀疑某个区域存在微乳头状生长方式,随后通过镜下巡查去核实该假设。

第三个任务是整套基准的核心分水岭——证据获取(Task 3, 诊断区域定位与切片探索)。该任务彻底剥离了静态评测的温室环境,分为两种模式:Mode A(文本引导的定位),模型接收一段特定病变描述,需要通过调用裁剪工具在数十亿像素画布上自主缩放漫游,输出目标病灶的坐标框;Mode B(全切片自主探索),模型在没有先验提示的情况下,仅根据肿瘤可疑度提示,从 2.5× 开始自主决定保留哪些潜在区域,并逐层向 10× 和 40× 深入下潜。

第四个任务是证据整合(Task 4, 多尺度诊断推理)。该任务假定前面的证据获取已经由专家完美完成,直接向模型投喂由 2.5× 宏观结构、10× 组织构筑到 40× 细胞形态的三层纯文字病理特征,测试大语言模型或视觉语言模型能否像资深主任医师那样,顺理成章地给出最终诊断(Diagnose)、分诊(Triage)以及亚型或分级细化(Refine)。

任务与数据分布概览

诊断推理的高分幻觉与跨模态匹配的分化

在这项涉及 20 款模型的横向评测中,最先呈现出的是模型在静态单点任务上的显著分化。在纯文本输入的多尺度证据整合任务(Task 4)上,模型展现出了极强的医学常识与归纳能力。共有 12 款模型的综合准确率突破了 87%,其中由中国团队主导的开源模型表现尤为抢眼:InternVL2.5-8B 和 Lingshu-7B(灵枢)双双取得了 93.4% 的高分,InternVL2.5-26B 也达到了 93.2%,全面超越了 GPT-5.2 与 Gemini-3-Flash 等顶尖商业大模型。消融实验进一步证实,多尺度观察对模型推理至关重要:在绝大多数模型中,同时提供三级倍率的完整证据链比单独使用任何单一倍率(即使是最关键的 10× 结构图)准确率提升了 2.3 到 6.3 个百分点。

然而,一旦进入图像与文本的跨模态关联(Task 1 与 Task 2),模型的表现便显出疲态。在最优秀的梯队中,Gemini-3-Flash 拿下了任务一 63.5% 和任务二 67.7% 的榜首成绩,排名前五的模型表现大致落在 52% 到 68% 的区间。

令人大跌眼镜的是病理专用微调模型的表现。在普通多模态模型能维持在 50% 以上准确率的图像-文本匹配测试中,Patho-R1-7B 和 LLaVA-Med-1.5 的准确率跌落到了 19% 至 22%,Quilt-LLaVA 甚至下探到了 7% 左右——连 25% 的随机乱猜基线都没能守住。造成这种局面的核心原因在于微调分布的严重漂移:这类专用模型在以往的问答数据微调中,高度依赖模态间特定的词汇模板和问答套路,一旦面对被抹除了倍率前缀、且由 MiniLM 深度挖掘出的语义强混淆选项时,其浅层的多模态表征对齐便彻底崩溃,甚至对选项语法格式产生了过拟合干扰。

与此同时,实验还观察到了一个普遍现象:绝大多数模型在“文搜图”(Task 2)上的表现普遍优于“图配文”(Task 1)。这说明多模态模型在验证一个已经明确写出的病理假设时,比从零开始读取复杂无序的图像特征并给出准确描述更为从容。这一不对称性为后续的 Agent 架构设计提供了重要启示——以“临床假设驱动”的检索循环,远比模型漫无目的扫描图像更符合当前技术栈的能力特征。

证据获取大崩溃:定位能力为何不如简单规则?

如果说跨模态匹配只是表现平庸,那么在需要模型自主下场寻找证据的 Task 3 中,现存所有多模态大模型的表现可以用“全面崩塌”来形容。

在 Mode A 的文本引导定位测试中,研究人员为智能体封装了清晰的工具调用环境:允许模型查看图像信息、在指定坐标范围提取局部区域(ROI),并最终给出目标边界框。评测给出了明确的探索步数预算,但在 50 张切片的严格测试下,即使是推理能力最顶级的闭源模型,其预测框与病理医生金标准之间的平均交并比(mIoU)也全部低于 0.09。

更讽刺的是非模型基线的对照结果。如果完全不使用任何 AI 模型,也不看病理图像,仅仅采用一条极度机械的启发式规则——“在上一层视野的正中心直接画一个框”,其在 10× 和 40× 放大倍率下的 mIoU 可以达到 0.25 到 0.28。这意味着,耗费巨大算力自主探索、逐步分析的大模型,其定位精度只有简单居中规则的三分之一到四分之一。更有甚者,大量主流开源模型和经过医疗微调的模型,在面对这一任务时根本无法持续输出符合格式的坐标与工具调用参数,命中率直接记为 0。

进一步的算力消融实验更揭示了一个反常识的现象:给智能体更多的探索预算,反而会降低定位表现。当允许模型调用的局部切片数量从少量增加到宽裕时,整体 mIoU 呈现出倒 U 型走势,随后迅速下滑。这是因为当前多模态模型的空间规划与多轮状态追踪能力极不稳定,探索步数一多,模型极其容易在不断累积的视觉上下文历史中产生幻觉,在坐标空间迷航,最终将边界框抛向无关的背景区域。

自主探索定性案例对比

自主探索中的阶梯式溃败与高昂代价

在摆脱了显式坐标回归、将模型降级为“切片打分器”的 Mode B 全局自主探索中,情况同样不容乐观。该任务在 190 张未见过的乳腺癌独立切片队列上进行,切片带有严格的 Nottingham 分级肿瘤多边形标注。模型不需要输出绝对坐标,而是对切片在 2.5× 均匀打散的图块进行肿瘤嫌疑度评分,挑选出 Top-$K$ 个可疑区域;随后系统自动放大这些区域,模型继续在中倍镜和高倍镜下筛选子图块。

在这套看似极其稳健的自顶向下级联机制下,无条件命中率(Unconditional Hit Rate,即最终高倍镜下成功抓取到的真实肿瘤占全片所有真实肿瘤区域的比例)发生了灾难性的雪崩:

以打分表现最好的 Gemini-3-Flash 为例,在低倍镜 2.5× 下,它尚能保留 52.2% 的肿瘤图块;但到了中倍镜 10×,这一数值断崖式下跌至 18.5%;而在最关键、最需要用于细胞学诊断的 40× 高倍镜下,无条件命中率仅剩下凄惨的 2.02%。排名靠前的开源模型 Qwen2.5-VL-7B 轨迹完全一致,从低倍镜的 51.75% 逐级衰减至 18.46% 和 2.06%。

自主探索案例研究

上图的实际病例深刻展示了这种溃败是如何发生的。在左侧金标准中,黄色线条圈定了广泛分布的浸润性肿瘤。黑色边框代表理论最优的打分器(Oracle)所能保留的路径,它能够紧紧锁定肿瘤核心区。然而,蓝色框标出的 Gemini-3-Flash 和橙色框标出的 Patho-R1-7B,在低倍镜阶段就由于轻微的打分置信度失真,过早地把大量真正含有肿瘤但形态略显非典型的区域修剪(Prune)掉了。

这种自顶向下的分层探索机制存在不可逆的原罪:一旦父节点在低倍镜下被误判并剪除,其名下成百上千个潜在的高倍镜视野就永远失去了被检视的机会。哪怕后续放宽保留分支数量——例如将保留图块的配额扩大到原来的近两倍,高倍镜下的肿瘤覆盖率也仅仅能从 2.06% 微弱回升至 6.25%,而计算量却呈几何级数暴增。

除了效果上的巨大断层,证据获取过程对算力资源的消耗更是触目惊心。在针对闭源模型的推理成本剖析中,回答单道选择题(Task 1, 2, 4)的调用成本仅在 0.00025 到 0.0028 美元之间;而针对一张切片执行一次 Mode B 的分层自主探索,由于需要对成百上千张动态金字塔图块反复调用大模型进行多模态评分,单张切片的 API 调用费用直接飙升至 0.2 美元左右,耗费的绝对推理时间长达 20 到 46 分钟。证据获取步骤消耗了闭源模型端到端调用总成本的 92% 至 96%。无论从准确性、稳定性还是从经济与时延成本来看,让现有多模态模型直接接管病理切片的证据获取,在实际临床中都是完全不切实际的。

走出“静态推理”盲区:未来病理智能体的四个着力点

PathAgentBench 展现出的鲜明反差,彻底戳破了“通用大模型+病理微调即可直接落地”的乐观预期。目前业界的研发重心大量倾斜在“下游推理”上——教模型记住复杂的病理学名词、解释罕见的染色机制、撰写格式规整的诊断报告;但整张切片分析的真实痛点,却死死卡在上游的“证据获取”这一几何与规划难题上。医学专有知识与智能体空间规划能力,在技术谱系上是高度正交的两个维度,只在医学语料上微调根本换不来可靠的物理坐标理解。

基于这套严谨的评测结论,未来病理智能体(Pathology Agent)的架构演化必须直面以下四个设计维度的转变:

首先,必须建立容错与回溯机制。当前单向递进的由粗到细流水线极其脆弱,只要早期低倍镜漏掉线索,系统就万劫不复。未来的智能体必须具备“探索前沿”(Search Frontier)的动态维护能力,能够在高倍镜下发现证据不足或与临床特征矛盾时,主动回退到中低倍镜重新扩大搜索半径,打破不可逆修剪的魔咒。

其次,需要推动“假设驱动”的检索闭环。鉴于模型在验证文本假设(Task 2)上的表现明显好于盲目提取特征(Task 1),智能体不应漫无目的地在全片上漫游,而应先基于临床病史或全局低倍镜印象,生成一组鉴别诊断假设(Differential Diagnoses),随后使用特定病理表征的有监督检索工具,针对性地在切片空间内寻找支持或反驳该假设的形态学证据。

再次,空间坐标定位不能完全甩给通用多模态模型的自回归生成。大语言模型的 Token 机制在应对连续的高分辨率像素坐标时表现拙劣。更合理的系统工程应当是将宏观规划交由大模型主导,而将微观的图块排序、组织分割与坐标精炼下放给轻量级、确定性更高的传统病理专用特征提取器(如专门训练的对比学习视觉编码器)。

最后,必须正视临床落地的隐私与算力边界。单张切片耗时数十分钟、依赖频繁跨网传输数十亿像素切片切片的闭源 API 方案,无法通过医院伦理审查,也无法匹配病理科每日海量标本的流水线吞吐。构建参数规模适中、具备可靠工具调用能力、且能完全本地化私有部署的病理交互智能体,才是从学术榜单走向现实临床的唯一可行路径。