医疗Agentic AI最新综述!四大架构解构+557项研究全景映射
Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

在各类大语言模型接连攻破医学执业医师资格考试题库之后,医疗人工智能领域迅速陷入了一种乐观的错觉。然而,任何具有真实临床经验的人都清楚,能解答多选题的系统与能够在重症监护室或复杂门诊中协助决策的系统之间,隔着一条巨大的鸿沟。真实的临床工作不是静态的单步问答,而是一连串在不确定性、时间压力和信息残缺状态下的连续决策——医生需要调阅既往电子病历、开具靶向检验检查、比对前后多次影像、翻阅最新临床指南,并在患者病情发生变化时动态推翻先前的假设。
ArXiv URL:https://arxiv.org/abs/2607.25489v1
单纯依靠基石模型(Foundation Models)的端到端直接生成,无法胜任这种高风险的多步任务。医疗人工智能正因此经历一场深刻的范式迁移:从依赖单模型单次预测的传统深度学习,跨越至由多步规划、工具调用、长期记忆、动态环境交互和协同推理驱动的“智能体系统”(Agentic AI)。来自大连大学、香港中文大学(深圳)、香港理工大学、加利福尼亚大学旧金山分校(UCSF)以及耶鲁大学的研究团队,在最新发表的范围综述中对该领域展开了系统证据映射。该研究从 5 处权威数据库检索到的 1,649 篇记录中,严格筛选出 557 项符合真实智能体机制的独立研究,首次全面厘清了医疗智能体系统的技术架构、应用场景与落地困境。
这项工作最核心的洞察在于:基石模型绝不等于智能体 AI。基石模型提供的是底层的语言表征、图像感知与泛化推理能力,而 Agentic AI 是一种系统级编排范式(Orchestration Paradigm)。它将大模型作为中枢控制器,结合专用计算工具、医学检索库、多模态算法与审计约束,构建出具有目标导向的临床工作流。然而,研究团队通过对 557 项研究的证据穿透发现,当前该领域的“繁荣”高度依赖公开基准测试与回顾性模拟,整个学术界对过程可靠性、证据可追溯性以及前瞻性真实临床验证的关注严重不足。

从预测黑盒到系统编排:医疗范式的代际跨越
回顾医疗人工智能的发展历程,早期系统主要由专家系统和经典机器学习主导,随后进入以卷积神经网络和判别模型为主的深度学习时代。这一时期的核心范式是“输入映射到输出”:给模型一张胸部 X 光片,输出肺炎概率;给一段临床文本,抽取命名实体。这些模型虽然在封闭边界任务上表现出优异的受试者工作特征曲线下面积(AUC),但缺乏上下文适应能力,无法调用外部资源,更无法反思自身的判断。
多模态大模型的出现拓宽了表征边界,但直接将其应用于临床诊断依然面临致命硬伤:幻觉无法根除、推理链路不可审查、对时效性知识迟钝,且无法自主操作临床信息系统。医疗 Agentic AI 的出现并非为了取代底层模型,而是重塑了任务执行的控制论逻辑。在智能体视角下,复杂的医疗诊疗被视为部分可观测马尔可夫决策过程(POMDP),其数学形式可抽象为元组 $\left\langle S,A,T,R,\Omega,O\right\rangle$。
在这个框架中,患者的真实生理状态 $S$ 往往是部分隐藏的,系统只能通过有限的临床观测 $\Omega$ 获得表象信息 $O$。智能体需要基于当前的信息状态,自主规划下一步行动 $A$——这一动作可以是在电子病历中检索某项三年前的病理报告、调用专业影像分割工具圈定病灶边缘、向药物数据库发起相互作用查询,抑或是向主管医生发起警报并主动放弃自主决策。这种引入了任务分解、记忆维持与自适应修订的闭环系统,才真正开始逼近临床推理的动态本质。
557 项研究所沉淀的四大技术架构家族
通过对纳入的 557 项研究进行深入解构,论文系统梳理了当前医疗智能体系统的四类主流技术架构形态,并指出了各类形态在工程与临床双重维度上的核心取舍:
第一类是单智能体工具调用架构(Single-Agent Tool-Use Architecture)。这是目前落地最为广泛的形态,系统通常由一个强大的通用大模型或多模态大模型担任中央控制器。控制器负责解析非结构化的临床任务意图,将其拆解为有序的执行子图,随后按需调用预先封装好的外部工具链。例如,在处理复杂病历分析时,EHRAgent 通过自主编写并执行 SQL 或 Python 代码,在庞大的时序数据中提取特定的生命体征趋势;而在多模态诊断场景中,MedRAX 等系统则将影像分割模型、测量工具和报告生成模块作为下游执行器加以编排。这种架构的优势在于控制链路单一、因果关系清晰、系统确定性相对较高。然而,其致命短板在于单点依赖:一旦中央控制器的初始任务规划出现偏差,或者工具返回了噪声数据,错误就会沿着单向管道层层放大,导致最终输出严重失真。
第二类是多智能体协同架构(Multi-Agent Collaboration Architecture)。这类系统试图在硅基世界中模拟人类医院的多学科会诊机制(MDT)。在这类设计中,不同的智能体被赋予明确的角色设定、专业领域知识与行动边界,例如分别扮演影像科医师、病理科医师、临床药师以及主治质控医师。像 MedAgents 和 MDAgents 这类代表性系统,通过结构化通信协议让多个智能体围绕同一病例展开多轮辩论、补充论据并最终达成共识。论文作者在此提出了一个极其清醒的警示:基准测试数据表明,多智能体协同并不必然优于经过良好微调的单一强基模型。如果智能体之间的角色划分缺乏实质性的临床任务映射,所谓的协同很容易退化为多模型输出的机械重叠,甚至会诱发错误观点的虚假共识。此外,多智能体之间的交互显著增加了推理延迟与计算成本,在面临分歧时若缺乏可解释的证据仲裁机制,整个系统往往会陷入死循环或做出不可预测的折中。
第三类是外部知识增强架构(External Knowledge-Augmented Architecture)。该架构旨在切断大模型对静态参数化记忆的完全依赖。在药物警戒、罕见病筛查以及跨学科用药推导等高知识敏感型领域,如 MALADE 和 Rx Strategist 等系统,通过深度链接临床指南、PubMed 最新文献、FDA 药品说明书以及结构化医学知识图谱,将循证检索嵌入推导流程。与通用的检索增强生成(RAG)不同,医疗智能体不是一次性抓取文档碎片,而是根据推理的阶段性中间状态,动态评估检索证据的权威性、发表时间与临床指南推荐等级。该架构的挑战不在于接入了多少知识库,而在于对检索证据的时效性验证与冲突消除:当两份权威指南在某一疾病的二线用药上存在分歧时,智能体能否正确识别指南的适用人群边界,而非机械地将矛盾文本混合输出。
第四类是多模态医疗智能体架构(Multimodal Medical Agent Architecture)。临床医学本质上是跨模态的。虽然像 CheXagent 这样的视觉语言模型已经展现出惊人的胸片理解能力,但它在本质上仍偏向于感知层。真正的多模态医疗智能体(如 MMedAgent)需要将放射学影像(CT、MRI、X光)、数字病理切片、连续心电图监护信号以及结构化病历文本整合至统一的任务流中。系统不仅要“看懂”像素,更要根据文字病历中的主诉去主动检索特定序列的核磁影像,并在生成最终报告时,将自然语言诊断中的每一句话反向锚定到图像的具体三维坐标上。这种跨模态对齐不仅需要消除不同检查设备带来的格式与质量异构性,更必须确保生成的文字断言拥有不可辩驳的像素级物理证据支撑。
这四类架构在实际复杂系统中往往是交叉融合的,代码执行(Code Execution)更是作为一种通用底层能力穿插其中。通过调用代码沙箱,智能体能够实现高精度的医学剂量计算、生存分析曲线绘制以及结构化数据库透视,有效补齐了纯自回归语言模型在严密符号推理与数学计算上的先天缺陷。

严格循证下的文献图谱:557 项研究揭开的技术现状
为了跳过概念炒作、摸清医疗智能体技术的真实底色,研究团队制定了严苛的文献筛选标准。如图 1 所示,研究在 PubMed、IEEE Xplore、Europe PMC、arXiv 以及 medRxiv 五大数据库中展开跨学科检索,时间跨度锁定在 2022 年至 2026 年中旬。初始检索共捕获 2,192 条记录,在剔除无法独立导出和重复的数据后,进入标题与摘要初筛的记录达 1,649 项。
研究团队强调,一项工作能否被定义为医疗 Agentic AI,绝不取决于其标题是否包含了“Agent”或“AI Agent”这类流行词汇,而完全取决于其是否在真实工作流中实现了明确的智能体机制。在对 665 篇全文进行深度资格审查后,有 108 篇被剔除——其中大量被排除的研究仅仅是调用了 GPT-4 的 API 进行常规医学问答,却在摘要中冠以“智能体”之名。最终,557 项具备明确目标导向多步执行、工具交互、状态记忆、反馈自纠错或多智能体协同机制的独特研究,构成了该领域的全景证据映射底座。
通过对这 557 项核心文献的分类归纳,研究勾勒出了医疗 Agentic AI 的应用分布光谱。医学影像分析与报告辅助生成占据了显赫的版块,其演进方向正从单纯的病灶分割向“读图-调阅病史-出具分期诊断-建议追加检查”的全闭环辅助迈进;电子健康档案(EHR)理解与临床表型挖掘构成了第二大阵地,基于 MIMIC-IV 等公开重症监护数据集的试验层出不穷;此外,在临床试验受试者匹配、自动化真实世界证据抽取以及基于药物相互作用网络的精准处方推理中,智能体系统也展现出远超传统单任务模型的灵活性。
繁荣背后的临床落地断层:六大维度的现实拷问
尽管学术产出在过去数年间呈现指数级井喷,但在论文详尽的证据评估下,当前医疗 Agentic AI 的临床就绪度显得相当脆弱。研究团队构建了涵盖六大维度的评估框架:任务性能(Task Performance)、过程可靠性(Process Reliability)、证据可追溯性(Evidence Traceability)、系统安全性(Safety)、临床实用性(Clinical Utility)以及外部泛化效度(External Validation)。正是这六个维度的对照,揭示了该技术由代码仓库走向病房时的巨大断层:
第一,评价基准的严重窄化与虚假繁荣。在纳入的 557 项研究中,绝大多数工作依然沉迷于单一任务指标的跑分竞争,如分类准确率、F1 分数或 BLEU 语言重合度。系统往往在经过深度清洗的公共基准数据集(如 MIMIC、MedQA)上进行回顾性调优。然而,在真实医院中,电子病历充满了非标准缩写、矛盾记录、漏填项以及异构接口。在干净的开源数据上表现完美的工具调用链,一旦面对真实医院信息系统(HIS)或 PACS 系统的泥潭,往往会在第一步环境感知时崩溃。
第二,过程可靠性与错误级联的系统性缺失。现有评估往往只看智能体最终给出的“诊断答案”是否正确,却极少审计其“推理轨迹”(Trajectory)是否合规。在多步决策链中,智能体可能在中间步骤调用了错误的检验指标,却由于基石模型强大的文本归纳能力,在最后一步歪打正着蒙对了答案。这种不可见的“潜伏错误”在单次测试中难以暴露,但在长程临床部署中会诱发灾难性的错误级联传播(Error Propagation)。一旦前面的错误未被拦截,后续所有调用工具的行为都将沦为无用功。
第三,不确定性感知与拒答机制(Abstention)的缺位。一名合格医生的核心素养之一,是清楚知道“自己什么时候不知道”,并在证据不足时选择暂缓判断、请求上级医师介入。然而,绝大多数医疗智能体系统缺乏稳健的不确定性校准模块。面对模糊、自相矛盾的检查结果,系统倾向于强行完成所有预设的工作流,并给出言之凿凿却完全失实的推论。在 557 项研究中,明确设计了“置信度衰减告警”并主动向人类医生让渡控制权的系统屈指可数。
第四,证据溯源的表面化与不可审计性。许多系统宣称具备“检索增强”或“可解释性”,但其所提供的引用往往是粗颗粒度的。当一个智能体建议患者停用某种抗凝药物时,它所引用的指南出处常常是笼统的文档名称,而无法精确指明是基于指南中第几条具体推荐、对应患者的哪一项凝血指标异常。这种缺乏细粒度证据锚定的输出,不仅无法减轻医生的认知负荷,反而迫使医生耗费大量时间去反向核查智能体的文献真实性,彻底背离了临床减负的初衷。
第五,前瞻性验证与工作流集成的极度匮乏。绝大多数研究止步于原型演示阶段。几乎没有系统深入到真实的临床前瞻性随机对照试验(RCT)中去量化评估系统的引入是否真正缩短了重症患者的救治等待时间、降低了漏诊误诊率,或者提升了医疗资源周转效率。更严重的是,学术界普遍忽视了“人机交互摩擦”:当智能体生成了冗长的多学科推理报告,处于极度疲劳中的一线医护人员是否拥有足够的精力和警惕性去发现其中微小的逻辑漏洞?
通往可信医疗辅助的破局之路
面对上述系统性挑战,这篇综述并没有全盘否定 Agentic AI 的价值,而是为其未来的转化路径确立了清醒的技术坐标。医疗智能体的未来,绝不是盲目追求“完全自主行医”的脱缰野马,而必须是在严格人类监督和制度化审计边界内的“可控协同系统”。
要想跨越从算法原型到医疗器械级软件的鸿沟,未来的研究重心必须发生三个根本性转向:其一,评价体系必须从单纯评价“端到端结果质量”转向全面评估“过程执行的鲁棒性”。开发针对工具选择准确率、中间推理轨迹纠错率、异常状态恢复能力的专用医疗测试基准,是建立工程信赖的前提。其二,底层设计必须深度拥抱医疗信息标准化互操作框架(如 FHIR 协议与 DICOM 标准)。一个无法与现有医院电子病历系统实现零摩擦通信的智能体,无论在独立沙箱里跑出多高的准确率,都注定无法转化为临床生产力。其三,必须建立硬性的“安全护栏”(Safety Guardrails)与可插拔的人类在环(Human-in-the-Loop)机制。系统必须将动作权限进行分级,对于纯信息检索与初稿拟定给予较高自由度,而对于涉及侵入性操作、高危用药方案推荐等不可逆决策,必须在系统架构层强制加入多级医师审批断点。
大语言模型与多模态技术赋予了机器前所未有的医疗常识储备与推理潜力,而 Agentic AI 则为这些能力的结构化释放提供了一条极具前景的系统级路径。但面对人类生命的崇高与脆弱,医学容不得“大力出奇迹”的侥幸。唯有当智能体系统在每一个推理节点上都做到证据可查、边界清晰、知错能退,这项前沿技术才能真正从计算机学者的控制台走入无影灯下的手术室与忙碌的门诊间,成为医生手中值得托付的技术护盾。