Google DeepMind提出ResidencyRL:多轮RL训练临床AI,遗漏风险降低31%
ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

在现实世界的医学教育中,医学生将书本上的学术知识转化为真正的临床专业能力,必须经历漫长而高压的住院医师规范化培训阶段(Residency)。在这个过程中,他们需要在数千次真实的医患互动中积累经验,接收来自上级医生和患者的多样化反馈,并逐渐承担更大的独立决策权。临床推理绝不是对静态病历的机械作答,它高度依赖于患者面诊时的动态对话。在对话中,临床医生必须引出病史、不断修正诊断假设,并在高度不确定性下做出后续管理决策。
ArXiv URL:https://arxiv.org/abs/2608.07418v1
当前的大型语言模型(LLMs)在处理静态医学考试和基准测试时,已经表现出媲美甚至超越人类专家的水平。然而,在面对动态且充满变数的完整临床决策序列时,这些模型往往表现出与初级医生类似的致命弱点:过早闭合(Premature closure)。过早闭合是临床实践中最常见的诊断错误来源,意味着医生或AI系统在收集到表面症状后过早地下定论,从而忽略了可能改变诊断结果的关键隐藏信息。当患者病情呈现非典型特征、刻意隐瞒信息或提出对抗性需求时,现有的AI系统极其容易受到误导。来自Google DeepMind、休斯顿卫理公会医院、斯坦福肿瘤病学合伙人机构等多家顶尖机构的研究人员联合指出,这是医学过程优化上的缺失,而不仅是医学知识储备的不足。
为了解决这一痛点,研究团队提出了ResidencyRL。这是一种创新的在线多轮强化学习(RL)方法,旨在通过模拟动态且完整的临床面诊,对临床AI智能体进行训练。ResidencyRL支持极长视野的序列决策,每个轨迹可扩展至多达60个对话轮次和8个结构化环境交互。研究最核心的突破在于,经过这种高保真“住院实习”后,AI智能体在对抗条件下的诊断准确率相比基座模型提升了7.0%(从81.0%升至88.0%),而遗漏关键红旗警示(red flags)的概率则大幅降低了31%。这项工作明确证明,通过在模拟环境中进行多轮强化学习,AI可以有效地掌握复杂的序列临床决策能力,并在盲测中获得了人类临床专家87.6%的胜率偏好。
为AI打造全真“住院医师”环境
将医学AI推向真实世界,最大的障碍在于训练环境的保真度。过去的临床对话基准通常依赖于僵化的症状本体论,或者仅仅考察模型的历史信息收集能力,完全忽略了后果严重的临床行动(如医疗记录、管理计划或分诊)。ResidencyRL的设计理念是,如同人类医生一样,AI的临床熟练度必须在极度贴近真实的实践中锻造。
研究团队首先构建了一个包含生成、提议与评判流水线的场景合成系统。在这个流水线中,不仅合成了海量的常规远程医疗咨询场景,还精心设计了针对复杂病史收集的特化场景,以及对抗性的安全挑战场景。为了防止模型产生代表性偏差,并在罕见和高风险表现面前保持警惕,研究者刻意将多阶段生成管道与自动化临床验证结合起来,生成了数万个具备丰富患者背景、详细临床表现和排名鉴别诊断的病例。
特别值得注意的是其中的对抗性安全场景。这些场景覆盖了9个不同的临床安全分类,例如:最小化红旗症状的急性心肌梗死(测试紧急升级判断)、针对文本远程医疗不安全情况下的临床边界执行、诱导模型过早闭合的非典型表现、违反安全处方边界的药理学限制,以及面对患者急性心理健康危机时的降级处理技巧。通过这些精心设计的“刁钻”病患,模型在训练期就被逼迫着去面对医疗活动中最棘手的人性与伦理考验。

多模态交互与结构化反馈机制
在模拟环境中,担任“主治医师”的AI智能体需要面对一个基于Gemini 3.5 Flash构建的高级患者模拟器。与以往合作性质的基准测试不同,这里的患者模拟器被赋予了复杂的行为特征:他们可能会轻描淡写自己的严重症状、隐瞒不良病史,或是抗拒医生的建议。模拟器在每一轮都会识别AI医生的提问,查阅底层设定好的真实病历,然后给出一个符合患者人设的自然语言回复,同时它内部还会经历十一项失败模式检查,确保不会过度配合AI从而泄露剧透信息。
AI智能体的行动空间不再局限于纯文本的聊天。ResidencyRL框架暴露了一个模仿真实结构化临床工作流的工具调用API,涵盖七大功能:查看患者初始病历、提交主要诊断、提交带有推理链的鉴别诊断排名、进行紧迫性分类、制定结构化的后续管理计划、生成通俗易懂的患者沟通摘要,以及撰写标准化的SOAP(主观、客观、评估和计划)临床笔记。这些工具让AI医生的行为产生了实质性的临床重量。

由于患者模拟器无法真正对处方产生生理反应,ResidencyRL利用基于大型语言模型的自动化评分器(Autorater)来作为裁判。在长达数十轮的完整对话结束后,评分系统会基于遭遇战的文字记录和工具调用记录,对照地面真实病历进行评估。评分维度包含六大临床核心:诊断准确性、管理质量、筛查完整性(即病史问诊)、以患者为中心的沟通、临床文档记录以及对话风格。任何违反安全底线的行为都会触发严厉的惩罚标志。这一结构化的奖励信号最终会被送入群组相对策略优化(GRPO)算法中,用于不断更新AI智能体的策略网络。
训练动态显示,模型在追求彻底的临床调查和保持对话效率之间经历了一个艰难的探索过程。随着训练步数的增加,中位面诊长度逐渐从18轮增加到23轮,说明模型学会了为了获取隐藏的关键信息而进行更深入的追问。同时,在每一轮对话中,智能体用于内部临床推理的计算量也在稳步上升,这表明模型正在从一个“见招拆招”的简单问答机器人,进化为一个在行动前深思熟虑的序列决策系统。
打破过早闭合:在对抗与不确定性中的安全表现
ResidencyRL最令人瞩目的结果是在同分布的保留评估集上,特别是在面临对抗性挑战时的表现。在传统的模型中,面对症状具有误导性或患者隐瞒关键病史的场景时,模型极容易顺着患者的话语直接得出结论,导致灾难性的误诊或漏诊。
实验结果表明,经过多轮强化学习训练后,智能体在对抗性情境下未能提出关键问题的比例从65.5%大幅下降至43.5%(下降22.0个百分点),而遗漏红旗警示信息的比例也从45.5%降至31.5%(下降14.0个百分点)。这标志着系统在缓解过早闭合这一医学认知陷阱方面取得了实质性的突破。智能体学会了在表面症状背后进行深挖,而不是急于下达诊断结论。这种安全余量的提升在真实的医疗环境中,可能直接等同于拯救生命的防线。
在盲态进行的面对面人工评估中,由97名持有执照的认证临床医生对基座模型与ResidencyRL训练模型生成的临床处理记录进行了对比审查。结果具有压倒性:在整体临床印象方面,医生们在87.6%的案例中更偏好经过ResidencyRL训练的智能体。细分来看,训练后的智能体在信息收集完整性上的胜率高达90.7%,在管理计划合理性上的胜率为75.3%。这一结果强有力地证明了,仅仅拥有广泛的医学知识库是不够的,遵循科学严谨的临床探究路径才是赢得专业人士信任的关键。
强大的跨领域与纵向泛化能力
评估一个通过模拟环境训练出的AI系统,最核心的质疑在于:它是否只是死记硬背了训练模拟器的特定偏好?为了回答这个问题,研究人员将经过ResidencyRL训练的智能体暴露在了完全未见过的临床评估基准中。
在AMIE Mx(一个专注于长期随访和纵向临床管理的基准测试)中,模型展现出了惊人的泛化能力。ResidencyRL智能体在所有六个临床评估维度上均完胜基座模型。其中,临床管理推理能力从80.1%提升至88.4%,这反映出模型在疾病特定的知识运用、持续监测调整以及预后判断上具有更强的素养。同时,模型在以患者为中心的沟通方面取得了显著进展,从83.7%跃升至92.2%。即使是面对需要多次就诊记忆的连贯性管理,训练后的智能体也表现出了极强的连贯追踪能力。
不仅如此,研究团队还将该模型应用于由专家精心策划的肿瘤学场景测试中。需要强调的是,肿瘤学在整个ResidencyRL的训练阶段属于完全未见过的专业领域(Out-of-domain)。然而,在这一严苛的领域内,模型同样在临床准确性、处理完整性和行动可操作性等维度上表现出了显著的进步。同时,在AgentClinic和CRAFT-MD这两个外部基准上,该模型同样维持了稳健的方向性改进,充分展现出其通过强化学习所习得的临床路径策略,是一种底层的、通用的“行医方法论”,而不是针对某种疾病的特定拟合技巧。
从模拟演练到真正临床应用的必由之路
ResidencyRL证明了临床医学中的序列决策不仅可以被量化,还可以通过大规模的自我对弈与反馈来进行深度学习优化。正如人类住院医师通过一千个不同病例的折磨才能磨砺出直觉敏锐的临床感官一样,大型语言模型也需要脱离静态文本,置身于模拟的、甚至是带有敌意的复杂互动环境中,才能真正学习到“医生”这一角色的精髓。
研究也清醒地指出,基于LLM打分的惩罚和奖励机制,依然是对真实世界医疗干预结果的一种代理。智能体当前的成功是在数字孪生的沙盒中实现的,距离在临床一线直接面向患者还有漫长的路要走。尽管安全故障率已经有了三分之一左右的下降,但面对人命关天的医疗任务,绝对数值上的遗漏率依然有着进一步压降的空间。
不过,ResidencyRL提供了一个强有力的框架证明:让模型置身于动态多轮的环境中,并辅以严密的奖励结构,是攻克大模型医学推理短板的有效武器。未来,随着真实世界临床反馈循环的逐步引入,这一技术不仅将极大地加速医学AI从“智能医书”向“虚拟主治医师”的演进,更可能为人类医生的培训和辅助提供一个不知疲倦、安全可控的顶级演练对手。