MedClaw:不调权重,仅靠100条样本蒸馏拿下长程手术视频时序推理
MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
在医疗多模态大模型的研发中,数十分钟乃至数小时的手术视频一直是最难啃的硬骨头之一。手术教学、资质认定以及术后质控复盘,极度依赖一种被称为“长时程时序推理”(Long-horizon Temporal Reasoning)的能力:回答“在某个关键步骤之前或之后医生做了什么”、“某种意外状况是如何逐步演变而来的”。这类问题的答案往往不依赖于单一静止帧的视觉特征,而是分散并深埋在漫长手术流转的数千秒画面中。
ArXiv URL:https://arxiv.org/abs/2608.14015v1
现存的主流解法普遍陷入了两难困局。一种是直接将整段视频塞给支持长上下文的视觉语言模型(Vision-Language Model, VLM),但为了适应有限的上下文窗口,模型不得不对整段手术进行大幅抽帧与特征压缩,导致识别微小解剖结构、细致手术器械所必需的高分辨率细节严重丢失;另一种方案是走强化学习或微调路线,训练端到端的视频智能体(Video Agent)学会“在何时把镜头移向何处”。然而,这类方法对高质量轨迹数据极度饥渴,更致命的是,一旦遇到跨科室、高门槛的未知术式(例如从未见过的复杂脑神经外科手术),微调出的定位策略往往迅速失效。
由北京交通大学、北京天坛医院、首都医科大学、西湖大学等机构联合提出的 MedClaw,尝试通过一种完全不同的范式打破这一死锁。该系统提出了一个完全无需调整模型权重的 Agent 框架(Agent Harness),在架构上严格解耦了“时序规划推理”与“底层视觉感知”。更关键的是,研究团队设计了一套无梯度、奖励门控的“启发式技能蒸馏”(Heuristic Skill Distillation)循环:系统不再优化数以亿计的神经网络参数,而是通过挖掘自身失败的检索轨迹,仅用约 100 条有标注的问答样例,就蒸馏出了可复用的时序检索策略。在自建的长神经外科手术以及公开手术演讲基准上,MedClaw 的表现不仅全面超越了一众单次输入的顶级通用 VLM,更大幅领先于现有的开源视频 Agent。

将推理与感知物理隔离:Agent Harness 的设计哲学
传统端到端多模态模型试图让同一个骨干网络兼揽全局全局时间轴感知与局部毫米级像素识别,这在信息密度极高、时间跨度极长的专业医学视频中往往两头不讨好。MedClaw 采取的策略是将大脑(推理规划)与眼睛(视觉感知)彻底拆解为独立的系统组件。
整个系统的核心是一个纯文本的调度器(Orchestrator)$\pi_{\theta}$。调度器本身采用冻结参数的大型语言模型,它自始至终不需要直接“看”到底层的原始视频像素,因而不会受到海量视觉 Token 对上下文空间的挤占。调度器依靠 Reason-Act(ReAct)循环运行:在每一个决策步 $t$,它根据当前的上下文状态 $c_t$ 生成工具调用动作 $a_t = (T_{i_t}, u_t)$,其中 $T$ 代表调用的具体工具,而 $u_t$ 则包含时间范围或缩放区域等结构化参数。工具执行后返回文本形式的视觉观察 $o_t$,上下文随之更新为 $c_{t+1} = c_t \oplus (a_t, o_t)$,直到调度器认为证据已经充分闭环,才输出最终的自然语言诊断与解答。
负责在像素层面执行指令的,是一组被冻结参数的视觉子智能体(Vision Sub-agents)$\psi$。视觉子智能体封装在固定的工具接口之后,分别负责从宏观到微观的渐进式感知任务。工具箱 $\mathcal{T}$ 构筑了三层递进的视觉颗粒度:第一层是对全视频进行粗粒度扫描,定位出潜在的候选时间窗口;第二层是对定位出的时间切片(Segment)进行密集的时空裁剪与细读;第三层则是将特定时刻的单帧放大、检查微小的解剖解剖变异或器械特征。此外,系统还挂载了一个专用的外挂医学知识检索工具 search_surgical_kb,基于 PubMed 摘要和权威文献中总结的内窥镜视觉线索构建,用以在调度器遇到冷僻手术专业术语时提供精确的解剖学概念对齐。
这种“外挂工具+纯文本上下文调度”的架构带来了一个极其关键的临床优势:透明度与可审计性(Auditability)。在手术复盘等高责任医疗场景中,黑盒模型的端到端输出往往令人心存疑虑;而 MedClaw 的每一次判断,都伴随着一段完全可追踪的工具调用轨迹 $\rho = ((a_1, o_1), \dots, (a_T, o_T))$。主治医生不仅能看到模型最终给出的回答,还能清晰地复核它调取了哪一分哪一秒的片段、放大了哪个视场、引用了哪篇文献,从而快速判定其推理逻辑是否立得住脚。

不改权重改上下文:仅需 100 条样本的启发式技能蒸馏
拥有了工具箱与调度器之后,真正的难题落在了策略上:面对一段长达半小时的手术录像,调度器如何知道在什么情况下该调用什么工具?如果通过强化学习(RL)去端到端微调策略模型,不仅训练开销极其昂贵,还需要数以万计甚至几十万条专家轨迹数据,稍有不慎就会过拟合到训练集见过的特定手术类型中。
为了摆脱对梯度更新的依赖,研究团队提出了一种完全基于上下文优化的学习机制——启发式技能蒸馏(Heuristic Skill Distillation, HSD)。该机制的核心假定是:模型的感知能力本身已经足够成熟,欠缺的只是在面对特定长时程问题时“如何组织检索”的操作经验。
HSD 循环极其轻量,它仅仅切分了 100 条带标注的问题样本:其中 60 条划入“挖掘集”(Mining Set),剩余 40 条作为“验证集”(Validation Set)。整个学习过程完全在推理层自我演化:
-
收集失败轨迹:让初始的 MedClaw 智能体在挖掘集上运行,筛选出那些得分较低的失败轨迹。
-
反思与诊断:将低分轨迹与标注的黄金标准(Gold Standard)比对,系统会自动对失败原因进行三分类诊断——是不可达的不可抗力(如原始画面极度模糊)、本身答案已被误判,还是属于工具调用次序不合理的“操作性缺陷”(Operational Failure)。
-
策略提炼与门控验证:针对操作性缺陷,系统自动总结出操作层面的候选技能文本(Candidate Skill),详细描述该技能应被触发的情境以及具体的工具调用参数范式。候选技能被送往验证集,只有当它能显著拉升验证集在多维度评估上的奖励得分时,才会被正式收录到外挂技能库 $\mathcal{S}$ 中。
令人惊讶的是,这套无梯度循环最终收敛出的外挂技能库非常精炼,其中最关键、贡献最大的一项策略被命名为“定向重看”(Directed Re-look)。以往的视频模型在回答“在切除肿瘤之前做了什么”时,往往错误地停留在定位到的“切除肿瘤”这一核心动作窗口内反复找细节,最终不可避免地产生幻觉。而通过挖掘自身错误,MedClaw 自主提炼出了一条深刻的经验规则:对于“前序(Before)”或“后续(After)”这类时序因果问题,真正的视觉证据绝大部分情况下并不在事件发生的窗口内部,而在紧挨着该事件的前置或后置相邻窗口中。一旦触发“定向重看”技能,调度器会在定位到核心事件后,主动跳出当前时间段,强行对相邻切片进行裁剪与二次读取。正是这样一条简单却极其贴合手术事实的检索技能,显著降低了长程时序推理的盲目性。
过滤四种捷径:构建防泄露的基准 MedClawBench
为了科学评测智能体在长手术视频中的真实推理水平,研究团队构建了专门的测试基准 MedClawBench。当前绝大多数医学视频问答数据集存在严重的测试泄露和“虚假长程”问题:有的数据集全是几秒钟的预剪辑短片;有的视频包含同步语音解说,模型只要把音频转文字就能直接抄出答案;还有大量问题即便把视频画面全部抹黑,语言模型单凭文本医学常识也能猜个八九不离十。
MedClawBench 收集了 $1{,}123$ 道开放式问答题,数据来源涵盖了天坛医院等自建的复杂长神经外科手术实录(中位时长 $18.4$ 分钟,超过 $20$ 分钟的长视频占比高达 $41\%$),以及由 SurgVidLM 提出的公开手术演讲视频切片。为了杜绝模型“走捷径”,所有题目必须强制通过一套极其严苛的多道级联过滤器(Filtering Cascade):
-
时长过滤:剔除所有低于 10 分钟的碎片视频,确保测试场景严格聚焦于长时程。
-
盲测过滤(Blind Filter):在完全不提供视频输入的情况下,让纯文本大模型(DeepSeek)直接答题。如果单凭文本先验就能答对(得分 $\ge 3$ 分,满分 5 分),说明该题目考查的是记忆而非视觉,直接淘汰。
-
音频过滤(Narration Filter):针对带解说的公开演讲视频,系统仅提供音频轨道让模型作答。一旦听音频就能答出答案的题目被一律剔除,强制模型必须从手术画面的视觉证据中找答案。
-
局部有效性过滤(Local Filter):确认只给目标时间窗口的高清密集观测时模型能够答对,以此保证题目本身是具备视觉可解性的,而非由于画面缺失导致的无解死题。
-
神经外科保真度过滤(Faithfulness Filter):由专业神经外科医生对机器生成的问答对进行事实性复核,严格剔除脱离手术事实的幻觉内容。
最终保留下来的问题被精细拆分为两大类:一类是视觉感知推理(Visual Perception Reasoning, VPR),侧重于在定位后辨识特定的器械、解剖变异或计数量;另一类则是极度考验全流程理解的视觉时序推理(Visual Temporal Reasoning, VTR),重点考察跨越多个阶段的操作演变与因果承接。
实验结果与深度分析
评测采用四维综合评分体系,分别从信息正确性(CI)、细节关注度(DO)、上下文理解度(CU)以及时序理解度(TU)四个维度(每个维度 1 至 5 分)衡量生成文本的质量。为了验证自动化评测的可信度,研究人员邀请人类神经外科专家对自动化打分结果进行了双盲比对。结果显示,GPT-5.5 评估裁判与人类专家的评分呈现出高度一致性,在神经外科和公开手术集上的加权 Cohen’s $\kappa$ 分别达到 $0.72$ 和 $0.86$,平均分几乎完全重合(神经外科集:$2.95$ vs $2.94$),证明了自动化评测维度的临床可靠性。
在最具挑战性的长神经外科手术切分中,MedClaw 展现出了极具统治力的性能优势。使用 Gemini-3.5-flash 作为视觉子智能体底座的 MedClaw 取得了 $2.90$ 的四维平均总分,大幅甩开了当前表现最好的开源视频推理大模型 VideoChat-R1-7B($2.14$ 分),领先幅度达 $+0.76$ 分。即便是与同样以 Gemini-3.5-flash 为底座、采用端到端单次输入(One-shot)方式直接推理相比,搭载了 MedClaw 框架后模型在所有四个评测维度上均实现了净增长,平均分提升了 $+0.17$ 至 $+0.56$ 分。而在演讲视频数据集 SVU 上,即便将视觉底层切换为更加轻量低廉的 Gemini-3.1-flash-lite,MedClaw 的表现依然全面优于对应的单次输入基线。
这一对比揭示了一个深刻的现象:以往专门针对视频进行端到端微调的模型(包括医学专用模型 SurgVidLM 和重看模型 ReWatch-R1-7B),在面对神经外科这种长达数十分钟且专业壁垒极高的长程视频时,表现甚至落后于通用的单次前向大模型。这证实了端到端参数微调在跨领域超长视频中的脆弱性——它们在训练集学到的注意力分布很难泛化到新的术式中。反观 MedClaw,底层模型未动分毫,仅仅依靠框架赋予的粗到细检索链路与外部沉淀的检索技能,就成功跨越了数据分布的鸿沟。
在消融实验部分,研究人员系统剥离了各个模块以观察其对性能的实质影响。数据表明,一旦移除外挂技能库中的“定向重看”策略,模型在长程时序推理(VTR)上的得分直接下跌,成为系统各项能力中降幅最显著的部分。进一步的底座替换实验证明,无论将纯文本调度器替换为其他商业推理模型,还是将视觉子智能体替换为不同参数规模的视觉模型,MedClaw 的框架增益始终保持稳健。这一特性确立了该框架作为一种即插即用(Plug-and-play)基础设施的实用价值。
总结与展望
MedClaw 证明了在超长专业视频理解这一前沿高地上,“通过演化上下文与外挂技能,而非强行更新神经网络权重”具有巨大的可行性与独特的工程优势。长达数十分钟的手术录像,其信息瓶颈往往不在于像素级特征无法表征,而在于模型不知道该以何种策略去逐级筛选、回溯那些跨越漫长时间轴的细微线索。
通过将复杂的长时程时序感知任务分解为可审计的工具链,并仅用极其微量的样本进行启发式经验反思,MedClaw 走出了一条轻量、透明且兼顾跨领域迁移能力的新技术路线。对于未来临床智能助手的落地而言,这种将高风险推理置于明处、随时接受临床医生检查与经验注入的系统范式,无疑比一味追求端到端黑盒参数扩张提供了更为踏实且值得信赖的解题思路。