Video-DeepResearch:解耦感知与检索,开源35B超越Claude-4.5
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

在过去一年里,具备自主规划、信息检索与长程推理能力的深度研究智能体(DeepResearch Agent)迅速成为大模型落地的前沿战场。从最初依靠纯文本搜索引擎的 AutoGPT、WebGPT,到结合逆向图像搜索的视觉深度研究框架,模型处理静态网页与图文信息的能力已经相当成熟。然而,当这类智能体试图进入信息密度更高、时空动态更复杂的真实数字环境——视频流时,现有的技术范式遭遇了显而易见的挫败。
ArXiv URL:https://arxiv.org/abs/2608.03979v1
视频不是几张孤立静态图片的堆叠,它包含高度冗余的时间序列、多尺度的动态实体以及需要多跳推理的上下文线索。面对这类任务,现有的多模态模型往往展现出两种极端的“偷懒”行为:要么完全避开开销巨大的视觉工具,直接把模糊问题扔给文本搜索引擎;要么依靠庞大的内部参数记忆进行无凭据的幻觉猜测。
针对这一困境,研究团队提出了首个面向连续视频流的深度研究智能体框架 Video-DeepResearch(简称 Video-DR)。该工作打破了传统智能体自由调用工具的既定思维,提出了一种“感知与探索解耦”的分阶段工具解锁机制,强迫模型在跨帧完成穷尽的时空视觉定位之后,才被允许访问外部网络检索。结合监督微调(SFT)与群体相对策略优化(GRPO)强化学习,开源模型 Video-DeepResearch-35B-A3B 在全新的 VideoDR-Bench 基准上取得了 64.0% 的平均准确率,不仅以 5.0 个百分点的优势超越了专有模型 Claude-4.5-Sonnet(59.0%),更显著领先于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。哪怕是更紧凑的 30B 变体,也交出了 59.3% 的优异答卷。

视频智能体的隐蔽死穴:模态偏置与参数泄露
要理解 Video-DeepResearch 的架构创新,必须先认清当前多模态大模型在处理长程视频任务时的真实执行习惯。许多人直觉上认为,只要给多模态模型挂载关键帧截取和以图搜图的工具,模型就能自然而然地像人类侦探一样反复调取视频帧破案。然而,作者团队在前期基准测试中观察到了非常反直觉的现象。
最突出的问题是模态偏置(Modality Bias)。在缺乏硬性交互约束的环境中,即便给予智能体完整的视觉操作工具,模型也会表现出对主动视觉探索的系统性厌恶。即便业界顶尖的开源多模态模型,在单个复杂任务中平均仅调用 0.10 次视觉工具,却调用了 1.27 次文本搜索。原因非常现实:多模态大模型的语言骨干网络天然对高维、密集的时空视觉信号感到“疲倦”,面对模糊的视频提问,智能体更倾向于从问题中提取几个关键词,盲目地发起网页搜索,寄希望于通过海量文本撞出答案。这种行为导致所谓的多模态研究退化成了带有一张无用首帧的纯文本检索。
另一个隐蔽却更具破坏性的问题是参数化知识泄露(Parametric Knowledge Leakage)。评测发现,在未调用任何视觉工具且文本搜索调用次数接近于零(仅 0.12 次)的情况下,未微调的通用闭源大模型居然在基准测试中拿下了 57% 的高分。这并不意味着模型的长程探索能力强大,恰恰相反,它暴露了现有评测基准中的大量题目本质上是模型内部预训练权重“背诵”过的静态常识。模型根本没有在时空维度上完成证据链闭环,仅仅凭借参数记忆就直接蒙出了最终答案。如果在训练和评测中放任这种现象,智能体的自主推理机制便形同虚设。
解耦感知与探索:分阶段解锁工具
为了彻底扭转模型的规避倾向,Video-DeepResearch 确立了核心设计原则:将时空维度的实体锚定与广域开放网络的外部探索彻底物理隔离,建立一套解耦的感知-探索管线(Decoupled Perception-Exploration Pipeline)。
在形式化定义中,给定研究查询 $Q$ 与包含 $T$ 个帧的视频序列 $V={v_{1}, v_{2}, \dots, v_{T}}$,智能体在时间步 $i$ 根据交互历史 $\mathcal{H}{i}$ 生成动作 $a{i} \sim \pi_{\theta}(a \mid \mathcal{H}_{i})$。在传统的通用 Agent 框架中,所有工具自始至终暴露在同一个动作空间内。而在 Video-DR 中,动作空间被打上了严格的时间锁。

如上图所示,整个交互过程被机械性地划分为两个阶段:
在第一阶段(视觉感知阶段),系统仅向模型开放两个底层感知工具:用于在时间轴上锁定关键瞬间的 Select_Keyframe,以及在给定帧上根据坐标框 $B \in \mathbb{R}^{4}$ 裁剪特定感兴趣区域的 Crop_Search。在这个阶段,模型被彻底剥夺了发起文本搜索甚至直接给出最终结论的权限。智能体必须反复在视频时间序列中追踪目标实体、截取局部线索、对比多帧之间的时空演变。只有当智能体在思维链中确认视觉证据足够充分,或者触及了预设的感知最大步数阈值时,系统才会触发状态流转。
在第二阶段(网络探索阶段),动作空间才正式解锁文本搜索(Search)与网页详情解析(Visit)。此时,智能体基于前一阶段提取出的精细实体剪裁和时空上下文,构建极度精确的检索词和以图搜图请求,在开放网络中补全事实证据链,并最终组织回答。这种分阶段解锁策略从机制上切断了模型“跳过看视频直接搜答案”的取巧路径,迫使模型将注意力权重扎扎实实地分配在跨帧视觉特征的处理上。
从轨迹蒸馏到自我进化:两阶段训练策略
具备优秀推理行为的前提是拥有干净且符合新范式的训练数据。面对视频深度研究数据匮乏的现状,研究团队开发了一套可扩展的数据合成引擎,其生成流程涵盖了严格的防作弊过滤机制。
在基础 VQA 合成环节,团队通过单实体(Fact-based)与多实体组合(Compositional multi-hop)两种模式构造问题,并显式剔除浮于表面的视觉属性问答。为了彻底消灭参数记忆泄露,研究团队对生成的每一个候选问题执行了极其严格的“无工具反向过滤”:让基础大模型在不使用任何工具的情况下进行 4 次自主生成;一旦模型在任意一次尝试中蒙对了答案,该样本就会被永久废弃。最终留存下来的 30K 个视频问答对,从数学概率上保证了它们必须依赖外部工具链路才能被成功解答。
基于这套题目,团队借助高性能多模态大模型 Qwen3.5-397B 配合分阶段工具解锁机制生成执行路径,并通过拒绝采样(Rejection Sampling)筛选出 7K 条高质量轨迹。训练过程则被划分为紧密衔接的两个阶段:
首先是监督微调(SFT)冷启动。单纯依靠 7K 条视频轨迹容易导致模型在长时间感知后遗忘复杂的文本深度调研技巧,为此,研究团队引入了来自开源 Vision-DeepResearch 的 7K 条纯文本深度研究数据进行混合训练。优化目标遵循经典的自回归交叉熵损失:
\[\mathcal{L}_{\text{SFT}}=-\mathbb{E}_{(x,y)\sim\mathcal{D}}\left[\sum_{i=1}^{\lvert y \rvert}\log\pi_{\theta}(y_{i}\mid x,y_{<i})\right]\]该阶段的主要目的不是让模型穷尽特定事实,而是牢固确立分阶段工具调用的语法规则与感知状态机的执行逻辑。
随后是基于群体相对策略优化(GRPO)的强化学习探索。SFT 只能教会模型模仿预设的动作分布,无法跨越教师模型设定的能力天花板。为了激发智能体内生的探索策略,研究团队在经过难度筛选的 2K 个高质量子集上应用了 GRPO。由于消除了独立价值网络(Critic Network)的显存占用,系统能够经济地对每个任务并行采样一组轨迹并评估相对优势 $\hat{A}_{i}$:
\[\mathcal{L}_{\text{GRPO}}=\frac{1}{G}\sum_{i=1}^{G}\left[\min\left(\frac{\pi_{\theta}(o_{i})}{\pi_{\text{old}}(o_{i})}\hat{A}_{i}, \text{clip}\left(\frac{\pi_{\theta}(o_{i})}{\pi_{\text{old}}(o_{i})}, 1-\epsilon, 1+\epsilon\right)\hat{A}_{i}\right)\right]-\beta\mathbb{D}_{\text{KL}}\]在强化学习细节上,研究人员采用二元稀疏奖励(回答正确为 1,错误为 0)。尤为值得注意的是其对格式违规与无效死循环的处理:团队并没有直接对格式错误施加毁灭性的惩罚,而是对其负梯度进行了 20% 概率的下采样。这种设计既保留了格式约束的引导作用,又防止了策略优化早期大面积的死板惩罚击垮智能体探索罕见感知路径的积极性。
VideoDR-Bench:构建可信的多跳评测基准
现有的多模态测试集大多集中在简短动作分类、单帧常识识别或静态图像检索上,难以支撑对视频深研长程规划的客观度量。为此,论文同步推出了全新的人机协同评测集 VideoDR-Bench。

该基准覆盖了知识科普(29.5%)、影视娱乐(22.0%)、日常生活(18.5%)、体育游戏(14.5%)、新闻动态(12.0%)等六大多元领域,视频时长结构合理平衡,既包含 2 分钟以下的短片段,也有 10 分钟以上的长时序记录。
与传统基准相比,VideoDR-Bench 的本质区别在于其每个样本均满足“视频强依赖 + 多跳外挂检索”的双重前置条件。例如,题目绝不会问“视频第 3 秒的人穿什么颜色的衣服”,而是可能要求模型:“在视频第 7 分钟背景展柜中出现的冷门专利模型,其发明者在 1984 年参与创办了哪家非营利研究机构?”智能体若不能精准抽帧、局部裁切并识别该特定展品,后续的文本搜索便根本无法形成查询向量。这种设计彻底排除了只靠纯文本搜索或纯视觉感知单点突破的可能性。
实验结论与核心技术发现
在相同且受限的开放环境交互约束下,研究人员将搭载 Video-DeepResearch 训练范式的一系列模型与业界公认的最强基座模型进行了端到端对比。
在 VideoDR-Bench 的最终测试中,以 Qwen3.5-35B 为基座的 Video-DeepResearch-35B-A3B 斩获了 64.0% 的平均准确率,相较于其未精调的基础模型实现了高达 21.2 个百分点的飞跃,不仅将专有闭源标杆 Claude-4.5-Sonnet(59.0%)甩开 5.0 个百分点,也显著拉开了与 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)的差距。即便是采用上一代基础模型微调的 Video-DeepResearch-30B-A3B,也取得了 59.3% 的成绩,同样微弱胜过 Claude-4.5-Sonnet。
消融实验进一步印证了训练组合拳的递进增益。如果仅在 7K 视频轨迹上进行单模态 SFT,模型虽然掌握了视觉抽帧逻辑,但文本搜索的深度和精度会出现下滑;引入 7K 纯文本深度研究数据混合训练后,模型的综合推理与信息提炼能力补足了短板;而最后的 GRPO 强化学习阶段,则让模型学会了在首轮检索失败时主动回到视频时间线重采关键帧的“容错与回溯”行为,带来了关键的胜率跃升。
比准确率分数更具启示意义的,是模型在工具调用行为上的底层转变。统计显示,经过 Video-DR 范式训练后的智能体,在任务执行期间的视觉工具调用频次出现了爆发式增长,一改此前“视而不见”的懒散行为,模型在视觉裁剪定位与文本网络检索之间的分布走向了健康的动态平衡。
这一系列现象为多模态智能体研究提供了具有穿透力的底层洞察:
-
模态偏置是训练分布的产物,而非网络容量的硬伤。过去很多研究者倾向于认为小模型调不动视觉工具是因为“参数太小所以理解力弱”。然而 Video-DeepResearch 的实验给出了相反的答案:30B 的紧凑模型经过感知解耦训练后,其工具调用的丰富度与决策逻辑的合理性甚至直接超越了 397B 的庞然大物。这表明现存的工具规避很大程度上是指令微调数据分布失衡所带来的“行为惯性”,而非模型容量不足。
-
多模态对齐的本质是交互逻辑对齐。将多模态模型推向 AGI 的路径,绝非仅仅在架构前端接上更高分辨率的视觉编码器,而在于构建符合不同模态信息密度的交互与决策协议。
尽管 Video-DeepResearch 在构建高保真数据与模型闭环上迈出了决定性的一步,但该工作同样指出当前的实现面临不容忽视的算力开销:在长达数万轮的动态网页检索与跨帧高分辨率渲染中,数据合成与强化学习采样对集群 GPU 显存带来了极端压力;同时,为了保证评测零作弊,基准构建依然保留了相当比重的人工介入成本。未来如何在更轻量的架构上保持这种高强度的时空反思能力,将是视频乃至更广阔物理世界 Agent 演化必须直面的下一个课题。