VideoDB:视频检索不是给文件打分!分层索引与可播放证据打破端到端神话
Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence

当下多模态模型的能力突飞猛进,但只要让大模型或智能体去处理真实世界中持续涌入的视频流,工程架构很快就会暴露出严重的系统性短板。很多开发者习惯于将视频检索简化为一个“图文匹配”问题:把视频切成固定片段,塞进端到端训练的视频大模型中提取向量,用户提问时计算余弦相似度并按得分给视频文件排序。然而,真实工业场景中的监控摄像头、屏幕录制、会议直播和海量归档切片,从来不是静态、封闭的“文件列表”,而是不断沿时间轴延展的连续流。
ArXiv URL:https://arxiv.org/abs/2608.08075v1
针对这一本质矛盾,基础设施团队 VideoDB 提出了一个明确判断:在物理与数字构成的视觉世界中进行搜索,本质上是一个系统架构问题,而非单纯依靠更大参数量训练出的端到端视频检索模型。他们提出了视频数据格式(VideoDB Data Format,简称 VDB),通过将视频理解的产物解耦为持久化的“视觉记忆”(Visual Memory)、任务特定的“上下文”(Context)以及能够即时流式播放的“溯源证据”(Evidence),在系统层重构了视频检索的基础设施。
在涵盖 4 个公开数据集、超过 9800 个自然语言真实查询的评测中,这套没有经过任何端到端视频检索预训练、完全由通用开源组件搭建的系统,在宏平均召回率指标 Recall@1、Recall@3 与 Recall@10 上,全面击败了以固定 API 形式交付的知名商业视频原生检索引擎,其中 Recall@1 达到了 73.09% 对 65.75%。这一结果有力地证明:在面对复杂的视觉时空信息时,精细的系统设计与灵活的多粒度索引分层,比昂贵的端到端视频预训练更能决定检索的上限。
为什么文件排序在真实视觉世界中失效?
如果将视频库与传统文本数据库做对比,会发现两者的底层假设完全不同。传统文本检索假设语料库由离散且边界稳定的文档(Document)构成,文档内部通过单一形态的文本表达语义,新增数据通常是简单的追加写入,查询命中后人眼可以直接阅读返回的段落。
但视频所投射的现实世界具备六个独特的系统约束,使得传统的向量召回机制在工程层面几乎全面脱节:
其一是时序性(Temporal)。视频的真正含义存在于时间间隔(Interval)、发生顺序和状态变化之中,而不是像图片那样存在于某个静态原子项里。用户问“叉车最后一次进入 3 号库房时卷帘门是否开启”,需要定位的是一个具有精确时序起止的事件区间,而不是给一整个 2 小时的 MP4 文件打分。
其二是持续变动(Continuously changing)。无论交通卡口还是工业产线,视频数据都在被检索的同时持续写入。正在进行的直播流根本没有“终态”,一套检索系统必须能用完全一致的抽象同时索引归档录像与毫秒级涌入的实时帧。
其三是分布式与多源性(Distributed)。画面分布在不同机位、屏幕捕捉和流媒体切片中,需要在统一的时间参考系下完成跨源实体的关联与对齐。
其四是视频体积远超模型可用上下文(Larger than usable context)。哪怕前沿大语言模型拥有数百万 Token 的窗口,直接把数小时甚至数天的原始高分辨率视频帧丢进多模态窗口,不仅在计算成本和网络传输上不可承受,还会引发长上下文常见的信息迷失。系统必须动态抽取精确裁剪的任务级上下文,而不是将整个多模态语料直接传递给下游模型。
其五是理解颗粒度的碎片化(Understood in pieces)。没有任何单一模型能够同时以最佳精度和最低成本提取视觉画面中的一切信息。ASR 负责语音转写,OCR 负责识别屏幕文本,目标检测与跟踪器负责定位物理边界,通用多模态大模型(VLM)负责高层语义叙事,领域模型负责特定的缺陷判定。每种模型运行的频率、计算开销和输出结构千差万别,强行用一个统一的端到端大模型做全局特征压缩,必然丢失特定维度的细粒度事实。
其六是源头可验证性(Verifiable at the source)。智能体根据检索做出的任何决策,都不能仅依赖模型生成的文字转述,因为文本转述可能夹带幻觉。系统必须能够返回一段人类或模型能够直接点开检查的真实视频证据片段。
当这六大约束同时出现时,视频搜索就不再是单纯的模型特征抽取任务,而变成了如何组织、持久化、多路检索并动态生成流媒体的完整数据系统工程。
核心解耦:记忆、上下文与证据的三分法
为了从工程上彻底解决这些痛点,系统架构设计必须先在概念模型上厘清“存储了什么”、“给模型什么”以及“拿什么佐证”。许多现有多模态系统混淆了这些概念,导致分析结果无法复用,下游调用极其沉重。这项研究通过严格的形式化定义,划分了三个层次。
首先是视觉记忆(Visual Memory)。记忆是系统保留的完备超集。它不是指存放在硬盘里的冷数据视频文件,而是指所有运行在视频之上的分析器(Analyzer)所产生的持久化机器理解成果,以及挂载在其上的多层索引和完整的溯源链路(Provenance)。视觉记忆具有追加写入和可修订的特性,它不需要也不应该在每次查询时全量喂给下游模型。
其次是任务上下文(Context)。上下文是针对当前智能体或模型的具体需求,从视觉记忆中动态挑选并精简打包的紧凑子集。组装上下文需要系统做出四项权衡:挑选哪些与任务相关的起止区间(Selection)、附带拉取哪些持久化元数据(Hydration)、以多高的精度呈现(Representation,例如仅返回几句转写文本、结构化行数据、少量关键帧或是高清视频段),以及严格控制在下游模型的最佳注意力预算内(Budget)。上下文是临时生成、用完即弃的,不会污染持久化的视觉记忆。这种机制被定义为“上下文效率”(Context Efficiency),使智能体不必背负整个视觉语料的负担。
最后是证据(Evidence)。证据是支撑结论或动作的原始视觉片段,必须保持可直接消费和审查的状态。如果一个智能体给出了“叉车违规进入”的判断,但提供不出对应秒数的视频画面,这一检索系统就是不可信的。在整个链路中,证据最终以动态生成的流媒体(Stream)形式暴露,做到按需即时可播放。
VDB 逻辑数据格式与平行的场景空间
为了让这套概念落地,系统实现了一套名为 VDB(VideoDB Data Format)的逻辑数据格式。VDB 的设计思想借鉴了现代数据湖仓中的开源表格式(如 Iceberg 或 Delta Lake):它并不替代底层的视频编码格式(如 H.264、AV1)和容器协议,而是作为一个逻辑元数据抽象层,将底层异构的物理文件抽象为具有时序独立性的数据单元。
在 VDB 中,每一个视频源都被建模为一个持久化的“单元”(Cell),其内部绑定了五大要素:视频源的稳定唯一标识、以 0 为起点的源时间轴(Source-Time Axis)、由不同分析器在该时间轴上构建的场景空间与理解伪影、派生出的能力声明索引,以及记录每次推理模型版本、提示词与运行时间的完整数据血缘。
这一设计最精彩的突破在于打破了“预先切分固定视频块”的惯性思维。在传统管道中,视频在导入时往往被硬切成 5 秒或 10 秒一段的固定切片;但对于语音识别来说,合理的切分是基于一句话(Utterance);对于镜头切换检测器来说,切分依据是画面的硬切与转场;对于目标跟踪器而言,切分是基于固定步长的抽帧;对于高级事件分析器,切分则是叙事事件的起止。
VDB 允许不同的分析器在同一个视频源上并行运行,各自独立输出互不重合、颗粒度迥异的时间切片,即共存的场景空间(Coexisting Scene Spaces)。这些空间之间既不需要预先对齐边界,也不需要强行折衷。真正将它们连接在一起的唯一纽带,就是共享的“源时间轴”。
当系统进行跨维度的联合检索时,例如寻找“屏幕上出现 Error 弹窗(来自 OCR 空间),且主讲人说抱歉(来自 ASR 空间),同时画面切换到操作员特写(来自视觉分类空间)”的时刻,系统可以直接基于底层的毫秒级源时间轴执行时序连接(Temporal Join)。最终组合并返回给用户的场景区间,是根据查询意图临时计算出的精确起止窗口,它完全不必与底层任何一个分析器所记录的物理切片边界重合。
告别转码切片:证据即流的即时渲染引擎
在传统音视频处理链路中,如果检索系统找到了分布在三个不同视频中的精彩片段(例如从第 1 分钟截取 10 秒,从第 5 分钟截取 20 秒),为了让前端用户或下游应用能够播放这段拼接结果,系统必须启动一个繁重的文件级转码任务:调用 FFmpeg 解码原始媒体、截取对应关键帧并重新编码封包为一个新的 MP4 临时文件。这种文件级管线存在明显的延迟惩罚,极大地破坏了交互式探索的实时性,同时产生大量无法追踪血缘的离线垃圾文件。
VDB 通过耦合底层的流式编辑引擎,彻底淘汰了这种以“文件”为工作介质的范式,实现了“时序数据独立性”(Temporal Data Independence)。
在 VDB 架构下,开发者或智能体在检索到命中区间后,并不需要等待任何磁盘写操作,而是直接得到一个声明式的时序时间轴描述(Timeline Program)。这个程序仅仅指定了:“播放源 A 的 $[t_0, t_1)$ 区间,紧接着播放源 B 的 $[t_2, t_3)$ 区间,并在画面右上角贴上对应的 OCR 置信度文本”。
底层的流式引擎能够直接解析这一声明式程序,并在毫秒级的时间内按需动态组装生成标准的 HLS(M3U8)播放清单。消费端无论使用常规浏览器、移动端播放器还是大模型的视觉接口,都能像播放普通在线视频流一样即时拉流,甚至支持毫秒级的精准 Seek 和不同音视频轨的动态混流。这一机制使得“时间戳”不再只是数据库里冷冰冰的数字或需要等待导出的外部指针,而是直接变成了“即时可看、随组随播”的可执行坐标。
双闭环驱动的四层检索交互表面
在丰富而异构的持久化视觉记忆之上,系统设计了一个类型化的检索表面(Typed Search Surface),提供了四种互补的交互模式以满足不同场景的开销与延迟需求:
一是规划式检索(Planned Retrieval):针对明确的多条件查询,系统规划器会根据各索引层声明的能力(向量语义能力、结构化字段过滤能力、聚合统计能力),生成最佳的多路检索与时序连接计划。
二是有界状态化深度调查(Bounded Stateful Deep Search):针对模糊或复杂的开放式线索,系统启动多轮假设校验,按需渐进式地深入特定时间区间重新采样分析,直到满足置信度。
三是直接混合访问(Direct Access):跳过规划,直接发起针对语义向量、时空标量属性或聚合指标的低延迟底层查询。
四是溯源式合成回答(Grounded Synthesis / Ask):下游大模型在消费紧凑上下文的同时,系统在输出的文本回答中自动嵌入对应源视频区间的播放凭证。
[原始视频流 / 归档录像]
│
▼ (异步并行抽取)
┌────────────────────────────────────────────────────────┐
│ 多模型分析器组合 (ASR / OCR / VLM / 目标检测 / 领域事件) │
└────────────────────────────────────────────────────────┘
│
▼ (按源时间轴对齐)
┌────────────────────────────────────────────────────────┐
│ VDB 持久化视觉记忆 (共存场景空间 + 完整血缘 + 能力声明索引) │
└────────────────────────────────────────────────────────┘
│
▼ (按需动态抽取)
┌───────────────────────┬────────────────────────────────┐
│ 紧凑上下文 (Context) │ 流式可播放证据 (Evidence) │
│ 面向智能体模型消费 │ 面向用户与事实核查(HLS即播) │
└───────────────────────┴────────────────────────────────┘
更重要的是,整套系统通过两个关键闭环维持着自我进化的能力。第一个是查询时微调闭环(Query-time Refinement):在有界探索模式下,初始检索如果发现置信度不足或上下文线索出现歧义,可以在同一会话内动态重构规划、调整过滤约束。第二个是表征层进化闭环(Representation Refinement):当搜索行为频繁探测到某些时间片段缺乏细粒度理解时,系统能够驱动专门的高精度分析器,仅针对这部分可疑区间发起局部“再理解(Re-understand)”和“再索引(Re-index)”。由于 VDB 的所有切片均解耦持久化并以源时间轴连接,新产出的高精度切片可以平滑并入现有的场景空间,而完全无需对整个数小时的原始视频重跑昂贵的全量流水线。
9800+ 真实查询实测:通用系统组合逆袭视频原生模型
长期以来,AI 社区存在一种普遍信念:处理视频这类高密度时空数据,最终必须依赖从头到尾进行大规模预训练的端到端视频原生基础模型(Video-Native Foundation Models)。为了验证这一假设是否在实际检索场景中成立,研究团队设计了一场极具说服力的受控对比实验。
测试基准涵盖了来自 4 个公开数据集的 9800 多个真实自然语言查询,包括涵盖密集动作与时序定位的 ActivityNet-Captions、Charades-STA,以及跨模态检索常用的 MSR-VTT 和 MSVD。评测的基线系统选用了一款在行业内被广泛采用、主打视频原生预训练特征提取的商业化视频检索专用引擎。而对比组则是 VideoDB 提出的系统化方案:一个完全由开源通用的语音识别、通用图文多模态模型以及基础向量检索模块组合而成的管线,没有任何一个组件专门为端到端视频检索进行过专门微调。
实验评估了在不同召回深度下的宏平均指标(Macro-averaged Recall@K),测试结果展现出了极具启发性的对比形态:
在考验精准命中能力的 Top 召回区间,VideoDB 的通用组件系统全面领先于商业视频原生引擎。在 Recall@1 指标上,通用系统取得了 73.09% 的高分,而视频原生商业引擎仅为 65.75%,绝对优势超过 7 个百分点;在 Recall@3 上,比值为 83.39% 对 77.13%;在 Recall@10 上,比值依旧保持在 91.20% 对 89.10% 的领先态势。只有当评估窗口进一步放宽到深层长尾的 Recall@50 时,依托稠密预训练表征的商业引擎才以微弱优势反超(96.42% 对 96.07%)。
| 评估指标 | 通用组件系统管线 (VideoDB) | 商业视频原生检索引擎 |
|---|---|---|
| Recall@1 | 73.09% | 65.75% |
| Recall@3 | 83.39% | 77.13% |
| Recall@10 | 91.20% | 89.10% |
| Recall@50 | 96.07% | 96.42% |
这一组数据揭示了一个至关重要的现实:在真实世界的视频检索中,端到端视频预训练模型的优势主要体现在粗粒度的语义联想与极宽泛的候选池覆盖(高 Recall@50),但在决定交互体验和智能体决策质量的高精度前序排位(Top-1 到 Top-10)上,它往往不如一个具备精细时序切分、多模态分层抽取和精准时间对齐的工程系统来得扎实。
端到端黑盒视频大模型往往将几分钟的视频压缩为一个或数个全局 Embedding,在这个压缩降维的过程中,语音中的具体专有名词、屏幕上稍纵即逝的代码错误提示、局部的细微肢体动作不可避免地被平均化和稀释了。相反,基于分层架构的系统,通过让 ASR 专注处理文本层、让细粒度视觉模型专注处理关键帧、让特定时间边界精确定位事件,并在统一的源时间轴上进行结构化与语义联合过滤,成功弥补了单个通用模型在“时空连续性”理解上的不足。
从单纯依赖模型到依靠系统基础设施
VideoDB 的这项研究给多模态技术的发展路径带来了一个清晰且务实的启示:面对视觉世界这一高度复杂、海量且持续变化的实体,构建 AI 基础设施的核心任务,不能仅仅押注在等待“全能端到端视频大模型”的降临。
模型的参数和能力总是在不断更迭,今天适用的前沿多模态大模型,明天可能就会被更小、更快、更便宜的模型取代。如果整个系统的架构将视频切片逻辑、索引能力与某个特定模型的输入输出深度绑定,那么模型更新之日就是整个存储与处理系统推倒重来之时。
正如现代关系型数据库将物理存储格式与逻辑查询优化器分离、现代大数据体系将存储表格式与计算引擎解耦一样,视频数据系统也必须走向解耦。将物理视频流抽象为统一源时间轴,将多模型的异构理解沉淀为具备完备血缘的持久化视觉记忆,将面对任务的交互严格限制在精简的上下文预算内,并让检索的每一步结果都能无缝落地为可即时播放的真实视频流证据——这种以数据系统为中心的架构思想,才是让多模态大模型真正安全、高效、可信地接入真实物理与数字世界的稳固桥梁。