StreamMind:双层架构解耦长程流式视频记忆,端到端延迟降低66%
StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

在具身机器人、智能眼镜等可穿戴设备落地过程中,多模态大模型面对的物理世界并非被切分成几十秒、预先打包好的离线视频,而是不间断涌入的无界音视频流。真正的智能体不仅要看懂正在发生的事情,还要记住一个小时前随手放下的钥匙在哪,更要在特定事件发生时自主发出预警,而不是被动等待人类提问。
ArXiv URL:https://arxiv.org/abs/2608.05703v1
然而,现阶段的大多视频理解模型本质上依然是“回合制做题家”:用户提问,模型就对前序片段抽帧推理,处理完毕便清空上下文。现有的流式评测也大量依赖短视频片段和选择题格式,甚至出现仅输入最后四帧就能打平复杂流式架构的荒谬捷径。针对这种评测失真与系统断层,来自香港中文大学、香港科技大学、香港大学和小红书的研究团队推出了面向小时级、交互式流式视频理解的基准 StreamArena,并针对现有架构的“记忆与交互互斥”困境,设计了双层解耦系统 StreamMind。
这项研究直接击中了流式长视频交互的核心瓶颈:要在长达一个半小时的持续视频流中同时实现极低延迟交互、长程因果检索、自主监控预警与外部多模态工具调用,靠单一上下文窗口或暴力压缩是走不通的。通过将前端低延迟交互与后端异步长记忆构建进行解耦,StreamMind 在同等骨干模型(Qwen3.5-397B-A17B)下将平均响应延迟压缩了 66.2%,并在流式基线模型中实现了各项能力的大幅领先。

戳破“四帧捷径”:StreamArena 构建的真实流式考场
过去的视频大模型评测往往存在两个难以规避的问题:一是依靠选择题机制,语言大模型仅凭选项先验和常识就能猜出七八成答案;二是视频片段过短,所谓“流式视频理解”退化成了“近期帧特征平滑”,模型压根不需要长时间跨度的记忆管理。
为了构建无信息泄露的连续评测环境,StreamArena 汇集了 243 个源自 YouTube 的高质量长视频,涵盖七大真实场景,平均时长达到 88.8 分钟,最长达 134.2 分钟。整个基准共包含 3,646 个开放式问答任务,全部要求模型生成简练精准的自由文本,并交由 Gemini 3.1 Pro 作为裁判进行严苛的事实核心对齐判断。
更为关键的是其双时间戳(Dual Temporal Grounding)与因果约束机制。基准中的每一个提问(Query)不仅有发生的时间戳,其赖以回答的事实证据(Evidence)也都被打上了严格的起止时间区间。在因果流式设定下,模型在某个时间戳之前,绝对不允许访问该时刻之后的数据。统计数据显示,在历史回溯(Historical Retrospection)任务中,问题与证据之间的中位时间差高达 12.1 分钟,有超过 20% 的问题需要回溯半小时以上,甚至有 49 个问题需要调取一小时以前的瞬时线索;更有 21.6% 的任务需要模型综合两个乃至最多 15 个分散的证据片段才能完成回答。
StreamArena 将现实部署对智能体的严苛要求拆解为四维能力矩阵:
第一是实时感知(RTP),考察对当刻音视频同步画面的细粒度理解;第二是历史回溯(HR),检验模型在没有重看全部视频机会的前提下,能否调取远期记忆;第三是多模态工具调用(Tool),要求模型识别视频中的特定实体并自主发起外部检索;第四是主动交互(Proactive),用户提前下达监控指令,智能体必须在目标事件发生的严格时间窗口(提前 0.5 秒至滞后 2 秒)内主动触发报警,没有二次 Prompt 提示。
现有流式架构为何陷入“记忆偏科”?
在 StreamArena 的严苛测试下,市面上现存的五大类主流架构纷纷暴露出无法兼顾的结构性软肋。评测清晰地揭示了目前学术界与工业界在处理流式视频时所面临的三大经典妥协路线:
第一种是滑动窗口派(如 AURA 与 MiniCPM-o)。这类架构专注于当前交互的敏捷性,只缓存最近十几秒到数十秒的观测窗口。它们在实时感知上反应迅捷,但面对历史回溯时几乎呈断崖式溃败。评测显示,AURA 在 5 分钟以内的事件回溯准确率尚有 25.4%,但当回溯跨度超过 30 分钟时,准确率骤降至 10.5%。一旦离开近期窗口,模型对过去的世界便处于失忆状态。
第二种是文本摘要派(如 VST)。为了在不爆显存的前提下保留长远记忆,这类系统将过去的视频画面逐步转译为文本日志。然而,这种降维付出了极高的信息代价:大量非言语、细粒度或当时看似不重要的多模态线索在转录为文本时被彻底丢弃。面对需要精细视觉定位的问题或需要依托旧画面发起图像搜索的工具任务,文本记忆显得捉襟见肘。
第三种是模型内部压缩派(如 StreamForest 与 ThinkStream)。它们尝试在 Token 或隐状态层面对长时序特征进行周期性融合压制。然而实验表明,面对开放式长序列场景,特征在多次循环压缩后信噪比严重退化,无法承受精确的事实检索。ThinkStream 在四项能力上的准确率仅维持在单数字百分比区间。
至于离线切片推理的大模型,虽然能够通过海量抽帧保留较强的被动问答能力,但它们天然缺乏“持续在线”的时序因果状态,根本无法支持任何无提示的主动预警任务。

StreamMind:解耦交互与认知的双层机制
面对“又要低延迟响应、又要小时级记忆、还要主动警觉”的“不可能三角”,研究团队提出了 StreamMind。其核心系统哲学非常明确:不能把长时间尺度的记忆沉淀与复杂推理,堆死在用户交互的延迟敏感路径上。
StreamMind 将智能体拆解为前端(Frontend)交互派发层与后端(Backend)记忆推理层,两个层级通过按需消息通信,且各自拥有独立的生命周期调度机制。
前端包含两类轻量级执行者。Front Worker 是整个系统的交互网关,它不开启深度思考模式,仅依托当前局部因果观测与对话上下文维持毫秒级的交互应答。如果当前上下文足以作答,它便即刻返回;若需要调用长程证据,它生成检索简报派发给后端。Monitor Worker 则专门应对主动监控任务。当用户注册一条“如果出现红衣男子敲门就提醒我”的意图后,系统便派生一个专职 Monitor。该 Worker 独立挂载于当前流式输入之上持续巡检,不阻塞主会话,只有在触发判据匹配时才主动向上回调提醒。
后端则负责长程知识的异步重构与深层检索。Memory Writer 在后台以 2 fps 的频率持续摄入音视频流,将非结构化信号沉淀进三层混合记忆库(Memory Bank)。这套结构包含了微事件(Micro Events)、宏事件(Macro Events)乃至超级事件(Super Events)的时序分层树,并同步提取并动态维护实体关系图谱(涵盖人物、物体、地点及其动态变迁),每个事件节点均锚定关键帧视觉实体。这保证了即使流式视频过去两个小时,系统依然持有紧凑的语义拓扑与未被压缩毁坏的原始关键帧。
当收到前端请求时,后端的 Router Worker 充当战略调度枢纽,拆解任务并并行激活 Recall Worker 与 Search Worker。Recall Worker 在分层事件树与实体图谱中进行基于内容寻址的时序召回;Search Worker 则能够将召回出的历史关键帧作为视觉实体锚点,联动 Google 外部搜索引擎弥补模型参数外事实。两者的协同推理完全由 Router 串联调度,最后将综合证据交付生成。
这种非思考型前端与思考型后端(Thinking-enabled)的物理拆分,彻底隔绝了长记忆检索对实时对话的算力挤占。
实验印证:精度飞跃与 66% 的延迟削减
在 StreamArena 的系统对比中,StreamMind 展现出明显的综合优势。如数据所示,在全部四项核心评估中,StreamMind 均名列流式系统榜首。
相较于各单项最强的流式基线模型,StreamMind 在实时感知(RTP)上相对提升了 58.4%;在历史回溯(HR)上相对提升了 53.7%,并且在超过 30 分钟的远期深层回溯区间内依然保持了稳定的检索命中,显著拉开了与滑动窗口和文本摘要方法的差距;在多模态工具调用(Tool)上,由于具备关键帧锚定外搜能力,相对暴增 228.1%;而在无二次提示的主动预警(Proactive)上,得益于专职 Monitor 线程,相对提高了 54.7%。
不仅如此,StreamMind 带来的另一重决定性突破在于推理延迟。对于需要落地的多模态助手,等待一两分钟才给出回复是无法接受的。在统一采用 Qwen3.5-397B-A17B 作为骨干模型的基础下,传统的离线按需推理每次都要把长视频切片重新编码一次,平均查询端到端耗时达 81.4 秒。而 StreamMind 凭借前序构建好的结构化持久记忆,将 RTP、HR 和 Tool 任务的响应时间分别压缩了 84.6%、73.9% 和 55.3%,加权平均延迟降至 27.5 秒,总体降幅达 66.2%,同时保留了 89.7% 的离线满血精度。
这种延迟下降并非牺牲了推理质量,而是来自“状态复用”。流式计算的吞吐被平摊在无人的后台流水线中,临场交互自然变得轻盈。

诊断分析与长程记忆的未来边界
在对 616 个核心子任务的诊断测试中,研究团队深入探讨了模态依赖与计算预算对流式长视频系统的影响。
模态消融实验揭示了音画联合的必要性。如果仅输入语音 ASR 文本,实时感知任务的准确率直接跌至 4.2%;仅有视觉帧时为 26.8%;而当音视频双流融合后,准确率提升至 32.4%。这证明在长时流式交互中,单纯依靠转录文本既无法还原物理场景的演进,更不能应付绝大多数视觉具身提问,双模态甚至多模态的并存是流式架构的底线。
在消融实验图谱中,研究团队进一步观察到几个具有启示性的趋势:
增加输入帧数主要对历史回溯(HR)有决定性收益,但对当下的实时感知(RTP)收益边际递减;提升分辨率则全方位赋能了所有任务类型;而关于深度推理模式(Thinking mode),数据显示开启思考虽然显著改善了涉及复杂链路的 HR 和 Tool,但却轻微损伤了 RTP 的得分。这一现象直观地佐证了 StreamMind 系统设计的正确性:让前端执行者专注于感知,让后端专家处理长链思考,强行在单一线程中混合两类诉求只会相互掣肘。
尽管 StreamMind 取得了显著突破,但实验也暴露出长时序记忆在认知逻辑上的根本难点。即使具备完善的事件树索引,随着时间差从 5 分钟拉大到 30 分钟以上,系统在历史回溯上的性能依然存在回落。这说明长时记忆的问题不仅是“上下文窗口有多大”,而是“在事件发生那一刻,智能体如何知道未来会被问到什么”。当未来的 Query 尚未出现时,模型在当前帧压缩保留的信息密度注定是不完全的。
结语
从评估层面看,StreamArena 终结了短视频切片与选择题刷榜带来的虚假繁荣,为未来具身智能、AI 智能眼镜的真正可用性划定了明确的考场准绳:连续性、因果性、主动性与工具联动性缺一不可。
从系统层面看,StreamMind 则展示了一条行之有效的系统工程范式。面对无限流式世界,试图把所有信息一股脑压进单一大模型的单一 Forward 过程,在物理上与效率上都是极其低效的。将低延迟交互与长程持久化记忆解耦,以多 Agent 协同体系构建异步的“大脑皮层与海马体”,或许才是走向终身在线流式智能体的标准答案。