Aero Realtime:港大清华提出双工流式架构,4B模型84ms时延实现边听边说

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Aero Realtime:港大清华提出双工流式架构,4B模型84ms时延实现边听边说 论文图示

在人机多模态交互的前沿探索中,“实时感”往往是一种脆弱的错觉。无论是主流的多模态大模型还是近期涌现的流式视频理解系统,底层逻辑几乎都沿袭了传统自然语言处理的“轮流对话”(Turn-Based)范式:系统必须先完整接收或截断一段音视频输入,执行耗时的 Prefill(预填充)阶段编码多模态 Prompt,随后转入自回归的 Decode(解码)阶段逐字输出文本。一旦模型开始“说话”,外界新涌入的画面与声音就无法自然注入当前正在解码的注意力序列中。为了让模型看起来足够主动,近期的研究往往转向微轮询(Micro-Turn Polling)或外挂响应控制门控(External Gating),但这不仅割裂了连续的交互流,还将“何时开口”与“生成什么”拆解为两个脱节的工程阶段,直接破坏了现代推理引擎赖以生存的 KV-cache 复用机制。

ArXiv URL:https://arxiv.org/abs/2608.08469v1

针对这一根本性断层,来自香港大学、清华大学与 LMMs-Lab 的研究团队提出了 Aero Realtime。这是一个参数量为 4B 的流式多模态大模型,核心在于打破了非全双工(Non-Duplex)的技术藩篱。Aero Realtime 放弃了“先问后答”的输入输出拼接模式,将视频、音频输入与文本输出统一编排在一个严格共享的时间网格上,以约 80 毫秒的音频时隙为基准步调,让输入流与输出流同步推进。在这个统一框架下,模型通过一个标准的自回归目标,同时学习“何时保持沉默或插话”以及“具体说什么内容”。

在工程部署层面,Aero Realtime 彻底契合了流式推理的硬件特性。模型在每一步仅增量追加最新的多模态时隙,持续复用历史 KV-cache,消除了重复 Prefill 的计算开销。在 4 张消费级/工作站级的 NVIDIA A6000 GPU 上,Aero Realtime 面向长达 20 分钟的连续流式视频,保持了 84 ms 的中位处理延迟与 173 ms 的 P95 延迟,全流程紧跟源视频时钟线。这项工作不仅提供了一个 4B 参数的双工实时交互模型,更完整开源了从因果数据合成、静音掩码优化、三级硬件并行训练到低延迟增量推理的完整技术栈。

从单工轮询到全双工流:实时交互范式的根本转向

要理解 Aero Realtime 的价值,必须先审视现有实时多模态系统在架构上的固有缺陷。传统多模态模型本质上是“半双工”的。如图 1(a) 所示,传统的处理流程是将历史的多模态观测作为前缀打包,一旦触发回答,模型就会进入闭门造车的解码阶段。在这期间,现实世界发生的所有新事件都被拒之门外,或者只能积压为下一个回合的输入。

三种实时多模态交互架构对比

为了让模型显得具有前瞻性和连续性,学术界与工业界此前主要采取了图 1(b) 中的两条折中路线。第一种是高频微轮询,即把无休止的音视频切成数秒甚至更短的微小切片,由外围调度器不断询问模型“现在是否需要回复”。这种做法虽然缩小了时间切片,但底层依然是离散的回合交替,频繁的打断重算让显存带宽不堪重负。第二种是引入外挂决策头(Decision Head)或激活门控(Activation Gate),先由一个判别网络决定何时发言,再唤醒生成模型。这种分离机制看似合理,却在语义层面割裂了时机与内容:人类在交谈时,决定开口的时机与大脑中正在组织的词汇是深度纠缠的,硬性解耦往往导致响应时机机械生硬。更致命的是,外挂模块破坏了底层推理引擎标准的 Prefill-Decode 流水线,使得原本高效的增量 KV-cache 复用变得极其复杂。

Aero Realtime 所走的第三条路径(图 1(c))则是真正的全对齐双工流(Fully Aligned Duplex Stream)。在它的世界观里,交互不再划分“用户回合”与“助手回合”,现实世界的时间轴以严格的物理步调向前流动。音频被切分为均匀的、长度约为 80 ms 的连续时隙(Slot),视频帧则根据其捕获的时间戳离散插入到对应的时隙节点上。更关键的是,模型的输出端同样以 80 ms 为单位吐出 Token:如果当前时刻不需要发言,模型就输出一个特殊的静音标记 $\mathtt{[P]}$(Pause/Silence);如果需要说话,则输出正常的词元(Lexical Token)。输入向前推进一步,输出就吐出一个 Token,两者在同一根时间轴上咬合前进,真正做到了“边听边说”。

80ms时间网格:模型架构与统一时空流

Aero Realtime 的骨架由多模态特征提取器与因果语言模型结合而成,但其数据流组织方式与常规 VLM 截然不同。模型保留了特定模态的视觉塔和音频塔,以此将高频传感器输入投影至因果 Transformer 的隐层空间。

Aero Realtime 模型架构图

具体来看,针对输入的视频帧序列 $v_j$ 与连续音频流 $a_t$,视觉投影模块将其转化为视觉表征 $z_j^v = P_v(f_v(v_j))$,音频特征则映射为 $z_t^a = P_a(f_a(a_t))$。音频塔借鉴了 Qwen2-Audio 的时间下采样设计,使得每一个音频 Token 在时间跨度上精准对应约 80 ms。这 80 ms 便构成了全系统的基本时间单元。对于任意一个时刻 $t$,系统收集所有时间戳满足 $\tau_j \le \tau_t$ 且尚未注入的新视觉状态 $\mathcal{Z}_{\le t}^v$。

在最核心的输入输出循环中,Aero Realtime 采用了一种高度紧凑的时间对齐递归方式。在时隙 $t$,进入因果语言模型的音频状态并非单模态输入,而是将当前时隙的音频表征 $z_t^a$ 与上一时隙预测出的输出文本嵌入 $E(y_{t-1})$ 进行逐元素直接相加:

\[e_t^a = z_t^a + E(y_{t-1}), \quad y_0 = \mathtt{[P]}\]

随后,多模态历史序列——包含过往的视觉状态集合 $\mathcal{Z}{\le t}^v$ 以及混合了前一时刻输出状态的音频流 $e{\le t}^a$——被共同喂入因果 Transformer 主干,提取出隐层状态 $h_t$。语言模型分类头 $W_{\text{lm}}$ 基于此预测当前时隙的输出目标:

\[p_\theta(y_t \mid \mathcal{Z}_{\le t}^v, a_{\le t}, y_{<t}) = \operatorname{softmax}(W_{\text{lm}} h_t)\]

这一精巧设计的妙处在于,输出词汇表空间被自然扩充为文本词表 $\mathcal{V}{\text{text}}$ 与静音符 ${\mathtt{[P]}}$ 的并集。这意味着模型在每一个 80 ms 瞬间都在面对两个选择:是继续倾听并保持沉默(预测 $\mathtt{[P]}$),还是打断沉默开始输出具体词汇。无需任何外部规则干预,自回归的负对数似然损失统一驱动了时机决策与语义生成。更重要的是,由于上一时刻的输出 $y{t-1}$ 被即时融合成下一时刻的输入底衬,语言模型天然获得了连贯组织多词句子的上下文记忆,同时始终处于可被外界新音频、新视觉信号随时打断或引导的强感知状态。

数据管线因果化与静音掩码机制

构建如此特异的全双工接口,最大的阻碍并非算力,而是传统多模态数据集的格式鸿沟。现存的视频问答数据集无一例外都是“问题前缀加答案后缀”的非因果组织形式。若直接拿来训练,模型不仅学不会时间网格对齐,更会失去在没有明确指令时保持静默的能力。为此,研究团队设计了一套严格遵循时间因果特性的数据合成流程与格式映射引擎。

实时因果 QA 生成管线与数据分布

在实时数据合成管线中,团队筛选了时长在 30 至 600 秒之间的视频片段,以均匀分布在 5 到 10 秒的时间间隔向前推演时间戳。在每一个采样的现实时间截面上,利用先进的大模型(GPT-5.4)充当生成代理,但严格遵循因果物理限制:代理只能观测到该时间戳之前累积的视频帧前缀,以及历史已经生成的所有问答记忆,据此生成扎根于当前时刻的全新时间连续问答对。整套管线杜绝了未来帧信息泄露,构建了包含 10.3 万条样本的高质量因果多模态数据集。

在将数据灌入统一的时间流时,由于真实交互中绝大部分时间处于静默状态,简单地填充静音标记 $\mathtt{[P]}$ 会引发极其严重的类别不平衡。统计表明,超过 90% 的时隙位置都是静音标签。如果无脑计算全部 Cross-Entropy 损失,梯度将被海量的 $\mathtt{[P]}$ 完全淹没,导致模型在推理时极度保守、彻底丧失说话意图。

针对这一静音压制现象,作者引入了静音标签掩码率(Silence-Label Masking)参数 $r$。在计算流式训练损失时:

\[\mathcal{L}_{\mathrm{stream}} = -\sum_{t=1}^{N} m_t \log p_\theta(y_t \mid x_{\le t}, y_{<t})\]

掩码掩盖因子 $m_t$ 对包含实际文字的 Token 始终置 1,而对于目标为 $\mathtt{[P]}$ 的时隙,则以概率 $r$ 独立将其剔除出梯度回传。这一策略的有效性在消融实验中得到了极具戏剧性的印证:当 $r=0$(不进行静音掩码)时,模型在基准评测上几乎全盘沉默,平均得分仅有惨淡的 6.40;而当将静音掩码率提升至 $r=0.95$(即随机丢弃 95% 的静音监督信号,仅保留 5% 约束模型不胡言乱语)时,模型在 OVOBench 上的基准综合得分一跃提升至 42.36,在时机把控与生成意愿之间达成了极为脆弱却至关重要的平衡。

随后展开的两阶段训练法则进一步巩固了这一基础。第一阶段耗费 20 亿 Token,在全量异构混合数据上专注于界面行为对齐,强制模型掌握“以 80ms 为拍子、在音频上叠加密钥、通过 $\mathtt{[P]}$ 维持呼吸”的新物理规律;第二阶段耗费 10 亿 Token,引入特定强化的高质量实时 QA、LLaVA-Video 与 QAEgo4D 精细样本,不仅将实时能力分数从 58.03 推高至 61.49,更将回溯性事件理解(Backward Track)分数从 33.94 拉升到 44.07,展示出系统在适应物理流格式后依然具备深度的逻辑推理潜力。

三级并行与增量 Delta 推理:硬件感知的系统工程

要让一个 4B 参数的多模态模型在无休止的实时音视频流中稳定工作,离不开底层工程架构对硬件特性的极限榨取。常规的分布式训练框架在处理混合模态长上下文时往往效率低下:文本与音频具有固定的长度密度,但视频数据受分辨率和动态 Patch 影响,极易产生单卡计算气泡;如果在数据并行或简单的序列并行中一刀切地广播视频帧,又会导致巨大的通信冗余与显存浪费。

三级训练并行系统架构

为此,Aero Realtime 构建了专门面向模态感知的三级并行架构(Three-Level Training Parallelism)

  1. 视觉负载均衡的帧级并行(Workload-Balanced Frame Parallelism):针对视觉编码器 ViT,根据每帧图像由动态分辨率网格计算出的计算开销 $w_f = H_f W_f$,使用带约束的贪心分配算法,将不同大小的视觉帧交错分发至各序列并行卡上,确保各卡在处理 ViT 特征提取时的计算负载方差最小,避免了重复编码同一帧图像的算力浪费。

  2. 纯净序列并行(Padding-Free Audio & Sequence Parallelism):在音频编码与语言模型骨架阶段,抛弃繁重的填充补齐操作,将展平后的密集 Token 流直接接入基于 Ulysses 范式的序列并行网络,在多卡之间打散长时序序列的隐藏层计算。

  3. 数据并行(Data Parallelism)与高效算子融合:配合深度优化的 Liger 融合算子与 65k 超长序列动态打包(Packing),整个训练流水线在 32 卡 A100-40G 组成的集群中迸发出了极高的吞吐表现,单卡训练吞吐突破 1,600 tokens/s,使得整套 30 亿 Token 的双工模型重训在一天内即可收敛。

在推理服务环节,研究团队构建了基于 vLLM-Omni 可重入请求框架的增量 Delta 推理机制(Cache-Valid Delta Inference)。在过去的非全双工系统中,一旦外界输入更新,系统往往需要将新旧输入拼接后重新跑一次局部的 Prefill 计算,否则历史的注意力边界就会混乱。

在 Aero Realtime 中,由于采用了时间网格对齐,每一个 80 ms 步长内的计算都被降维成极度标准化的单步递推。无论当前时刻是否伴随新的视频帧,系统都仅向模型输入当前这一个切片的增量特征向量:

\[(y_t, \mathrm{KV}_t) = F_\theta\left(x_t, y_{t-1}, \mathrm{KV}_{t-1}\right)\]

语言模型执行一次轻量级的单 Token 步进计算,吐出 $y_t$,并直接将计算出的键值对无损沉淀到持久化驻留的 KV-cache 尾部。如果 $y_t$ 是常规词元,它不仅被推流给下游 TTS 模块朗读,更在内存中直接与下一步的音频输入相加;如果 $y_t$ 是 $\mathtt{[P]}$,则仅在底层留下一段极小的隐层痕迹。这种设计将增量推理退化为现代推理引擎最擅长的“纯粹增量 Append”,消除了任何冗余的前缀重算,赋予了系统在长程任务中坚如磐石的时延确定性。

连续流式下的评测检验:性能与代价的权衡

任何新架构的生命力最终都要接受基准与真实场景的双重检验。研究团队针对视频长时交互基准 OVOBench 以及极端长视频连续推流展开了全面实测。

在代表流式视频综合理解能力的 OVOBench 测试集上,采用 4B 主干的 Aero Realtime 展现出了与多款主流 7B 级别在线模型互有胜负的能力。在 Realtime 这一考察当下感知与极速反应的赛道中,Aero Realtime 录得了 61.49 的高分,在 Backward(依赖过去记忆回答事件)赛道中取得 44.07 分,但在 Forward(预测未来行为趋势)赛道则相对较弱,录得 39.36 分,整体综合均分为 48.31。

客观来看,这一成绩并未打破现有离线或重度回合制超大模型的榜单纪录。然而这一对比必须建立在一个关键的前提之上:OVOBench 榜单上几乎所有高分基线,本质上都是在评测点发生时将视频强制打断、塞入传统 Prompt、执行完整单向生成的“作弊级”离线系统。Aero Realtime 是全评测集里唯一一个在真正全双工(Duplex I/O)与原生自主决策(Native Proactive)双重约束下运行的模型。它在解码生成答案的每一个瞬间,依然在毫无防备地实时吞吐着后续涌入的新视频帧与新音频,从未冻结过输入流。

理解分数的微幅落后,揭示了将单工模型推向双工交互时必须支付的“架构税”:原本在预训练中极度熟悉“用户说完一整段话模型再作答”的稠密语言模型,被粗暴地拽入了一个充满大量静音标记 $\mathtt{[P]}$、且强行被 80 ms 离散切片的陌生数据分布中。从离散对话到连续时间流的分布漂移、天然实时监督数据的稀缺,共同构成了限制其多模态认知深度发挥的天花板。

但在现实系统的时延表现上,Aero Realtime 证明了这种架构牺牲的巨大回报。实验团队在 4 张工作站级别的 NVIDIA A6000 GPU 上搭建了严苛的连续流式测试环境,向模型以真实时间速率持续注入一段长达 20 分钟的高清视频与音频流,并记录系统相对于物理真实世界的时滞抖动(Processing Lag)。

数据展现了极高的工业可用性:在长达 20 分钟的未间断运转中,Aero Realtime 处理每个 80 ms 输入增量的中位延迟仅为 84 毫秒P95 时延稳稳压在 173 毫秒,最长尾的极端情况也控制在 200 毫秒以内。由于处理每一个切片所需的时间严格小于或约等于切片本身的物理时长,KV-cache 在持续累积的同时并没有引发延迟雪崩。这表明该系统能够以极低的时钟漂移,与现实物理世界保持绝对同频。

迈向真正共存的人机交互

Aero Realtime 为困在“非全双工”瓶颈中的实时多模态交互体系提供了一次极具启发性的破局尝试。它向学界证明了一件事:想要让多模态大模型获得类似人类“听与说同时发生”的具身反应力,不需要在模型外围搭建纷繁复杂的触发器、投票器与截断调度器,而是应当回归到时间轴本身,让感知时钟与自回归语言时钟同频共振。

这项探索同样诚实地暴露了当前技术方案的边界。固定 80 ms 的时间网格从物理上将模型的最大文本生成速率卡死在每秒 12.5 个 Token,无法像传统离线模型那样在算力富余时以几十甚至上百 Token/s 的速度爆发式输出;而高度稀疏的静音 Token 分布,也时刻考验着语言模型的先验概率校准。此外,在长时视频理解上相较于百亿参数巨无霸模型的差距,也表明全双工流式架构仍需经历更大规模高质量原生数据的洗礼。

即便存在取舍,Aero Realtime 依然向前跨越了重要一步。它不仅跑通了全双工多模态从底层训练到终端 Serving 的完整物理闭环,更清晰地勾勒出未来下一代助理型 AI 的雏形:它不再是一问一答的无实体搜索引擎,而是一个安静注视着周围世界、随时聆听声响、并在关键时刻自然出声接入人类生活的时间连续体。