Apple新一代Siri语音架构:21MB内存实现16倍实时音频合成

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Apple新一代Siri语音架构:21MB内存实现16倍实时音频合成 论文图示

在端侧大模型逐渐接管操作系统的今天,语音交互正经历从“机械播报”向“拟人表达”的代际跨越。用户不再满足于平直单调的助手发音,而是期待具备自然停顿、情绪起伏与细腻语调的全双工对话。然而,将高表现力的神经音频合成模型塞进手机和手表等边缘设备,始终横亘着一道几乎不可逾越的物理鸿沟:硬件内存与算力预算的极度紧缩。

ArXiv URL:https://arxiv.org/abs/2607.23811v1

传统的端侧语音架构往往采用级联的声学模型加声码器方案,音色僵硬且难以与多模态大模型的语义表征深度对齐;而业界前沿的端到端神经音频表征模型(如 Kyutai 的 Moshi 等)虽然具备极强的表现力,却普遍依赖残差矢量量化(RVQ, Residual Vector Quantization)层级解码与全注意力机制,其内存占用会随着音频时长的增加呈现线性甚至二次方膨胀。当设备端需要同时常驻一个数十亿参数的基础模型时,留给音频解码器(Detokenizer)的 DRAM 空间往往只有区区几十兆字节,一旦合成长语音,极易触发系统的内存过载崩溃。

针对这一严苛边界,Apple 在其最新的技术成果中揭秘了支撑 Siri Expressive Voices(Siri 表现力语音)背后的核心音频反标记器架构。该架构依托 Apple 迄今最强的端侧多模态基础模型 AFM 3 Core Advanced,在专用的 Apple 矩阵协处理器(AMX)上,创下了令人惊艳的工程与算法指标:仅需约 21 MB 的峰值运行内存和 329 MB 的端侧静态资产,就能以约 10 毫秒每步(RTF 约为 0.06,即 16 倍于实时速度)的超高吞吐,持续合成长达 20 至 320 秒的高保真音频流。 在 10 亿激活参数的系统配置下,其整体主观听感 MOS 评分相比既有端侧系统提升了 +0.28(从 3.87 跃升至 4.15),在自然对话场景下的提升幅度更是达到了惊人的 +0.42(4.24 vs 3.82)。

这项工作不仅展示了 Apple 如何在刀尖上跳舞、将高算力模型精简进移动硬件,更为整个生成式 AI 领域提供了一套优雅的时空解耦音频生成范式。

为什么现有方案在端侧行不通?

要理解这项架构创新的精妙之处,首先必须看清前人方案在端侧落地时的死穴。

在现代语音生成大模型中,音频通常被离散化编码为语义 Token 与声学 Token。为了兼顾压缩率与重构精度,业界普遍采用残差矢量量化(RVQ)技术,将每一帧音频切片分解为深度方向上的多个离散码本层级(Levels)。这也意味着,模型在每个时间步必须预测一整串由粗到细的量化 Token。

近年来极具代表性的实时对话模型 Moshi,采用了分层 RQ-Transformer 架构:外层由一个时间 Transformer 负责捕捉上下文的时序推进,内层则由一个深度 Transformer 沿着量化深度自回归生成各个码本层级。尽管 Moshi 在深度网络的主干部分实现了参数共享,但它仍然为每一个量化层级保留了独立的输入与输出线性投影矩阵(Per-level projections)。随着码本层数 $K$ 的增加,这种设计依然会导致参数量与计算开销随着量化深度线性递增。

更致命的瓶颈在于长序列生成时的内存膨胀。传统的自注意力机制(Self-Attention)需要维护一个键值缓存(KV Cache)。当用户与 Siri 进行长文本朗读、连续导航或长轮次深度交流时,音频时长可能长达数分钟,KV Cache 会随着时间无限拉长,导致运行时内存(Runtime Memory)迅速突破端侧系统划定的 DRAM 红线。

在 AFM 3 Core Advanced 运行体系下,系统采用基于指令跟随剪枝(Instruction-Following Pruning)的稀疏混合专家(MoE)机制,平时将 200 亿参数完整存放于 NAND 闪存,推理时仅将 10 至 40 亿激活参数动态调入 DRAM。在如此紧张的共享内存环境下,音频反标记器必须打破“长度换内存”的魔咒,实现严格意义上的恒定内存开销($O(1)$ Memory Complexity)。

时空完全解耦:复用单个 DiT 深度解码器

针对上述痛点,研究团队提出了一种彻底解耦时序维度与深度维度的三组件流水线架构:流式编码器(Streaming Encoder)、时间解码器(Temporal Decoder)与深度解码器(Depth Decoder)。


输入: 语义音频 Token (x_t)

         │

         ▼

┌──────────────────┐

│ Streaming        │ (4层, 结合前瞻机制)

│ Encoder f_θ      │

└────────┬─────────┘

         │ 隐层表征 h_t

         ▼

┌──────────────────┐

│ Temporal         │ (6层, 负责时间步推进)

│ Decoder g_ϕT     │ ◄── 聚合上一帧全层量化均值 q̄_{t-1}

└────────┬─────────┘

         │ 时序状态 y_t

         ▼

   [ + RoPE(k) ]   ◄── DiT 风格阶段条件注入 (无需独立投影层)

         │

         ▼

┌──────────────────┐

│ Unified Depth    │ (仅2层, 循环执行 K 次)

│ Decoder g_ϕD     │ ──► 自回归输出该帧第 k 层 RVQ Token r_{t,k}

└──────────────────┘

这个架构的运行逻辑极具数学上的对称美感:

  1. 流式编码器 $f_\theta$:首先接收基础模型给出的语义音频 Token 流 $x_t$,将其映射为蕴含局部语音意图的高维隐层状态 $h_t$。

  2. 时间解码器 $g_{\phi_T}$:以自回归的方式在时序轴上移动。在时刻 $t$,它结合当前编码特征 $h_t$ 与上一时刻所有深度层级的量化特征总和 $z_t^{(T)}$,生成当前帧的时序基底特征 $y_t$。

  3. 完全复用的深度解码器 $g_{\phi_D}$:这是整套架构最具颠覆性的设计。它完全舍弃了 Moshi 方案中为每一层 RVQ 单独设置投影矩阵的做法,整个网络仅由一个极其轻量的 2 层 Transformer 构成。

为了让这个单一的网络能够精准辨识当前到底在生成第几层残差量化码本,研究人员引入了类似 Diffusion Transformer(DiT)的阶段条件注入机制(Stage Conditioning):直接利用旋转位置编码(RoPE)将量化深度索引 $k \in {1, \dots, K}$ 编码为位置信号,加注到时间解码器的输出 $y_t$ 上,得到 $y_{t,k} = \text{RoPE}(y_t, k)$。

深度解码器仅依据 $y_{t,k}$ 以及上一深度的状态 $z_{t,k}^{(D)}$,便能自回归地吐出第 $k$ 层的离散 RVQ 标记 $r_{t,k}$ 和更新向量 $q_{t,k}$。在单帧内循环迭代 $K$ 次后,系统对所有深度的特征取均值 $\bar{q}t = \text{mean}(q{t, 1:K})$,回传给时间解码器作为下一步的状态输入 $z_{t+1}^{(T)}$。

这种“单一网络 + RoPE 条件调制”的设计,将深度解码器的参数量压至极限,实现了深度的完全参数共享。无论下游音频需要多少层残差量化来填充细节,解码器的物理参数规模都不会增加一个字节。

常数级内存:因果滑动窗口与固定 KV Cache

解决了参数层面的冗余,接下来就是攻克长序列音频生成时的显存爆炸问题。

传统语音生成系统在处理连续音频时,注意力机制往往作用于过去的所有时间步。为了实现无论生成 20 秒还是 320 秒都能把内存牢牢锚定在约 21 MB,研究团队在反标记器中全面实施了因果滑动窗口注意力(Causal Sliding Window Attention)与固定窗口键值缓存(Fixed-Window KV Cache)。

在自回归推进过程中,时间注意力不再试图与无穷无尽的历史帧建立全局连接,而是将感受野严格锁定在一个大小固定的局部滑动窗口内。由于注意力计算只在有限的近邻窗口展开,KV Cache 的容量在初始化后便达到上限,后续推理只需像环形缓冲区(Ring Buffer)一样覆盖最早的历史数据。

这彻底重写了端侧音频合成的资源占用曲线:从传统 Transformer 的二次方增长、传统自回归/GAN 的线性增长,直接抹平为一条绝对水平的直线。这种真正的 $O(1)$ 复杂度,正是 Siri 能够在车载长时间导航播报或连贯长篇阅读中保持设备冰凉、内存波澜不惊的关键基石。

关键设计取舍背后的消融洞察

极致的工程压榨往往伴随着精细的架构妥协。论文通过详尽的对比实验,展示了几个至关重要的架构设计取舍。

1. 条件注入:DiT 机制完胜 Cross-Attention

在条件生成任务中,交叉注意力(Cross-Attention)通常是首选。但实验证明,在音频反标记任务中,DiT 风格的自注意力阶段调制与交叉注意力在评估损失和下一 Token 预测准确率上几乎完全重合;而在计算效率上,DiT 机制展现出了压倒性优势:

2. 时间前瞻机制:6 个 Token 的物理感知窗口

由于流式编码器是单向推进的,如果完全不提供未来信息,音频的声学连贯性会大打折扣。论文深入分析了前瞻机制(Temporal Lookahead)对生成质量的影响。

3. 滑动窗口尺寸与层级黄金比例

在滑动窗口大小的探索中,最初的直觉假设该模型只是一个确定性的 Token-to-Token 映射,不需要太长的时间记忆。但实测表明,128 个 Token 的窗口尺寸综合表现最优。模型展现出了极强的注意力选择能力,不仅未因窗口放宽而引入无关噪点,反而更好地锚定了发音韵律的整体走势。

而在整体深度的分配上,论文敲定了 4-6-2 的黄金层级比例(编码器 4 层,时间解码器 6 层,深度解码器 2 层):

此外,模型严格继承了现代大语言模型的规范化设计:采用 RMSNorm、SwiGLU 激活函数、RoPE 位置编码以及分组查询注意力(GQA),全面剔除 Bias 偏置参数,并在进入 Logit 计算前引入 $1/\sqrt{V}$ 的 Logit Scaling 与输出归一化。这些设计被证明在长期训练中对抑制梯度发散、稳定高保真音频生成起到了决定性作用。

性能蜕变:不仅跑得飞快,听感更是全面升级

技术的硬核最终要转化为用户耳边的真实体验。在专门面向矩阵计算优化的 Apple Matrix Coprocessor (AMX) 芯片上,经过端侧专门量化与指令集优化的生产版反标记器展现出了令人惊叹的工业性能。

在端侧实测中,该模型单步推理耗时稳定在 10 毫秒左右,每一步可输出 160 毫秒的真实音频,这意味着实时率因子(Real-Time Factor, RTF)低至约 0.06——也就是比人类真实发声速度快 16 倍。更关键的是,其内存表现完全兑现了架构承诺:峰值动态内存仅为 21 MB,整体模型资产占用仅 329 MB。

在衡量音素区分度的客观评测中,针对 LibriHeavy 数据集进行的发音人内部 ABX(Within-speaker ABX)测试表明,该模型的错误率仅为 5.3%,显著击败了 Moshi 的 Mimi 解码器及自回归 GAN 基线,证明其语义到声学量化的重构保真度处于行业顶尖梯队。

在真实用户的多盲听感测试(MOS,满分 5 分)中,搭载该反标记器的 AFM 3 Core Advanced 系统在三大典型使用场景下迎来了音质的全面飞跃:

评估维度 / 场景 旧版端侧 TTS 基线 AFM 3 Core Advanced (本架构) 净提升幅度
整体平均 MOS 3.87 4.15 +0.28
对话场景 (Conversational) 3.82 4.24 +0.42
助手指令 (Siri Assistant) 3.91 4.12 +0.21
地图导航 (Navigation) 3.89 4.10 +0.21

在主观听觉评测中,MOS 提升 0.1 即可被人类耳朵明显捕捉,而在对话场景下暴涨的 +0.42 则是一次质的质感重塑。它标志着 Siri 彻底告别了传统拼接合成或简单参数合成带来的轻微发音颤抖、吞音与语流顿挫,在连续对白中呈现出与真人极其接近的节奏自如感。特别是在导航场景下,生成的音频纯净度(Audio Cleanliness,即无杂音、无破音的样本比例)达到了罕见的 100%。

走出孤岛:端侧生成式音频的未来范式

Apple 这篇论文的价值,远不止于为 Siri 打造了一个更好听的语音包,它在移动端 AI 体系架构上具有鲜明的风向标意义。

长期以来,业界在探索“多模态大模型端侧实时化”时,往往把精力全部倾注在主干 LLM 的量化与剪枝上,却忽视了输出端解码器这个“隐形电老虎”。当大模型以流式 Token 的形式高速向外涌现意图时,下游声学反标记器如果内存暴涨、算力捉襟见肘,端到端的交互体验依然会瞬间崩塌。

通过时空处理解耦、单层深度条件复用以及恒定窗口 KV Cache,这项工作证明了:我们完全无需为了高保真度而牺牲端侧的轻量性,高维复杂的物理声学建模,同样可以通过数学上的正交分解与极致的参数共享被驯服在移动硬件的寸土之间。

当 21 MB 的极简音频解码底座与十亿激活级别的稀疏大模型在端侧 AMX 芯片上融为一体,一个毫无延迟感知、音色可随情绪自如调节且完全离线私密的全双工个人语音时代,已经悄然降临。