SPADE:自适应3D分块稀疏引擎,视频扩散注意力提速3.4倍
SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

生成式 AI 正在全面转向高分辨率、长时序的视频生成任务,以 Sora、Hunyuan-Video、Wan 2.1 和 Wan 2.2 为代表的视频扩散 Transformer(vDiT)已经成为行业前沿的主流架构。然而,伴随画面质感与时空连贯性提升而来的,是极其沉重的计算代价。在 720p 分辨率及数十乃至上百帧的视频生成场景下,单一视频序列切片后的 Token 数量动辄数万甚至数十万。即使采用 FlashAttention 等成熟技术将显存占用降至线性规模,自注意力机制(Self-Attention)内生的二次计算复杂度 $\mathcal{O}(N^2)$ 依然构成了显卡计算单元与内存带宽难以承受的硬性壁垒。
ArXiv URL:https://arxiv.org/abs/2608.03335v1
面对这种计算冗余,学术界与工业界很早就将目光投向了稀疏注意力(Sparse Attention)。视频数据在时空维度上存在天然的局部相关性与结构冗余,绝大多数 Token 之间并不需要维持全局成对计算。然而,过往的稀疏化尝试往往陷入两难窘境:预设固定分块的静态方法虽然算子开销小,却缺乏对画面内容动态变化的感知能力,极易损失细节;而依赖输入内容动态推断注意力掩码的方法,虽然理论稀疏度高,其构建索引、计算重要性分数的控制开销却极其沉重,常常出现“筛选 Token 花的时间比算注意力还多”的反讽局面。
来自北京航空航天大学和北京大学的研究团队给出了新的破局思路。他们提出了名为 SPADE 的免训练(Training-Free)、输入自适应稀疏注意力引擎。该框架打破了以往算法设计与系统实现相割裂的局限,从“算法-系统协同设计”出发,构建了一套统一的稀疏表达规范、极低开销的自适应方案生成算法,以及深度适配现代 GPU 架构的执行引擎。在 Hunyuan-Video 以及 Wan 2.1/2.2 等多个主流视频生成模型上,SPADE 在完整保持生成画质与时空连贯性的前提下,将注意力算子加速了 2.26 倍至 3.40 倍,端到端推理提速最高达到 1.80 倍。
视频注意力的两难:静态死板与动态高耗
要理解 SPADE 的切入点,首先要厘清视频扩散模型在计算结构上的特殊性。现代 vDiT 模型通常借助 3D 变分自编码器(3D VAE)将高维像素流压缩到紧凑的潜在空间。例如 Hunyuan-Video 和 Wan 系列模型,会将视频张量压缩为带有下采样时空维度的 3D 隐空间表示,随后展平成一维长序列送入 Transformer 模块。由于展平操作打散了时空局部邻域,直接套用传统的注意力计算,就意味着每个 Token 都要和跨越数帧、数千个空间位置的全部 Token 进行点积运算。
为了降低这种二次方开销,现存的稀疏注意力技术大致可以归纳为三类路线。第一类是静态稀疏,例如固定窗口或固定 3D 步长切分,这类方法执行极快,但无法随画面主体的移动或复杂场景的切换而自适应调整;第二类是半静态稀疏,系统在少数几个预先定义的分块模版中进行有限切换,虽然引入了微弱的自适应性,但搜索空间狭窄,难以捕获复杂的动态注意力分布;第三类则是纯动态稀疏,根据输入的 Query 与 Key 实时计算相似度掩码,动态挑出高权重区域。
第三类动态方法理论上最为优美,能在极高稀疏比下保留生成画质,但实际落地时却频频遭遇系统级瓶颈。动态选择关键 Token 需要经历特征降维、重要性估计、排序截断(Top-K/Top-P)和稀疏掩码构建等一系列步骤。在现有的许多实现中,这套前置“模式搜索(Pattern Search)”的耗时甚至占到了整个注意力计算时间的一半以上。换言之,算法层面辛苦节省下来的浮点运算量(FLOPs),在系统层面全被繁琐的控制流、非连续显存访问和小算子启动开销吞噬殆尽,最终在真实墙钟时间(Wall-clock Time)上难获明显增益。
统一抽象:vDiT-SSR 规范与表达体系
为了化解上述矛盾,SPADE 首先确立了一套通用的抽象表达体系——视频扩散 Transformer 稀疏方案表示(vDiT-SSR)。研究团队意识到,静态、半静态与动态三种路线并不是非此即彼的对立关系,而是一个统一参数空间中的不同特例。vDiT-SSR 旨在为整个稀疏生命周期提供统一的形式化接口,其核心由三个互相关联的组件构成:3D 分块候选方案集、稀疏策略控制函数,以及用于动态掩码生成的摘要器(Summarizer)与估计器(Estimator)表达式。
在分块设计上,vDiT-SSR 允许在连续的时空网格中定义多维分块方案候选集,例如纯空间延展分块、纯时间沿轴分块或混合时空分块。面对进入注意力层的张量,引擎并不采用单一固定的切分颗粒度,而是为后续的自适应匹配提供丰富空间。在动态推断部分,vDiT-SSR 引入了 Summarizer 与 Estimator 机制:Summarizer 负责将每个时空块内部高维的数十个 Token 浓缩为极具代表性的块级摘要向量;随后,Estimator 在这些低维摘要向量之间进行轻量点积或比较,以极小的计算代价评估块与块之间的“块间相关性”,以及块内部信息聚集程度的“块内重要性”。
依托这套抽象,SPADE 能够衍生出多种兼顾精度与速度的实例。例如,团队定义的 DSA-SPADE 通过提取块内的最大、最小与均值特征向量来构建估计;DSA2-SPADE 则引入更精细的极值组合;MEAN-SPADE 则以纯均值向量展开快速粗筛。更关键的是,这一规范允许开发者将注意力汇聚(Attention-Sink)机制、局部固定时空窗口与内容自适应动态块无缝融合成一个稀疏掩码,使算法能在不同颗粒度之间自如调配稀疏策略。
极速决策:基于 SICS 的运行时方案生成
有了表达框架之后,系统面临的紧迫问题是:对于给定的输入帧和当前的去噪步骤,如何以微秒级的代价决定每个注意力头该使用哪种 3D 分块,并分配多少稀疏预算?如果方案决策本身耗时过长,整个系统的端到端收益就会化为泡影。
SPADE 给出的核心算法创新是运行时方案生成模块(Scheme Generation),其理论支撑在于块内余弦相似度之和(SICS,Sum of Intra-block Cosine Similarities)。直觉上,如果某种 3D 分块方式能够将语义高度相近、特征向量夹角极小的 Token 圈定在同一个分块内部,那么该分块就极好地契合了当前视频内容的物理时空结构。在这些特征高度同质的块内,用单一摘要向量代表整块进行外部交互时的信息损失最小。基于这一洞察,SPADE 为每一种候选分块方案计算 Query 和 Key 的聚合分数(Aggregation Score, AS):
\[\mathrm{AS}(Q \mid \text{scheme}) = \sum_{i=1}^{NB} \mathrm{SICS}\left(\mathbf{Q}^{(i)}_{\text{block}}\right)\]直接计算块内所有向量成对的余弦相似度开销过高,复杂度为分块大小的二次方。为此,论文推导出了高度简化的数学变形。通过对归一化特征向量求和,SICS 可以化简为基于累加向量内积的增量计算形式:
\[\mathrm{SICS}\left(\mathbf{Q}^{(i)}\right) = BS + 2\sum_{j=1}^{BS}\Big(\sum_{i=1}^{j-1}\hat{\mathbf{q}}_{i}\Big)^{\top}\hat{\mathbf{q}}_{j}\]利用这一数学特性,系统能够以接近线性维度的计算量,在线评估所有分块候选方案,并为每个注意力头精准挑选出聚合分数最高的最优切分架构。整个方案生成阶段仅占稀疏注意力总运行时间的 8% 左右,完全消除了过去动态搜索算法中昂贵的前置延迟。
紧接着,选出的聚合分数连同当前的去噪时间步信息,被输入至策略函数(Policy Function)中。在视频扩散模型的去噪轨迹中,早期时间步通常确立全画面的全局布局与语义轮廓,对全局注意力的依赖较高;而随着去噪进入后期,模型主要聚焦于高频纹理与局部细节的微调,注意力冗余度极高。策略函数由此在不同时间步、不同网络深度以及不同注意力头之间实施非均匀预算分配,让关键路径保留充足连接,而在冗余区域大幅削减计算,做到算力物尽其用。
系统重构:硬件感知的多头稀疏执行器
算法与数学层面的优化,最终必须落入底层硬件执行的节拍中。如果底层算子依然采用零散的通用 CUDA 核函数拼装,频繁的全局显存(HBM)读写与同步屏障同样会摧毁性能优势。SPADE 的另一大核心贡献,在于实现了一套专为现代 GPU 架构打造的高性能多头稀疏注意力执行器,完成了从算法逻辑到极致硬件吞吐的“最后一公里”跨越。
执行器在底层主要引入了三项关键系统级优化:
其一是深度的算子级融合(Operator Fusion)。在传统流程中,将张量调整为 3D 分块布局、计算摘要特征、再评估块内分数往往对应多个独立的核函数调用,中间数据反复进出显存。SPADE 将数据布局重排、块摘要计算与块内重要性估计全部融合为单一 GPU 算子。张量在加载到片上共享内存(Shared Memory)后一次性完成所有前置判断,彻底消除了中间特征写回全局内存的带宽损耗。
其二是多头分组调度(Head Grouping)。在多头注意力机制中,不同的注意力头可能自适应挑选出不同的 3D 分块几何形状。直接按单头 launch kernel 会导致每个核函数的网格规模过小,硬件资源填充不饱满。SPADE 在运行时动态扫描所有头的选择结果,将选择相同分块方案的多个头编排成组,合并执行 Q/K/V 的搜集与布局转换,显著提升了 Tensor Core 的并发计算利用率。
其三是专为 Hopper 等新一代微架构定制的 Flash 块稀疏注意力算子(Flash Block-Sparse Attention)。该核函数在内部将动态生成的二维稀疏掩码预处理为排好序的分块行压缩格式(Ranked BSR),确保计算线程块在遍历有效注意力块时始终保持连续的显存读取。算子内部全面继承并发展了 FlashAttention 的精髓,在片上寄存器中以数值稳定的在线 Softmax 机制维持增量计算,绝不显式实例化任何中间注意力大矩阵。针对 NVIDIA Hopper 架构,算子深度挖掘了异步张量内存加速器(TMA)与 Warp-group 级矩阵乘加(WMA)指令的能力,将显存搬运与张量核心计算重叠在极高深度的流水线中,达到了逼近硬件理论极限的运算效率。
实验评测:提速表现与画质验证
为了全面验证 SPADE 的真实效能,研究人员在装备单块 NVIDIA H800 显卡的平台上,针对当前极具代表性的开源视频扩散模型进行了系统性测试。评测覆盖了 Hunyuan-Video-13B(文生视频,125 帧)、Wan 2.1-14B 与 Wan 2.2-14B(文生视频与图生视频,61 帧),生成分辨率统一设定为 720p 高清规格,序列中单帧包含高达 3600 个 Token。
作为对比基线,评测不仅囊括了全注意力黄金标准 FlashAttention-3,还对比了半静态代表 Sparse-VideoGen,以及动态稀疏前沿方案 Sparge Attention、X-Attention 和 Sparse-VideoGen2。
在运行速度方面,微观性能剖析直观展现了 SPADE 的统治力。对单层注意力耗时的分解测试显示,SPADE 在“模式搜索”和“注意力计算”两项核心开销上均取得了显著优势。在稀疏度大致对等的前提下,SPADE 用于搜索稀疏模式的时间仅为 Sparse-VideoGen2 的 25%,比 Sparge Attention 缩减了 74%;而在随后的稀疏注意力密集计算中,SPADE 的耗时仅为 Sparse-VideoGen2 的 65%。这意味着在同等稀疏度下,SPADE 模式搜索快了 3.48 倍,计算内核快了 1.80 倍。
在端到端宏观表现上,SPADE 同样保持了强劲优势。在主流模型上,SPADE 推动注意力核心加速达到 2.26 倍至 3.40 倍;而在整个视频扩散反向传播的去噪循环中,端到端整体推理时间缩短至原来的 1.49 倍到 1.70 倍。为了进一步探寻极限性能,团队还给出了 SPADE-Turbo 配置——仅在首个去噪步保留全注意力,随后全流程启用自适应稀疏计算,成功将端到端提速比推升至 1.80 倍。
速度的大幅提升并没有以牺牲视觉生成质量为代价。针对视频生成领域的权威评测基准 VBench(综合评估时空一致性、运动平滑度、画面美学与文本匹配度),SPADE 在各项模型中的综合得分始终稳定在 0.76 至 0.81 区间,与耗费全量算力的 FlashAttention-3 表现毫无二致,部分指标甚至凭借自适应过滤背景高频噪声而略有反超。在峰值信噪比(PSNR)、结构相似性(SSIM)和感知图像贴近度(LPIPS)等客观画质保真度指标上,SPADE 在 Wan 2.1 和 Wan 2.2 的各项文生视频与图生视频任务中全面领先现有稀疏基线,展现了极高的生成保真度。
机制透视:消融实验与设计启示
SPADE 的优异表现绝非单点调优的偶然巧合,随后的多维度消融实验清晰揭示了各个模块协同起效的内在机理。
在分块策略消融中,研究人员在 Wan 2.1-T2V 模型上维持约 82% 的超高稀疏度,分别测试了纯空间静态分块、纯时间静态分块、多候选静态分块以及对应的动态分块变体。实验表明,动态选择相较静态切分带来了决定性的画质飞跃,这印证了视频帧间非刚性运动的多变性绝非死板窗口所能包容。更进一步,单纯的动态空间或动态时间分块在保真度上均不及 SPADE 的全功能版本,充分证明了基于 SICS 的动态聚合评分机制在跨时空维度精确锁定信息密度最高区域的卓越能力。
对策略函数(Policy Function)的敏感性测试则进一步揭示了“差异化预算分配”的价值。在面对 VBench-2.0 中极具挑战性的高难度复杂情节提示词(Complex_plot)时,若剥离聚合分数的指导、强行在所有注意头与时间步施加均一的稀疏限制,模型的生成质量与画面结构会出现肉眼可见的裂解。而引入聚合分数作为调控中枢后,系统能够在场景突变或动作剧烈时自适应放宽注意力预算,确保复杂语义不失真,体现出极高的鲁棒性。
总结与展望
长久以来,学术界在探索模型加速时,往往容易陷入两极分化的偏向:理论算法研究者倾向于在抽象的数学公式中设计复杂的掩码筛选逻辑,却忽视了 GPU 硬件体系对规则并行度与连续访存的严苛要求;底层系统优化者则更习惯在固定的数据结构上深挖指令级流水,难以触及模型语义层面的动态冗余。
SPADE 的价值不仅在于为 Hunyuan-Video 和 Wan 系列等当红视频大模型提供了即插即用、无需重新训练的高性能推理加速方案,更在于它清晰展示了“算法-系统协同设计”在解决长时序生成模型瓶颈上的巨大能量。通过 vDiT-SSR 将稀疏模式形式化,依托 SICS 在算法侧实现亚微秒级低开销动态决策,再借由融合算子和硬件感知的 Flash 块稀疏内核将理论优势落到实处,SPADE 为下一代高分辨率视频生成引擎的规模化工程落地指明了极具实用价值的技术路线。