从全Softmax转向混合架构:SANA-Video 2.0用25%锚点换来120倍加速
SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
当视频生成的分辨率迈向 720p、1080p,生成时长从数秒拉长到数十秒甚至一分钟时,扩散模型底层的计算范式正撞上一堵难以逾越的显存与算力墙。目前开源和闭源的主流视频扩散 Transformer(Video DiT),大多重度依赖全时空三维 Softmax 注意力。这类机制对序列长度具有 $O(N^2)$ 的二次方复杂度,一段 1080p 的视频经过潜空间压缩后,Token 数量依然能够轻松突破数万;当视频时长进一步延长时,注意力矩阵与激活值占用的显存迅速吞噬整个硬件带宽。
ArXiv URL:https://arxiv.org/abs/2607.21553
为了逃离二次方复杂度的泥潭,线性注意力(Linear Attention)凭借其 $O(N)$ 的序列扩展能力和循环状态接口,一度被视作终极解法。然而,纯线性注意力的致命短板在于表达能力不足:其固定尺寸的状态矩阵在数学上构成了低秩瓶颈(Rank Bottleneck),很难精准记录高动态场景中的细粒度时空对应关系,生成的视频容易丢失纹理细节并发生形变失真。面对这种“要么算力爆炸,要么画质崩塌”的拉锯战,SANA-Video 2.0 给出了一套极具工程启发性的答案:不要走纯线性注意力的极端,而是用一套经过严密论证的混合架构,重构视频生成底座。

该团队构建了 5B 与 14B 两种参数规模的统一架构。其核心思想在于:以双向门控线性注意力承担 75% 的全局标记混合开销,维持 $O(N)$ 的低计算量;周期性地插入 25% 的门控 Softmax 锚点(Softmax Anchors),以 3:1 的精妙配比恢复全秩交互;再通过块级注意力残差(Block AttnRes)打破传统加性残差的层级阻隔,将锚点提炼的有效信息跨层直接注入深层网络。在单张 NVIDIA H100 上,5B 版本的 SANA-Video 2.0 采样 40 步生成 480p 视频仅需 13.2 秒,VBench 综合得分达到 84.30;在 720p、60 秒的高难度长视频前向测试中,其 DiT 编译速度比同等全 Softmax 基线快了 3.2 倍;配合全栈推理引擎 Sol-Engine 的系统级优化,5B 模型在 720p/5s 规格下的端到端生成时间被压缩至 13.06 秒,相较于同硬件下的 Wan 2.2-A14B 实现了高达 120 倍的速度飞跃。
纯线性注意力的秩瓶颈与 3:1 混合平衡
纯线性注意力之所以难以在视频生成中匹敌全 Softmax,本质上受制于隐状态的压缩极限。在线性注意力中,查询、键、值之间的交互被重构为关联矩阵的递推或累加:
\[S=\sum_{n}v_{n}(\beta_{n}k_{n}^{r})^{\top},\qquad o_{j}=W_{o}\!\left[\operatorname{RMSNorm}\!\left(\frac{Sq_{j}^{r}}{\sum_{n}\phi(k_{n})^{\top}\phi(q_{j})+\epsilon}\right)\odot\sigma(g_{j})\right]\]其中 $q_{j}^{r}$ 与 $k_{n}^{r}$ 为经过旋转位置编码(RoPE)处理的向量,$\phi(\cdot)=\operatorname{ReLU}(\cdot)$ 为核函数,$\beta$ 与 $g$ 分别为写入门控和输出门控。这一公式将序列计算复杂度严格压制在 $O(N d^2)$,处理超长序列极为轻盈。然而,状态矩阵 $S \in \mathbb{R}^{d \times d}$ 的尺寸与输入序列长度无关,当视频帧数增加、时空分辨率跃升时,$S$ 必须把整个时空连续体的全部运动与外观信息强行压入同一个有限维度的空间中。这种固有的低秩表征无法表达所有 Token 之间的精细相互作用,导致物理规律模拟模糊或高频纹理丢失。
针对这一理论缺陷,SANA-Video 2.0 没有试图在纯线性算子内部做打补丁式的微调,而是借鉴了前沿大语言模型(如 Qwen3-Next 与 Kimi-Linear)的混合思路,将网络解耦为两类分工明确的层级:大部分层采用双向门控线性注意力进行廉价的全局信息流动,每隔三层线性层便插入一层门控 Softmax 注意力锚点。
这一 3:1 的配比并非拍脑袋决定。研发团队通过低分辨率代理任务展开了系统的设计空间搜索,实验证明 25% 的 Softmax 占比正是视频生成的“效能拐点”:当 Softmax 比例低于 25% 时,视频的动作一致性与时空对应质量出现肉眼可见的滑坡;而当比例提高到 50% 甚至更高时,计算延迟呈二次方攀升,画质提升的边际效用却迅速递减。
为了进一步让底层硬件算子跑满吞吐,架构彻底抛弃了上一代 SANA-Video 中的时序卷积前馈网络(Temporal-Convolution FFN)。测量表明时序卷积随着序列拉长会带来不可忽视的调度开销,新架构全线改用无卷积的 SwiGLU FFN,并使线性层与 Softmax 层采用独立的 RoPE 张量和差异化的注意力头维度(Head Dimensions)。整套 Backbone 可以无缝映射到现成的 Fused Kernel 上,规避了非标准算子引发的显存碎片。

块级注意力残差:打破加性残差的“记忆退化”
如果仅仅按比例插入 Softmax 锚点,模型依然面临一个架构层面的隐性损耗:传统 Transformer 的加性残差连接 $h_{l} = h_{l-1} + f_{l}(h_{l-1})$ 是一种严格局部的单向流动。Softmax 锚点好不容易在第 $l$ 层计算出的全秩特征,在向深层传递时,必须逐层穿过后续的多个线性层和 FFN。由于后续线性层自身的表达能力受限,上游锚点注入的高秩信息在层层加和稀释后极易衰减,深层网络往往不得不耗费容量去重新推导上游早已算过的特征。
为了让昂贵的 Softmax 锚点发挥最大价值,SANA-Video 2.0 引入并改造了块级注意力残差(Block Attention Residuals,简称 Block AttnRes)。
在 Block AttnRes 的体系下,每 $S=8$ 个连续网络层被划分为一个物理计算块(Block),这正好覆盖了两个完整的“3 线性 + 1 Softmax”循环周期。当一个 Block 内部的所有层计算完毕后,其运行状态被固化为一个全局特征摘要 $b_k$。位于第 $l$ 层的任意注意力或 FFN 子层,其输入不再局限于上一层的输出,而是从一个动态聚合的候选源集合 $\mathcal{V}_{l}$ 中自适应抓取信息:
\[\mathcal{V}_{l} = \{b_{0}, b_{1}, \dots, b_{k}, p_{l}\}\]这里的 $b_0$ 是初始 Token 嵌入,$b_1, \dots, b_k$ 是此前所有已完成 Block 的总结向量,而 $p_l$ 则是当前正在进行的 Block 内的累加中间量。跨层路由权重的计算公式如下:
\[h_{l}(x)=\sum_{v_{i}\in\mathcal{V}_{l}}\alpha^{(\tau)}_{i\to l}(x)\,v_{i}(x),\qquad\alpha^{(\tau)}_{i\to l}(x)=\operatorname*{softmax}_{i}\!\Big(\big(w^{(\tau)}+\phi_{\tau}(t)\big)^{\!\top}\operatorname{RMSNorm}(v_{i}(x))\Big)\]这套设计对视频扩散任务做出了两处关键重构:
首先是查询参数的深度共享(Shared Routing Queries)。在原始语言模型的 AttnRes 中,每个子层都会单独学习一套独立的路由查询向量,这在层数较多时引入了相当可观的参数量和显存占用。研究人员发现,在双向视频生成中,同一个分支(注意力分支或 FFN 分支)在不同深度上的语义聚合偏好具备统计相似性。因此,SANA-Video 2.0 在所有层间为注意力分支和 FFN 分支各分配一个全局共享的查询向量 $w^{(\tau)}$。虽然查询向量是共享的,但因为每个深度的候选集合 $\mathcal{V}_l$ 会随着网络加深逐步变大,且输入的 Token 特征经过了层归一化,网络依然能根据空间位置的不同,自适应产生差异化的路由权重。
其次是剥离显式时间步偏置。在条件流匹配(Flow Matching)的扩散过程中,去噪时间步 $t$ 决定了当前的噪声水平。原本的设计尝试通过 $\phi_\tau(t)$ 让时间步显式参与路由计算,但探针实验揭示:在骨干网络已经使用自适应层归一化(AdaLN)的前提下,路由层学习到的时间步偏置变化极小,强行打乱或置零该偏置对最终验证损失的影响几乎可以忽略。因此,最终模型果断去掉了这一冗余分支(令 $\phi_\tau \equiv 0$),既降低了系统图优化的复杂度,又未造成任何精度损失。
从机制分析来看,Block AttnRes 带来了双重红利:一方面,它将深层状态的有效秩(Effective Rank)直接拉升了约 12%,使深层线性层可以无损“直连”浅层 Softmax 提取的全局关键点;另一方面,它把原本需要保留在显存中的全层激活历史从 $O(NLd)$ 压缩到了 $O(N\lceil L/S\rceil d)$,缓存体积极速收缩到原来的八分之一左右。
从头训练与数据流转的系统工程
混合架构不能依赖已有的全 Softmax 预训练模型做后处理剪枝或线性化转换。原因在于,强行把预训练 Softmax 权重映射到带有门控机制的线性核上,往往会引发灾难性的性能骤降,并遗留难以修复的动力学缺陷。SANA-Video 2.0 选择了高成本但更稳固的路线:全量从头预训练(From-Scratch Training)。
为了支撑这一探索,团队打通了一套工业级的数据与训练流转体系:
在数据清洗侧,团队没有使用单一的总分阈值粗暴过滤素材,而是建立了多维度的“质量-运动漏斗(Quality/Motion Funnel)”。视频生成训练中存在著名的“动态-画质两难”:大动态的镜头往往伴随着运动模糊或压缩伪影,而画质极高、纹理锐利的视频往往接近静止。若使用单一评分阈值,模型要么充斥着大量近乎 PPT 的静态视频,要么学到充满杂质的劣质运动。漏斗机制将画质、美学、运动幅度、时序连贯性彻底解耦,在预训练初期采用宽松阈值建立泛化性,随着阶段推进逐步收紧底层底线。
在时步采样与流匹配设计上,团队针对性地提出了内容感知流偏移(Content-Aware Flow-Shift,TQD)与标记量自适应偏移。在预训练阶段,TQD 根据素材属性引导样本分配:纯大动态样本被赋予正向偏移($+1.1$),使其更多地参与高噪声时步的去噪——高噪声负责勾勒全局结构与粗粒度运动轨迹,天然能掩盖纹理瑕疵;而画面极其纯净但动态微弱的样本则被赋予负向偏移($-1.1$),集中在低噪声时步指导模型打磨发丝与反光等微观细节。
到了后续的持续训练和监督微调(SFT)阶段,为了解决动态多分辨率与多帧数训练带来的尺寸跳变,模型根据潜空间 Token 总数实时插值计算流偏移量:从 480p/81 帧的 4,290 个 Token 线性插值至 720p/193 帧的 23,000 个 Token,使流偏移量在对数空间内平滑过渡。配合包含双时间步自蒸馏(Self-Flow)的目标函数,以及对验证损失进行 100 步等宽噪声分桶监控(Timestep-Stratified Validation),团队得以精准定位每个噪声区间的收敛状态,彻底摆脱了单标量损失因方差过大而掩盖退化的问题。
性能评测与端到端部署
架构的革新最终兑现到了极其亮眼的能效与画质指标上。
在画质基准 VBench 的全面评测中,仅包含 50 亿参数的 SANA-Video 2.0 展现了越级挑战的能力。在 480p 分辨率、40 步采样下,模型斩获了 84.30 的综合高分,其运动平滑度、物理常识遵循度以及文本一致性,完全能与数百亿参数的全 Softmax 旗舰开源模型相抗衡,但在延迟上仅需 13.2 秒。
当生成规格推向 720p 与长时长时,线性注意力的理论优势完全爆发。在相同的内核编译优化下,对比同等参数量的纯 Softmax DiT 骨干,SANA-Video 2.0 在 720p/60s 场景下的 DiT 前向传播速度达到了后者的 3.2 倍,并且这一速度差距随着视频时长的增加呈现出明显的发散趋势。这证明,混合注意力架构彻底打破了全 Softmax 模型在长视频领域算力消耗陡增的枷锁。
除了算法层面的精简,工程团队针对该硬件友好型架构开发了全栈推理优化引擎 Sol-Engine。通过深度算子融合(Kernel Fusion)、特征缓存以及细粒度稀疏注意力调度,Sol-Engine 将 5B 模型在单张 H100 上的 720p/5s 视频生成端到端耗时大幅压缩至 13.06 秒。面对同样在单张 H100 上部署的 Wan 2.2-A14B,SANA-Video 2.0 的端到端吞吐整整快了 120 倍。即便是 40 层、参数量达 14.25B 的旗舰版本,也能借助量化感知训练(QAT)在保持 BF16 原生画质的同时,实现 MXFP4 权重与 MXFP8 激活值的量化落地,极大降低了本地化高保真内容生成的部署门槛。
视频生成架构的下一站
SANA-Video 2.0 的技术路线具有极强的风向标意义。它证明了在视频扩散领域,全 Softmax 注意力绝非不可替代的唯一真理,而纯线性注意力也并非不可救药。通过“25% Softmax 锚点保下限、75% 门控线性换吞吐、AttnRes 跨层穿透”的系统级组合,模型成功在表现力与计算复杂度之间锚定了最佳平衡点。
这种混合注意力的设计理念,为未来超长视频、实时交互式视频生成以及端侧多模态物理世界的仿真,铺平了一条极具实操性的落地道路。对于开源社区与工业落地而言,让视频生成走出昂贵的算力集群、在普通单卡环境里实现秒级交付,正从一种愿景转变为切实的工程现实。