Visko Orbis 1.0:边播边改指令!有界记忆打通4K 24帧实时交互长视频
Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation

当前的视频生成大模型在单镜头画质与运镜表现上已经足够惊艳,无论是 Sora、Gen-3、Kling 还是 Wan,都能够交出电影级别的短视频片段。然而,现有模型几乎全部运行在离线批处理的范式之中:用户输入一段 Prompt,在进度条前等待数分钟,最终拿到一段完全固化的短片。这种模式能够胜任传统的素材制作,却天然隔绝了所有需要即时反馈的活态场景——无论是正在直播的数字人、即兴推进的互动叙事,还是可探索的虚拟环境与游戏世界,用户都需要画面在播放的同时持续演进,并随时根据新的指令调整走向。
ArXiv URL:https://arxiv.org/abs/2607.26694v1
要让视频模型从“离线渲染器”蜕变为“常驻运行的交互引擎”,核心障碍集中在三点:交互延迟是否足够低、自回归推演能否跨越分钟甚至小时级而不崩坏、高分辨率流式推理能否追上播放帧率。

Visko Orbis 1.0 的发布正是为了解决这些瓶颈。作为一套面向实时、可交互长视频生成的“Live Model”,它将推理边界直接锚定在最终交付的视频流上:用户可以在视频播放与生成期间随时修改文字指令,平均不到一秒即可在画面中看到过渡变化;借助有界多尺度记忆机制,系统支持长达一小时的持续自回归推演,且没有出现明显的质量衰减或色彩漂移;而在工程落地层面,系统通过因果流式扩散、蒸馏单步流匹配与参考感知超分辨率管线协同,成功在 GPU 集群上实现了 4K @ 24 FPS 的实时帧率交付。
告别切片拼接:流式状态机的交互逻辑
要理解 Visko Orbis 1.0 的突破,首先需要明确它与传统长视频方案在架构逻辑上的差异。过去业界生成长视频,多采用“逐段外推(Sliding Window)”或基于重叠帧的过渡拼接。这种做法在本质上依然是静态批处理的串联,每推进一次都伴随着漫长的等待,一旦用户中途改变想法,整条视频通常只能推倒重来。
Visko Orbis 1.0 将视频生成重构为一个持续运行的因果潜空间流(Causal Latent Flow)过程。在数学表达上,模型将视频拆解为连续的时序块(Chunk)$z_k$。在推演第 $k$ 个时序块时,模型不仅读取当前的文本控制条件 $c_k$,还会读取由先前生成内容构成的有界视觉历史 $H_k$,以及由初始图像或视频前缀提供的参考特征 $r_k$。整个自回归核函数写作 $p_{\theta}(z_k \mid H_k, c_k, r_k)$。
这种形式把会话的“长期视觉实体状态”与用户的“即时控制意图”彻底剥离。生成一旦启动,历史视觉状态便以因果链条向后推进,外部文本指令则被视作时序注入的控制信号。当用户在第 $k$ 块画面生成中途敲下新提示词时,异步编码器会将其打包并在下一个时序块边界生效。已经提交并交付播放的帧绝不再被重新改写,而未生成的未来帧则平滑承接新语义,使得文生视频(T2V)、图生视频(I2V)以及视频续写(V2V)在底层共享同一套流式演进算子。
打破误差滚雪球:有界多尺度记忆与抗漂移训练
任何尝试过用自回归模型跑超长视频的研究者都会遇到“自回归漂移(Autoregressive Drift)”难题。模型在每一步生成中引入的微小高频噪点、光影偏差或解算误差,会在后续步骤中不断作为输入历史被循环放大。几十秒后,人物面部特征崩解、背景空间扭曲、甚至画面饱和度逐渐溢出等问题往往接踵而至。
Visko Orbis 1.0 没有盲目堆叠全量历史上下文,而是提出了一套有界多尺度记忆(Bounded Multi-Scale Memory)架构:
-
近端与远端的分层组织:在推演当前块时,离当前时间最近的几个潜空间时序块保持原始的高时间与空间分辨率,以便模型捕捉即时动作的连续性;而距离较远的更早历史跨度,则在固定的 Token 预算下被渐进式压缩。
-
固态记忆的单向沉淀:当更古早的时序块即将滑出显式滑动窗口时,它们的信息并不会被直接丢弃,而是通过一个固定的轻量神经网络,被蒸馏沉淀到一个固定维度的可学习记忆状态 $M_k$ 中。去噪过程只读取该记忆,只有当旧块被移出显式缓存时才触发写入,避免了多步去噪反向污染持久记忆。
更关键的是训练阶段对误差的主动暴露。如果在训练时模型接触到的永远是真实完美的视频切片,部署时一旦遇到自身生成的不完美画面,系统就会迅速脱轨。为了克服这一分布偏移,团队引入了显式的历史扰动与漂移校准机制:在流式微调训练中,输入历史并不保证完全干净,而是按一定比例混入时序退化、统计漂移以及高斯噪声;同时,系统在生成历史与真实参考视频之间提取固定的统计漂移向量,并将其反向施加到训练前缀中。这让模型在接触到轻微的色彩偏移或画面残影时,学会了自我纠正与抑制,从而保障了长达数千秒推演下的色彩饱和度与结构稳定性。
数据分级治理:从静态事件到时序动态指令
强大的时序控制能力无法凭空从无序的短视频数据中涌现。长视频模型不仅要懂得画面静态美学,更要理解“动作的始末”以及“多事件之间的过渡逻辑”。Visko Orbis 1.0 的底层依赖一套多阶段的数据工程管线。

原始视频素材在经历分镜切分后,并没有被切成统一时长的机械切片,而是依据叙事完整性与镜头运动,被归纳为 3 到 240 秒不等的独立片段。在通过了多层安全过滤与涵盖曝光、闪烁、抖动、压缩伪影的质量门禁后,数据并没有直接灌入模型,而是通过“覆盖率账本”进行了动态重平衡,防止大量平庸的静态镜头或同质化运镜挤占注意力。
标注流程为后续的多事件交互埋下了关键伏笔。系统并行产出两组文本:一组是概括整段核心内容的单事件标注;另一组则是精确对齐到具体时间戳的多事件时序标注。这支撑了模型的三阶递进式训练:
第一阶段,利用高质量的单事件数据,让继承自双向短视频先验的模型适应因果流式块生成机制,建立起扎实的局部物理运动与单指令跟随能力;第二阶段,引入带有精确时间起止的多事件长视频训练,在长达 240 秒的连续视频中,条件文本会随着时间轴动态切换,强迫模型在指令突变时,既要响应新的事件描述,又要维持画面主体与环境的合理延续;第三阶段,则由人工精选出带有明确时空跃迁(例如主角推门进入、镜头自然转向天空等)的高难度样本,进行高置信度的强化微调。这种渐进式策略使得系统在后续面对用户即兴敲入的新 Prompt 时,具备了稳健的“语义转折”处理能力。
蒸馏与对齐:单步生成与物理一致性奖励
交互式视频生成对推理吞吐量有着极度严苛的指标要求。标准的流匹配(Flow Matching)或扩散模型通常需要数十步去噪积分,如果每次生成一个时序块都要迭代几十次,即使显卡算力再强,也绝不可能追上每秒 24 帧的播放基准。
为了砍掉多余的计算开销,系统在后训练阶段实施了两步关键策略。其一是无分类器引导(Classifier-Free Guidance, CFG)蒸馏。传统扩散模型通过正向和负向两个分支的加权外推来强化 Prompt 对齐,这意味着两倍的前向计算。Visko Orbis 1.0 通过引导蒸馏,将教师模型固定步长下的联合外推向量直接嵌入到紧凑的学生模型权重中,使得推理时仅需单次条件前向传播即可达到强引导效果。其二是轨迹一致性与自驱分布匹配(Self-Forcing Distribution Matching),将去噪步数压缩至极少步数,同时避免了少步自回归推演时动作僵硬的问题。
在效率被极致压榨之后,模型进入了基于强化学习的多维度对齐阶段。团队采用了 Flow-GRPO 与视频变体 DanceGRPO 相结合的相对优势强化学习算法:
在该框架下,旧策略收集成组的随机推演轨迹,在当前策略与旧策略之间计算带截断的比率损失。不同于常见的单标量评分,系统在各 Prompt 组内对“视觉美学质量”、“动作自然度”以及“图文语义对齐度”分别进行打分与归一化,形成综合相对优势。更进一步地,为了解决视频模型常见的“反物理”运动(例如物体无故穿模、形变或凭空消失),研究者引入了一个潜在世界模型(Latent World Model)作为辅助判别器,对候选未来块的物理合理性进行预测打分。这一步为生成流注入了对惯性、重力与碰撞的先验约束,大幅减少了长视频中常见的肢体畸变。
软硬件协同:实现 4K 24 FPS 的流式超分交付
即便是经过蒸馏的流式生成器,如果直接在 4K 分辨率的潜空间中运行自回归推演,其显存占用与计算开销也难以在当前硬件上做到实时交付。Visko Orbis 1.0 采取了“原生紧凑生成 + 流式超分辨率级联”的软硬件协同架构。
核心因果生成器在原生的 $832 \times 480$ 分辨率下专注处理语义演化、运镜控制与物理动力学。伴随原生时序块不断生成,一个专用的单次细化视频超分辨率(Video Super-Resolution, VSR)模型以流式流水线接入,将解码后的视频窗口提升至 4K 超高清画质。
为了保证端到端的时间预算不超标,超分链路对传统的视频自动编码器(VAE)进行了两阶段的时序感知蒸馏。通过紧凑型编解码器对大容量教师网络进行潜空间与像素域对齐,大幅降低了单帧重建的算力消耗。而在超分 Transformer 结构中,设计采用了空间窗口注意力机制,同时在每个局部空间窗口内保留全部时序帧,使得长镜头中的高频纹理得以在时间轴上相互对齐借力,避免了空间拼贴导致的画面闪烁。
在推理引擎实现上,系统通过深度计算图编译和算子融合,消除了一切不必要的显存搬运。QK 归一化、自适应层归一化(AdaLN)以及旋转位置编码均被固化进统一的执行核中;静态空间网格与时间步投影等张量在会话初始化时预计算常驻;生成、潜空间解码、超分增强以及最终的视频流编码被编排为流水线并发重叠。正是这套严密的系统工程设计,最终将“端到端全链路延时”压缩进了硬性播放时间窗内,完成了 4K 24 FPS 的无缝交付。
评测启示与交互视频的下一站
在实验评估上,Visko Orbis 1.0 脱离了以往单纯依赖几段 5 秒固定视频挑选最佳画面的打擂模式,将评测基准放在了完整的持续交付视频流上。在 1 到 3 分钟的连续测试集中,无论是 DOVER 美学与技术质量得分,还是 VideoAlign 的动作与视觉质量指标,该模型均拿下了同类流式方案中的前列位置。而在针对整体画质偏好与时序稳定性的 Arena 双盲横向评测中,Orbis 1.0 的点估计得分也展现了突出的表现;在更严苛的一小时连续推演诊断中,系统的色彩饱和度轨迹和指令遵从曲线几乎保持水平,没有展现出困扰同类方案的雪崩式漂移。
这项工作所折射出的,不仅仅是参数规模或生成画质的又一次常规提升,而是大模型交互范式的一场关键转向。长久以来,AI 视频生成都被困在“非即时响应”的被动创作工具定位上。而 Visko Orbis 1.0 证明了一套可持久运行、能够边跑边改、且算力开销可被现代基础设施消化的“Live Model”是完全可行的。
当视频模型能够以每秒 24 帧的节奏响应实时输入,它所对应的下游应用便不再局限于视频后期的辅助剪辑,而是直接叩开了云端实时生成游戏、交互式沉浸戏剧、全拟真数字伴侣以及动态环境仿真等全新场景的大门。将状态机引入生成流、用多尺度记忆抗击漂移、并在统一的工程流水线中实现极速交付——这一整套方法论,无疑为未来“世界模拟器”的落地提供了一条极具说服力的实践路径。