Crayotter:用组内相对偏好反传攻克视频剪辑,9B模型超越商业系统

Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

让大模型充当自主视频剪辑师(Video Editing Agent),是多模态智能体走向长程实操的关键一步。然而,在实际制作中,模型往往要面对长达数十步甚至上百步的操作链路:浏览海量素材、粗剪时间线、精细对齐音画、调整叙事节奏、导出成品并根据反馈反复修改。

ArXiv URL:https://arxiv.org/abs/2608.02694

在这种超长决策链条下,传统强化学习遇到了难以逾越的技术断层:中间过程可验证,但最终成片极度主观;最终成片有直观好坏,却无法反推是哪一步操作立了功或背了锅。

许多团队尝试直接引入多模态大模型作为裁判,为剪辑出的视频打出一个全局标量分数(如 1 到 10 分)。但不同视频任务的目标、风格、素材差异极大,跨任务打分毫无校准可言;更致命的是,直接把一个成片总分均匀摊派给每一个步骤,模型根本学不会哪一段剪辑节奏出了问题,策略极易崩溃。

针对这一困境,开源研究项目 Crayotter 提出了全新范式:GRPB(Group-Relative Preference Backpropagation,组内相对偏好反向传播)。该方法不强求跨任务绝对打分,而是将同一素材、同一需求下的多条候选剪辑轨迹锁定为一个对比组,将主观评判转化为组内零和排序优势,再借助滞后分配器将偏好信用精确回传至语义剪辑片段。基于该方法训练的 9B 参数开源智能体 Crayotter-9B,在权威后处理基准 AgenticVBench 以及严格的受控盲测中,不仅大幅超越同类强化学习基线,甚至在多项指标上击败了若干闭源商业多模态模型。

图1:为什么视频剪辑偏好需要片段级信用分配

从绝对主观评分到任务内相对排序

在自主视频编辑系统中,执行轨迹本身可以提供确定性极强的“过程反馈”:工具是否成功调用、时间线对象是否合法、导出的视频时长是否符合要求、阶段覆盖率如何。然而,节奏是否拖沓、叙事是否连贯、剪辑风格是否契合用户需求,这些高维度的视听质感只有在最终成片渲染完成后才能被观测到。

如果给成片打一个全局绝对分数,这个分数会不可避免地把产品质量、任务原生难度以及大模型裁判尺度的漂移混杂在一起。例如,一段本来就极难剪辑的杂乱素材,即使剪出合格成片也可能只拿到 6 分;而一段高质量样片随手拼接就能拿到 8 分。全局打分无法为策略模型提供稳定梯度。

Crayotter 团队的核心突破在于:将主观生成任务还原为同任务内的相对比较。当给定完全相同的用户需求、素材库、目标时长与工程约束时,生成的多条不同轨迹就具备了严格的对齐上下文。此时,评判“哪一个成片更好”变成了局部明确的序数关系(Ordinal Comparison)。

具体而言,GRPB 在一个包含 $K$ 条候选导出结果的同任务组内,将裁判判定转换为成对胜负优势:

\[A_{k}^{\mathrm{rank}}=\frac{1}{K-1}\sum_{j\neq k}\left[\mathbf{1}(J_{k}-J_{j}>\epsilon_{J})-\mathbf{1}(J_{j}-J_{k}>\epsilon_{J})\right]\]

其中 $J_k$ 为成片评价打分,$\epsilon_J$ 为平局容忍阈值。该设计直接带来了极其纯粹的数学性质:排序优势 $A_k^{\mathrm{rank}}$ 严格落在 $[-1, 1]$ 区间内,且在组内严格满足 $\sum_{k}A_{k}^{\mathrm{rank}}=0$。这意味着跨任务的尺度偏移、裁判打分的绝对漂移被彻底消除,策略优化面对的是零和博弈性质的纯相对信号。

图2:GRPB 整体训练架构

滞后与有界分配:成片偏好如何拆解到剪辑片段

解决了任务内排序之后,最核心的难题随之而来:成片的相对优势,究竟应该归功或归咎于中间的哪一个具体操作?

如果像许多基于组相对策略优化(如 GRPO)的方法那样,把轨迹级的标量优势广播给整条轨迹的所有 Token 或动作,会导致长文本或长链路中出现严重的误归因。长动作序列可能仅仅因为包含了更多 Token,就无端瓜分了大量奖励,进而诱发模式坍塌。

GRPB 采用了一种解耦设计:以持久化的工作区资产(Workspace Artifacts)和语义剪辑阶段为锚点,将长程轨迹划分为离散的剪辑片段(如粗剪筛选、时间线装配、音画修复等),并在片段终点放置信用分配。为此,团队设计了三道关键防线:

1. 滞后参数(Lagged Allocator)切断即时过拟合

GRPB 训练了一个轻量级的 Bradley–Terry 分配模型,输入由各片段特征(如动作类型、执行状态统计、耗时、语义变更等)构成的稀疏向量 $f_{k,m}$,输出片段级效用 $u_{k,m} = w^\top f_{k,m}$。为了防止分配器在当前批次中强行“死记硬背”当前样本的裁判标签并直接反馈给自己,系统强制采用滞后机制:用于向策略回传信用的分配器参数 $w^-$,必须是在看到当前任务组之前就已经固化的旧状态。策略拿走信用后,系统才在后台计算预测损失并更新分配器,供后续批次使用。

2. 可靠性门控(Reliability Gating)保护冷启动

在训练初期,分配器本身的排序能力不足,不可靠的细粒度预测会直接毁掉策略。GRPB 引入了动态门控系数 $g$:

\[g=\min\!\left(1,\sqrt{\frac{N_{\mathrm{cal}}}{8N_{\mathrm{warm}}}}\right)\operatorname{clip}\!\left(\frac{a-0.5}{a_{*}-0.5},0,1\right)\]

系统持续监控滞后分配器在历史批次上的成对预测准确率 $a$。只有当校准样本量累积到一定规模,且前向预测准确率稳健高于随机水平(0.5)时,偏好预算才会真正放行给下游策略。如果分配器表现不佳,门控系数会迅速归零,避免给策略注入噪声。

3. 注水法截断与严格能量守恒(Signed Capped Allocation)

为防止模型投机性地给某些模式化动作分配过高奖励,单片段信用被施加了严格的上限截断 $C$。系统使用类似注水算法(Water-filling)的方式分配总预算 $b_k$:

\[c_{k,m}=s_{k}\min\{C,\lambda_{k}q_{k,m}\}\]

当某个高分片段的份额触及上限 $C$ 时,将其锁定并从激活集合中剔除,剩余偏好预算继续按照末梢指数比例重新分配。这种数学构造保证了每个片段的奖惩绝对值不超过 $C$,同时单条轨迹分配出的总和严格等于轨迹预算 $b_k$,最终在整个同任务组内保持完美的组内零和($\sum_k \sum_m c_{k,m} = 0$)。

图3:滞后且有界的片段级信用分配机制

在信用最终回传时,片段信用 $c_{k,m}$ 被注入到对应阶段的终点步长上,与确定性的过程奖励 $r_t^{\mathrm{proc}}$ 叠加。策略端则保留经典的 Critic 价值网络,使用 GAE(广义优势估计)计算出随时步动态变化的优势函数 $\hat{A}_t^{\mathrm{GAE}}$,再通过 PPO 目标完成裁剪式更新。组结构在此处仅用于构建公平的偏好预算,梯度更新则回归到底层时序控制。

覆盖三层复杂度的真实剪辑基准

长程视频编辑需要真正的工程素材支撑。为了验证系统能力,团队人工收集并构建了包含 23 个真实后期制作项目的评测套件,覆盖 70 个独立任务。这套基准根据视音频交互深度与时间线跨度,严格划分为三档复杂度:

整个数据集在项目层面上完全隔离(Project-disjoint):18 个项目(54 个任务)用于训练,5 个全新项目(16 个任务)保留用于封闭评测,确保任何素材、需求描述和修订链路均无泄漏。

实验结论:精细化信用带来的性能分野

在保持 9B 参数底座模型、工具库调用权限、过程监督与优化预算完全一致的前提下,研究对比了多组消融与基线方案。

在内部受控对比中,完全依赖过程规则奖励的基线(Process-PPO)能够保证工具调用的准确,但在成片审美与重构任务上遭遇天花板;如果直接把成片排序奖励粗暴挂在轨迹末尾(Terminal Rank PPO),模型平均表现反而出现回落;如果简单将偏好奖励均摊给各个片段(Uniform Allocation),模型同样无法辨别核心剪辑节点。只有采用完整 GRPB 的方案取得了最高的平均分(15.7)与视频重构(Repurpose)单项分(23.0),高出纯过程奖励基准近 3 个点。

尤为关键的是消融实验:一旦剥离预更新滞后机制(No-lag)或移除可靠性门控截断(No-safeguard),训练指标甚至跌落至纯规则基线之下。这证实了在强化学习中,不可靠的细粒度偏好信号比没有偏好信号危害更大,严格的保护性传输是模型持续进化的生命线。

在外部分布外基准 AgenticVBench 的 100 项评测任务中,Crayotter-9B 展现了跨环境泛化能力。在多项包含视频重组、时序编排、成片修复的综合考量中,Crayotter-9B 的综合排名位列前三,超越了多个参数量远超自身的商业闭源系统,并在视频重构单项上打平了业内标杆多模态模型。

信用到底有没有分对?168 组受控探针给出答案

为了从底层确认 GRPB 是否真的理解了“哪一段剪辑出了错”,研究设计了一项极具说服力的受控干预实验。

在保留测试集完整项目的前提下,团队人工构建了 168 组单变量劣化对比对(Controlled Pairs)。每一对样本仅对素材筛选、时间线组装、解说词字幕对齐或最终检查这四个阶段中的某一个片段施加隐蔽劣化(降低素材相关性、破坏音画同步或截断转场),其余阶段和指令保持完全相同。随后,将这些样本输入被冻结的 GRPB 分配器,观察其信用分布能否精准“抓包”。

探针测试表明,GRPB 的 Top-1 故障定位准确率从均匀基线的 11.9% 提升到了 20.8%,且在成对偏好排序中达到了 85.7% 的准确率,整个过程没有出现任何超出预设截断上限的数值溢出。相比之下,传统的轨迹级广播完全丧失了定位能力,且天然违背了局部有界约束。实验数据证明,模型确实在复杂的长视频制作过程中,学会了将成品的好坏归因到具体的生产工序。

而在最终开展的三方独立双盲人类质量评估中,评审员在完全隐藏模型身份的情况下对渲染成片进行观感裁决。结果显示,GRPB 面对未经强化学习微调的原始底座获得了 34.2% 的净胜率优势;面对纯过程监督基线与末端标量广播基线,同样分别取得了 8.0% 与 3.2% 的净胜率提升。这直接说明,组内相对优势向片段的合理传导,最终扎实转化为了人类肉眼可感知的成片质量提升。

从视频剪辑走向更广泛的长程复杂创作

Crayotter 与 GRPB 的价值并不局限于视频剪辑这一个垂直领域。长期以来,大模型在软件工程、长篇写作、多媒体设计等复杂智能体任务上面临着共同的阻碍:流程冗长、中间操作缺乏密集监督、最终成品质量主观且无法被单一规则标尺衡量。

这项研究指出了一条行之有效的系统性解法:放弃对全局绝对分数的执念,将同环境同需求下的多路尝试转化为高置信度的局部相对排序;再借助滞后更新与有界保护的信用分配模型,将这股成品的比较压力稳健注入到工作区资产的关键演变节点上。这一“以相对定优劣,以有界保归因”的思路,为未来长程自主生成智能体的端到端进化提供了极为扎实的工程与理论基石。