近期大型语言模型中推理时扩展的成功启发了视频扩散领域的类似探索。先前工作受“黄金噪声”能提升视频质量的启发,尝试优化或搜索更好的初始噪声,但存在误差累积、奖励信号延迟稀疏且计算成本高昂等局限,阻碍了更强搜索算法的应用。为了解决这一问题,本文通过潜在奖励引导实现了高效的推理时扩展,该引导沿去噪轨迹提供中间、信息丰富且高效的反馈。我们提出了一种潜在奖励模型,可在任意时间步对部分去噪的潜在表示进行评分,评估视觉质量、运动质量和文本对齐。基于此模型,我们提出了LatSearch,一种新颖的推理时搜索机制,执行奖励引导的重采样与剪枝(RGRP)。在重采样阶段,根据奖励归一化概率对候选样本进行采样,以减少对奖励模型的过度依赖;在剪枝阶段(应用于最终预定步骤),仅保留累积奖励最高的候选样本,从而提升质量和效率。我们在VBench-2.0基准上评估LatSearch,结果表明与基线Wan2.1模型相比,它在多个评估维度上一致提升了视频生成质量。

核心观点

技术要点

潜在奖励模型(对任意时间步的潜在表示进行视觉、运动、文本对齐评分);奖励引导的重采样(按奖励归一化概率采样)与剪枝(保留最高累积奖励候选)

应用场景

提升视频扩散模型的可控性、样本效率和生成质量,适用于需要高质量视频生成的场景(如内容创作、视频编辑)