[论文解读] Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models
本文提出 PYoCo,一种新颖的视频噪声先验,通过从预训练图像扩散模型中学习,保留视频扩散模型中的时间相关性。通过建模帧间噪声相关性而非使用独立同分布(i.i.d.)噪声,PYoCo 实现了对图像扩散模型的高效微调,用于视频生成,在 UCF-101 和 MSR-VTT 上实现了 SOTA 的零样本文本到视频性能,且计算量和模型规模显著降低。
Despite tremendous progress in generating high-quality images using diffusion models, synthesizing a sequence of animated frames that are both photorealistic and temporally coherent is still in its infancy. While off-the-shelf billion-scale datasets for image generation are available, collecting similar video data of the same scale is still challenging. Also, training a video diffusion model is computationally much more expensive than its image counterpart. In this work, we explore finetuning a pretrained image diffusion model with video data as a practical solution for the video synthesis task. We find that naively extending the image noise prior to video noise prior in video diffusion leads to sub-optimal performance. Our carefully designed video noise prior leads to substantially better performance. Extensive experimental validation shows that our model, Preserve Your Own Correlation (PYoCo), attains SOTA zero-shot text-to-video results on the UCF-101 and MSR-VTT benchmarks. It also achieves SOTA video generation quality on the small-scale UCF-101 benchmark with a $10 imes$ smaller model using significantly less computation than the prior art.
研究动机与目标
- 解决使用扩散模型生成逼真、时间一致的视频的挑战,该挑战因高计算成本和缺乏大规模视频数据集而难以实现。
- 通过在帧之间使用独立同分布(i.i.d.)噪声而非时间相关性,克服将图像扩散模型简单扩展到视频时性能不佳的问题。
- 利用预训练图像扩散模型,迁移视觉质量并降低视频生成的训练成本。
- 设计一种显式建模视频帧时间相关性的噪声先验,以提升视频生成的保真度和一致性。
- 在零样本文本到视频基准测试中实现 SOTA 性能,且模型远小于先前方法,计算量也显著更低。
提出的方法
- 提出一种渐进式噪声先验,在视频扩散过程中注入时间相关性,其噪声图分布通过从预训练图像扩散模型的潜在噪声图中学习获得。
- 使用 t-SNE 对来自同一视频的帧进行可视化与分析,揭示同一视频中的帧在潜在空间中表现出强相关性(聚集为簇),而 i.i.d. 噪声则无此特征。
- 用结构化的噪声先验替代标准的 i.i.d. 高斯噪声先验,通过学习视频数据的空间与时间结构来建模时间依赖性。
- 使用所提出的视频噪声先验微调预训练的文本到图像扩散模型,通过联合图像-视频去噪损失实现有效迁移至视频生成。
- 整合成熟的视频生成技术:时间注意力、级联生成和专家去噪器集成,以提升视频质量和多样性。
- 采用两阶段训练流程:首先在 UCF-101 的图像帧上进行预训练,然后使用新噪声先验在视频数据上进行微调,以保持时间一致性。
实验结果
研究问题
- RQ1是否可以有效微调预训练图像扩散模型用于视频生成,而无需从头开始训练?
- RQ2是否由于忽略了时间相关性,简单地将图像扩散中的 i.i.d. 噪声先验扩展到视频扩散会降低性能?
- RQ3是否可以通过学习一种保留帧间相关性的噪声先验,显著提升视频生成质量与时间一致性?
- RQ4更小的、微调后的模型在质量与效率方面,能在多大程度上超越更大规模、从头训练的视频扩散模型?
- RQ5所提出的噪声先验是否能在包括 UCF-101 和 MSR-VTT 在内的多样化基准上实现零样本文本到视频生成的泛化?
主要发现
- PYoCo 在 UCF-101 和 MSR-VTT 基准上均实现了 SOTA 的零样本文本到视频生成性能,优于先前方法,且无需在视频数据上进行微调。
- 在 UCF-101 基准上,PYoCo 以 10 倍小的模型和显著更低的计算量,实现了 SOTA 结果,优于先前最先进方法。
- 该模型展现出强大的时间一致性与逼真感,能够生成与文本提示高度匹配的高质量视频片段。
- 噪声图的可视化分析证实,同一视频中的帧在潜在空间中表现出强相关性,验证了结构化噪声先验的必要性。
- 渐进式噪声先验设计有效捕捉了时间依赖性,相比 i.i.i.d. 噪声基线,显著提升了视频生成质量。
- 该方法实现了图像扩散模型在视频生成上的高效微调,降低了训练成本,同时保持或提升了性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。