Skip to main content
QUICK REVIEW

[论文解读] Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models

Songwei Ge, Seungjun Nah|arXiv (Cornell University)|May 17, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文提出 PYoCo,一种新颖的视频噪声先验,通过从预训练图像扩散模型中学习,保留视频扩散模型中的时间相关性。通过建模帧间噪声相关性而非使用独立同分布(i.i.d.)噪声,PYoCo 实现了对图像扩散模型的高效微调,用于视频生成,在 UCF-101 和 MSR-VTT 上实现了 SOTA 的零样本文本到视频性能,且计算量和模型规模显著降低。

ABSTRACT

Despite tremendous progress in generating high-quality images using diffusion models, synthesizing a sequence of animated frames that are both photorealistic and temporally coherent is still in its infancy. While off-the-shelf billion-scale datasets for image generation are available, collecting similar video data of the same scale is still challenging. Also, training a video diffusion model is computationally much more expensive than its image counterpart. In this work, we explore finetuning a pretrained image diffusion model with video data as a practical solution for the video synthesis task. We find that naively extending the image noise prior to video noise prior in video diffusion leads to sub-optimal performance. Our carefully designed video noise prior leads to substantially better performance. Extensive experimental validation shows that our model, Preserve Your Own Correlation (PYoCo), attains SOTA zero-shot text-to-video results on the UCF-101 and MSR-VTT benchmarks. It also achieves SOTA video generation quality on the small-scale UCF-101 benchmark with a $10 imes$ smaller model using significantly less computation than the prior art.

研究动机与目标

  • 解决使用扩散模型生成逼真、时间一致的视频的挑战,该挑战因高计算成本和缺乏大规模视频数据集而难以实现。
  • 通过在帧之间使用独立同分布(i.i.d.)噪声而非时间相关性,克服将图像扩散模型简单扩展到视频时性能不佳的问题。
  • 利用预训练图像扩散模型,迁移视觉质量并降低视频生成的训练成本。
  • 设计一种显式建模视频帧时间相关性的噪声先验,以提升视频生成的保真度和一致性。
  • 在零样本文本到视频基准测试中实现 SOTA 性能,且模型远小于先前方法,计算量也显著更低。

提出的方法

  • 提出一种渐进式噪声先验,在视频扩散过程中注入时间相关性,其噪声图分布通过从预训练图像扩散模型的潜在噪声图中学习获得。
  • 使用 t-SNE 对来自同一视频的帧进行可视化与分析,揭示同一视频中的帧在潜在空间中表现出强相关性(聚集为簇),而 i.i.d. 噪声则无此特征。
  • 用结构化的噪声先验替代标准的 i.i.d. 高斯噪声先验,通过学习视频数据的空间与时间结构来建模时间依赖性。
  • 使用所提出的视频噪声先验微调预训练的文本到图像扩散模型,通过联合图像-视频去噪损失实现有效迁移至视频生成。
  • 整合成熟的视频生成技术:时间注意力、级联生成和专家去噪器集成,以提升视频质量和多样性。
  • 采用两阶段训练流程:首先在 UCF-101 的图像帧上进行预训练,然后使用新噪声先验在视频数据上进行微调,以保持时间一致性。

实验结果

研究问题

  • RQ1是否可以有效微调预训练图像扩散模型用于视频生成,而无需从头开始训练?
  • RQ2是否由于忽略了时间相关性,简单地将图像扩散中的 i.i.d. 噪声先验扩展到视频扩散会降低性能?
  • RQ3是否可以通过学习一种保留帧间相关性的噪声先验,显著提升视频生成质量与时间一致性?
  • RQ4更小的、微调后的模型在质量与效率方面,能在多大程度上超越更大规模、从头训练的视频扩散模型?
  • RQ5所提出的噪声先验是否能在包括 UCF-101 和 MSR-VTT 在内的多样化基准上实现零样本文本到视频生成的泛化?

主要发现

  • PYoCo 在 UCF-101 和 MSR-VTT 基准上均实现了 SOTA 的零样本文本到视频生成性能,优于先前方法,且无需在视频数据上进行微调。
  • 在 UCF-101 基准上,PYoCo 以 10 倍小的模型和显著更低的计算量,实现了 SOTA 结果,优于先前最先进方法。
  • 该模型展现出强大的时间一致性与逼真感,能够生成与文本提示高度匹配的高质量视频片段。
  • 噪声图的可视化分析证实,同一视频中的帧在潜在空间中表现出强相关性,验证了结构化噪声先验的必要性。
  • 渐进式噪声先验设计有效捕捉了时间依赖性,相比 i.i.i.d. 噪声基线,显著提升了视频生成质量。
  • 该方法实现了图像扩散模型在视频生成上的高效微调,降低了训练成本,同时保持或提升了性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。