[論文レビュー] Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models
本稿では、事前学習済み画像拡散モデルから学習することで、動画拡散モデルにおける時間的相関を保持する新しい動画ノイズ事前分布PYoCoを提案する。独立同分布(i.i.d.)ノイズの代わりにフレーム間のノイズ相関をモデル化することにより、画像拡散モデルの効率的な微調整が可能となり、UCF-101およびMSR-VTTでSOTAのゼロショットテキストから動画生成性能を達成するが、計算量とモデルサイズを大幅に削減できる。
Despite tremendous progress in generating high-quality images using diffusion models, synthesizing a sequence of animated frames that are both photorealistic and temporally coherent is still in its infancy. While off-the-shelf billion-scale datasets for image generation are available, collecting similar video data of the same scale is still challenging. Also, training a video diffusion model is computationally much more expensive than its image counterpart. In this work, we explore finetuning a pretrained image diffusion model with video data as a practical solution for the video synthesis task. We find that naively extending the image noise prior to video noise prior in video diffusion leads to sub-optimal performance. Our carefully designed video noise prior leads to substantially better performance. Extensive experimental validation shows that our model, Preserve Your Own Correlation (PYoCo), attains SOTA zero-shot text-to-video results on the UCF-101 and MSR-VTT benchmarks. It also achieves SOTA video generation quality on the small-scale UCF-101 benchmark with a $10 imes$ smaller model using significantly less computation than the prior art.
研究の動機と目的
- 高コストな計算と大規模な動画データセットの不足により、拡散モデルを用いた写真的で時間的に整合性のある動画生成は依然として困難であるという課題に対処する。
- フレーム間で独立同分布(i.i.d.)ノイズを用いることで、画像拡散モデルを動画に単純に拡張した場合の性能劣化を是正する。
- 事前学習済み画像拡散モデルを活用し、視覚的品質の転送とトレーニングコストの低減を図ることで、動画生成のためのコストを削減する。
- 時間的相関を明示的にモデル化するノイズ事前分布を設計し、動画生成の忠実度と一貫性を向上させる。
- 従来手法よりもはるかに小型なモデルと少ない計算量で、ゼロショットテキストから動画生成ベンチマークでSOTA性能を達成する。
提案手法
- 事前学習済み画像拡散モデルの潜在ノイズマップから学習することで、動画拡散の過程で時間的相関を組み込む段階的ノイズ事前分布を提案する。
- 同じ動画のフレームに対してt-SNEを用いてノイズマップの相関を可視化・分析し、同じ動画からのフレームは潜在空間で強くクラスタ化されている(i.i.d.ノイズとは対照的)ことが明らかになった。
- 空間的および時間的構造を学習することで、フレーム間の時間的依存性をモデル化する構造的ノイズ事前分布に、標準的なi.i.d.正規ノイズ事前分布を置き換える。
- 画像・動画の両方のノイズ除去損失を統合したジョイント損失関数を用いて、事前学習済みテキストから画像への拡散モデルを微調整し、動画生成への効果的な転移を可能にする。
- 時間的アテンション、段階的生成、エキスパートノイズ除去器のアンサンブルといった、確立された動画生成技術を統合し、動画の品質と多様性を向上させる。
- 2段階のトレーニングパイプラインを採用:まずUCF-101の画像フレームで事前学習を行い、次に新しいノイズ事前分布を用いて動画データで微調整することで、時間的整合性を維持する。
実験結果
リサーチクエスチョン
- RQ1事前学習済み画像拡散モデルを、動画データの微調整なしに効果的に動画生成に応用できるか?
- RQ2画像拡散モデルから動画拡散モデルにi.i.d.ノイズ事前分布を単純に拡張すると、無視された時間的相関のため性能が劣化するか?
- RQ3フレーム間の相関を保持する学習済みノイズ事前分布は、動画生成の品質と時間的整合性を顕著に向上させられるか?
- RQ4より小型で微調整されたモデルは、より大規模で訓練から再学習した動画拡散モデルに比べ、品質と効率の面でどの程度優れているか?
- RQ5提案されたノイズ事前分布は、UCF-101やMSR-VTTのような多様なベンチマークでゼロショットテキストから動画生成に一般化可能か?
主な発見
- PYoCoは、UCF-101およびMSR-VTTベンチマークで、動画データの微調整なしにSOTAのゼロショットテキストから動画生成性能を達成した。
- UCF-101ベンチマークでは、従来SOTA手法よりも10倍も小型なモデルで、著しく少ない計算量でSOTAの結果を達成した。
- モデルは優れた時間的整合性と写真的忠実度を示し、テキストプロンプトに忠実に一致する高品質な動画クリップを生成した。
- ノイズマップの可視化分析により、同じ動画からのフレームが潜在空間で強く相関していることが確認され、構造的ノイズ事前分布の必要性が裏付けられた。
- 段階的ノイズ事前分布の設計により、i.i.d.ノイズベースラインに比べて時間的依存性を効果的に捉え、動画生成品質が向上した。
- 本手法により、画像拡散モデルの動画生成への効率的な微調整が可能となり、トレーニングコストを削減しながらも、性能を維持または向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。