Skip to main content
QUICK REVIEW

[論文レビュー] Photorealistic Video Generation with Diffusion Models

Agrim Gupta, Lijun Yu|arXiv (Cornell University)|Dec 11, 2023
Generative Adversarial Networks and Image Synthesis被引用数 7
ひとこと要約

本論文は、因果的エンコーダーを用いて画像と動画の潜在変数を統一し、ウィンドウ化されたアテンションにより効率的な時空間モデリングを実現する、Transformerベースの潜在拡散モデルW.A.L.T.を紹介する。512×896解像度および8 fpsで、分類器フリーのガイドランスを用いずにUCF-101で最先端のFVDスコアを達成し、テキストから動画生成において優れた品質と効率性を示している。

ABSTRACT

We present W.A.L.T, a transformer-based approach for photorealistic video generation via diffusion modeling. Our approach has two key design decisions. First, we use a causal encoder to jointly compress images and videos within a unified latent space, enabling training and generation across modalities. Second, for memory and training efficiency, we use a window attention architecture tailored for joint spatial and spatiotemporal generative modeling. Taken together these design decisions enable us to achieve state-of-the-art performance on established video (UCF-101 and Kinetics-600) and image (ImageNet) generation benchmarks without using classifier free guidance. Finally, we also train a cascade of three models for the task of text-to-video generation consisting of a base latent video diffusion model, and two video super-resolution diffusion models to generate videos of $512 imes 896$ resolution at $8$ frames per second.

研究の動機と目的

  • U-Netベースの拡散モデルが動画生成において抱える制限を克服し、スケーラブルで効率的かつ高品質な動画生成フレームワークの開発。
  • 因果的エンコーダーを用いて画像と動画のモデリングを共有の潜在空間に統合し、大規模な画像および動画データセットを共同で学習可能にする。
  • 自己アテンションを局所的な空間的および時空間的ウィンドウに制限するウィンドウ化アテンション機構を導入することで、動画拡散における計算コストを低減する。
  • 分類器フリーのガイドランスに依存せず、画像および動画生成の両方で最先端のパフォーマンスを達成する。
  • 3つの拡散モデルの級列により、512×896解像度および8 fpsで高解像度かつ時間的に一貫性のあるテキストから動画生成を実現する。

提案手法

  • 因果的エンコーダーが画像および動画を統一的かつ次元削減された潜在空間に圧縮し、画像および動画データセットの共同学習を可能にする。
  • 変換器のバックボーンは、メモリおよび計算コストを削減するため、交互にウィンドウ制限付きの空間的および時空間的自己アテンション層を採用する。
  • 空間アテンション層は画像および動画フレームを個別に処理するが、時空間アテンション層は重複のない局所的ウィンドウを用いて動画の時間的依存性をモデル化する。
  • アイデンティティアテンションマスクにより、画像入力が時空間層をそのまま通過するようにし、モodal特化処理を保持する。
  • テキスト条件付けは空間的クロスアテンションを介して適用され、自然言語プロンプトによるテキストから動画生成を実現する。
  • 3段階の級列モデルを訓練する:ベースの潜在動画拡散モデルに続き、2つの動画スーパーレゾリューション拡散モデルを追加し、512×896解像度にスケーリングする。
Figure 2 : W.A.L.T. We encode images and videos into a shared latent space. The transformer backbone processes these latents with blocks having two layers of window-restricted attention: spatial layers capture spatial relations in both images and video, while spatiotemporal layers model temporal dyn
Figure 2 : W.A.L.T. We encode images and videos into a shared latent space. The transformer backbone processes these latents with blocks having two layers of window-restricted attention: spatial layers capture spatial relations in both images and video, while spatiotemporal layers model temporal dyn

実験結果

リサーチクエスチョン

  • RQ1Transformerベースのアーキテクチャは、計算効率を維持したまま動画生成で最先端のパフォーマンスを達成できるか?
  • RQ2画像および動画データセットを共同で学習することで、潜在動画拡散モデルの生成品質が向上するか?
  • RQ3ウィンドウ化アテンション機構は、完全アテンションやU-Netバックボーンに代わって動画拡散に効果的に適用可能か、品質を損なわずに行えるか?
  • RQ4モデルスケーリングおよび画像・動画の共同事前学習は、テキストから動画生成のパフォーマンスにどのように影響するか?
  • RQ5級列拡散フレームワークは、テキストプロンプトから高解像度、写真同等の品質、時間的に一貫性のある動画を生成できるか?

主な発見

  • W.A.L.T.は、画像および動画データに共同で学習させた3Bパラメータのモデルを用い、UCF-101のゼロショットテキストから動画生成ベンチマークで258.1という最先端のFVDスコアを達成した。
  • UCF-101ではインセプションスコア35.1を達成し、PYoCoを除くすべての先行手法を上回ったが、より強力なテキストエンコーダーを用いている。
  • 画像および動画データセットを共同で学習させることで、動画専用ベースラインに比べ20.5%のFVDスコアの向上が見られ、マルチモodal事前学習の利点を示した。
  • モデルを419Mパラメータから3Bパラメータにスケーリングすることで、FVDスコアが116.7ポイント向上し、フレームワークの強力なスケーラビリティを示した。
  • 512×896解像度、8 fpsで、時間的に一貫性があり写真同等の品質の動画を生成でき、定性的なサンプルにより妥当性が検証された。
  • 分類器フリーのガイドランスを用いずに、UCF-101およびKinetics-600のクラス条件付き動画生成、およびImageNetのクラス条件付き画像生成においても最先端の結果を達成した。
Figure 3 : Qualitative evaluation. Example videos generated by W.A.L.T from natural language prompts at $512\times 896$ resolution over $3.6$ seconds duration at $8$ frames per second. The W.A.L.T model is able to generate temporally consistent photorealistic videos that align with the textual promp
Figure 3 : Qualitative evaluation. Example videos generated by W.A.L.T from natural language prompts at $512\times 896$ resolution over $3.6$ seconds duration at $8$ frames per second. The W.A.L.T model is able to generate temporally consistent photorealistic videos that align with the textual promp

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。