Skip to main content
QUICK REVIEW

[論文レビュー] Video Probabilistic Diffusion Models in Projected Latent Space

Sihyun Yu, Kihyuk Sohn|arXiv (Cornell University)|Feb 15, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本論文は、3Dビデオデータを3D→2D投影により2D画像に類似した潜在ベクトルに要約する潜在拡散フレームワーク、Projected Latent Video Diffusion Model (PVDM) を提案する。このアプローチにより、高解像度で長時間のビデオの効率的な学習とサンプリングが可能となり、UCF-101 128フレームビデオ生成タスクで最先端のFVD 639.7を達成。従来手法に比べてメモリと計算コストを最大17.6倍まで削減した。

ABSTRACT

Despite the remarkable progress in deep generative models, synthesizing high-resolution and temporally coherent videos still remains a challenge due to their high-dimensionality and complex temporal dynamics along with large spatial variations. Recent works on diffusion models have shown their potential to solve this challenge, yet they suffer from severe computation- and memory-inefficiency that limit the scalability. To handle this issue, we propose a novel generative model for videos, coined projected latent video diffusion models (PVDM), a probabilistic diffusion model which learns a video distribution in a low-dimensional latent space and thus can be efficiently trained with high-resolution videos under limited resources. Specifically, PVDM is composed of two components: (a) an autoencoder that projects a given video as 2D-shaped latent vectors that factorize the complex cubic structure of video pixels and (b) a diffusion model architecture specialized for our new factorized latent space and the training/sampling procedure to synthesize videos of arbitrary length with a single model. Experiments on popular video generation datasets demonstrate the superiority of PVDM compared with previous video synthesis methods; e.g., PVDM obtains the FVD score of 639.7 on the UCF-101 long video (128 frames) generation benchmark, which improves 1773.4 of the prior state-of-the-art.

研究の動機と目的

  • ピxls空間でのビデオ拡散モデルの学習・推論にかかる高コストを低減すること。
  • 限られた計算リソース下でも、高解像度で長時間のビデオを効率的かつスケーラブルに生成できること。
  • 時間的・空間的構造を効果的に因子分解する潜在空間の設計。
  • 3D畳み込みを避ける2D画像に類似した潜在表現に特化した拡散モデルアーキテクチャの開発。
  • 長時間ビデオ生成ベンチマークで優れた性能を発揮しながら、低メモリおよび低推論コストを維持すること。

提案手法

  • 本手法は、空間方向、時間方向、空間時間方向に沿った3D→2D投影を実行することで、3Dビデオテンソルを3つの2D潜在ベクトルに変換するビデオオートエンコーダを用いる。
  • 1つの潜在ベクトルが共通コンテンツ(例:背景)を符号化し、残りの2つが動きのダイナミクスを符号化することで、要約的で画像に類似した潜在表現を実現する。
  • 2次元畳み込み型拡散モデルをこの2次元潜在空間で学習し、3次元畳み込みを避けて効率的な2次元アーキテクチャを活用する。
  • 一括学習とフレーム条件付きモデリングを統合することで、1つのモデルで任意長のビデオ生成を可能にする。
  • 学習および推論パイプラインを最適化し、低メモリ使用量を実現することで、限られたハードウェア上でも大規模バッチサイズと長時間ビデオ生成を可能にする。
  • UCF-101およびSkyTimelapseデータセットで、FVD、IS、PSNR、R-FVDといった標準指標を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ12次元画像に類似した潜在空間は、高次元のビデオデータを効果的にパrameter化しつつ、時間的・空間的構造を保持できるか?
  • RQ2この潜在空間で学習された2次元畳み込み型拡散モデルは、3次元畳み込み型モデルに比べて、ビデオ生成品質と効率性で優れているか?
  • RQ3提案された3D→2D投影戦略は、長時間ビデオ生成におけるより効率的な学習と推論を可能にするか?
  • RQ4モデルは、任意長の高解像度(256×256)ビデオを、強力な時間的整合性と知覚的品質で生成できるか?
  • RQ5従来のビデオ拡散モデルに比べ、本手法はどれほどメモリと計算コストを削減できるか?

主な発見

  • PVDMは128フレームのUCF-101ベンチマークで、最先端のFréchet Video Distance (FVD) スコア639.7を達成。従来のSOTA(1773.4)を大幅に上回った。
  • 16フレーム、256×256のUCF-101ビデオ生成において、Inception Score (IS) 74.40を達成し、新たなSOTAを樹立した。
  • 従来のビデオ拡散モデル(VDM)と比較して、推論時間を17.6倍短縮。16フレーム256×256ビデオの生成に7.88秒で完了したのに対し、VDMでは2分以上を要した。
  • 3.5倍の高いメモリ効率を達成し、1枚の24GB NVIDIA 3090Ti GPUでバッチサイズ7での学習が可能となった。一方VDMはバッチサイズ1でOOMを発生させた。
  • オートエンコーダは高い再構成品質を達成し、UCF-101テストセットでR-FVD 32.26、PSNR 26.99を記録し、優れた知覚的忠実度を示した。
  • TATS や VideoGPT といった自己回帰型モデルに比べ、推論速度とメモリ効率で優れており、16フレーム生成時のメモリ使用量は4.33GBにとどまった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。