Skip to main content
QUICK REVIEW

[論文レビュー] StyleGAN-V: A Continuous Video Generator with the Price, Image Quality and Perks of StyleGAN2

Ivan Skorokhodov, Sergey Tulyakov|arXiv (Cornell University)|Dec 29, 2021
Advanced Vision and Imaging被引用数 8
ひとこと要約

StyleGAN-V は、動きに配慮した位置埋め込みと簡素化された効率的な識別器を用いて、動画を時間連続信号として扱う連続時間動画生成フレームワークを提案する。StyleGAN2 を基盤として構築されており、わずか ~5% の追加トレーニングコストで StyleGAN2 の画像品質に近い性能を達成し、任意長・高フレームレートの動画生成が可能であり、1024²解像度を含む 5 つのベンチマークで、平均して前人未到の 30% の性能向上を達成している。

ABSTRACT

Videos show continuous events, yet most $-$ if not all $-$ video synthesis frameworks treat them discretely in time. In this work, we think of videos of what they should be $-$ time-continuous signals, and extend the paradigm of neural representations to build a continuous-time video generator. For this, we first design continuous motion representations through the lens of positional embeddings. Then, we explore the question of training on very sparse videos and demonstrate that a good generator can be learned by using as few as 2 frames per clip. After that, we rethink the traditional image + video discriminators pair and design a holistic discriminator that aggregates temporal information by simply concatenating frames' features. This decreases the training cost and provides richer learning signal to the generator, making it possible to train directly on 1024$^2$ videos for the first time. We build our model on top of StyleGAN2 and it is just ${\approx}5\%$ more expensive to train at the same resolution while achieving almost the same image quality. Moreover, our latent space features similar properties, enabling spatial manipulations that our method can propagate in time. We can generate arbitrarily long videos at arbitrary high frame rate, while prior work struggles to generate even 64 frames at a fixed rate. Our model is tested on four modern 256$^2$ and one 1024$^2$-resolution video synthesis benchmarks. In terms of sheer metrics, it performs on average ${\approx}30\%$ better than the closest runner-up. Project website: https://universome.github.io.

研究の動機と目的

  • 離散的動画生成の限界を克服するため、動画を時間連続信号としてモデル化すること。
  • 2 フレーム/ビデオクリップという最小限のトレーニングデータで、高品質で長時間の動画生成を可能にすること。
  • 3D畳み込みを廃止し、単純な特徴連結を採用することで、識別器を再設計し、トレーニングコストを削減し効率を向上させること。
  • 動画生成において、StyleGAN2 の意味的制御可能性と潜在空間の性質を保持すること。
  • 非自己回帰的かつ高フレームレートの動画合成を可能にし、高解像度データセットにおいて安定的かつスケーラブルなトレーニングを実現すること。

提案手法

  • 動きコードに依存する時間変動型の波パラメータを位置埋め込みに導入し、周期的でない、動画固有の時間的表現を可能にする。
  • 非自己回帰的フレーム生成のため、不安定な RNN(例:LSTM)に代わって、パディングなしの 1D 畳み込みネットワークを用いて動きコードを生成する。
  • フレーム特徴を連結し、時間差を条件として与える包括的識別器を採用し、別個の画像および動画識別器の必要性を排除する。
  • データおよび計算負荷を軽減するため、1 ビデオクリップあたり 2〜4 フレームのみをサンプリングし、均一なランダムサンプリングを用いる。
  • StyleGAN2 の上に生成器を構築し、その潜在空間構造を維持することで、時間的に一貫した意味的編集を可能にする。
  • 初めて 1024² 解像度の動画データセットを直接トレーニング対象とし、StyleGAN2 と比較してわずか ~5% の追加コストで安定したトレーニングを達成した。
StyleGAN-V: A Continuous Video Generator with the Price, Image Quality and Perks of StyleGAN2

実験結果

リサーチクエスチョン

  • RQ1動画生成を離散的フレーム列ではなく、連続時間信号として効果的にモデル化できるか?
  • RQ21 ビデオクリップあたり 2〜4 フレームのみで、高品質な動画生成器をトレーニングできるか?
  • RQ33D畳み込みを用いる従来の識別器よりも、簡素化された 2D ベースの識別器が、トレーニングコストを削減しつつも性能を上回れるか?
  • RQ4時間的埋め込みにおいて、動きと位置情報の分離をどのように行うことで、繰り返しや「頭が飛んでいく」などのアーティファクトを回避できるか?
  • RQ5StyleGAN2 の潜在空間を、制御可能で長時間の動画生成にどの程度活用できるか?

主な発見

  • StyleGAN-V は、256² および 1024² 解像度を含む 5 つの現代的動画生成ベンチマークで、最も近い競合手法と比較して平均して約 30% の性能向上を達成した。
  • モデルは、StyleGAN2 と比較してわずか ~5% の追加コストで、1024² 解像度の動画データセットを直接トレーニング対象としており、前例のない解像度で高品質な生成を実現した。
  • 任意長の動画を任意のフレームレートで生成可能であり、MoCoGAN-HD や DIGAN などの先行モデルが抱える不安定さや長さ制限を克服した。
  • フレーム特徴を連結し、時間差を条件として与える包括的識別器は、トレーニングコストを削減するとともに、別個の画像および動画識別器よりもより豊かな勾配信号を提供した。
  • モデルは StyleGAN2 の潜在空間特性を保持しており、CLIP を用いた意味的編集が時間的に一貫して伝搬される。
  • 1 ビデオクリップあたり最小 2 フレームのデータでも、意味のある生成器を学習可能であることが理論的および実証的に検証された。
StyleGAN-V: A Continuous Video Generator with the Price, Image Quality and Perks of StyleGAN2

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。