Skip to main content
QUICK REVIEW

[論文レビュー] Temporally Consistent Transformers for Video Generation

Wilson Yan, Danijar Hafner|arXiv (Cornell University)|Oct 5, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

この論文では、ビデオフレームを離散的潜在変数に圧縮し、圧縮された系列に軽量な時系列トランスフォーマーを適用して長時間にわたる時間的整合性を実現し、空間的マスク付きGPT(MaskGit)を用いて高精細なビデオを再構築することで、長時間にわたる時間的整合性を達成する、TECO(時系列に整合的なトランスフォーマー)を紹介する。TECOは、3D環境から抽出された挑戦的な長距離ビデオベンチマークにおいて、時間的整合性とサンプリング速度の両面で先行モデルを上回っている。

ABSTRACT

To generate accurate videos, algorithms have to understand the spatial and temporal dependencies in the world. Current algorithms enable accurate predictions over short horizons but tend to suffer from temporal inconsistencies. When generated content goes out of view and is later revisited, the model invents different content instead. Despite this severe limitation, no established benchmarks on complex data exist for rigorously evaluating video generation with long temporal dependencies. In this paper, we curate 3 challenging video datasets with long-range dependencies by rendering walks through 3D scenes of procedural mazes, Minecraft worlds, and indoor scans. We perform a comprehensive evaluation of current models and observe their limitations in temporal consistency. Moreover, we introduce the Temporally Consistent Transformer (TECO), a generative model that substantially improves long-term consistency while also reducing sampling time. By compressing its input sequence into fewer embeddings, applying a temporal transformer, and expanding back using a spatial MaskGit, TECO outperforms existing models across many metrics. Videos are available on the website: https://wilson1yan.github.io/teco

研究の動機と目的

  • ビデオ生成モデルにおける長期的時間的整合性を評価するためのきめ細やかなベンチマークの不足を解消すること。
  • 既存のビデオ生成モデルが、以前に観察したシーン領域を再訪問する際に整合性を保てないという失敗モードを特定および定量すること。
  • 長時間のビデオシーケンスにスケーリング可能でありながら、時間的整合性を維持する新しい効率的なアーキテクチャを提案すること。
  • 階層的圧縮と再構築により空間的および時間的モデリングを分離することで、高速なサンプリングと高精細な生成を実現すること。

提案手法

  • 3Dプロシージャルシーンをカメラウォークでレンダリングすることで、長距離の時間的依存関係を持つ、DMLab、Minecraft、Habitatの3つの新しいビデオデータセットを構築する。
  • 入力ビデオフレームを離散的潜在コードに圧縮するためのVQ-GANベースのエンコーダーを用い、系列長と計算コストを低減する。
  • 二次的Attentionの複雑さを回避するため、圧縮された潜在系列に軽量な時系列トランスフォーマーを適用し、長距離依存関係を効率的にモデル化する。
  • 各フレームごとに独立して適用される空間的MaskGitを用いて、高精細なビデオフレームを再構築し、空間的詳細の自己回帰的精錬を可能にする。
  • 2段階の生成プロセスを設計:まず時系列トランスフォーマーで圧縮潜在変数を予測し、次にMaskGitでピクセルレベルの画像を再構築する。
  • すべてのモデルとデータセットに対して、固定された総訓練ステップ数を維持しつつ、コサイン学習率スケジュールとAdam最適化手法を用いて訓練を最適化する。

実験結果

リサーチクエスチョン

  • RQ1長時間のビデオシーケンスにおいて、以前に観察した場所を再訪問する際、最先端のビデオ生成モデルは時間的整合性をどの程度維持できるか?
  • RQ2圧縮された潜在表現に適用されたトランスフォーマーに基づくモデルは、ビデオ生成において長距離依存関係を効果的にモデル化できるか?
  • RQ3エンドツーエンドの自己回帰的モデルと比較して、階層的圧縮と再構築は、サンプリング速度と時間的整合性の両面でどの程度向上をもたらすか?
  • RQ4ダウンサンプリング係数やモデルの深さなどの異なるアーキテクチャ的選択肢が、長時間のビデオ生成タスクにおける性能と効率に与える影響は何か?
  • RQ5統一されたフレームワークは、数百フレームにわたる期間にわたり、高精細な生成と高速な推論を両立させながら、整合性を維持できるか?

主な発見

  • TECOは、DMLabおよびMinecraftで264フレームにわたる長時間のビデオ予測において、最先端の性能を達成し、LPIPSが0.15~0.25の低水準を維持している。
  • TECOは、先行モデルと比較して、サンプリング時間を桁違いに短縮し、高精細な視覚的品質を維持したまま高速な推論を実現している。
  • 以前に観察した領域を再訪問しても、シーンの内容が一貫しているのに対し、先行モデルは一貫性のない、あるいは新しいコンテンツを生成してしまう。
  • DMLabおよびMinecraftのデータセットにおいて、TECOはFitVidやCW-VAEといった強力なベースラインをFVDおよびLPIPSの両指標で上回っており、FVDの改善は最大15%に達する。
  • フレーム単位での精錬に空間的MaskGitを用いることで、特に高解像度設定において、標準的な自己回帰ヘッドと比較して視覚的品質が著しく向上している。
  • 時系列トランスフォーマーのモデル深さと幅を拡大することで、長時間のシーケンスにおける性能が向上し、12層モデルが品質と効率の最良のトレードオフを達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。