Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Autoregressive Video Models

Dirk Weissenborn, Oscar Täckström|arXiv (Cornell University)|Jun 6, 2019
Human Pose and Action Recognition参考文献 41被引用数 14
ひとこと要約

本稿では、3次元ブロック局所自己注意と空間時間的サブスケーリングを用いて動画を3次元ボリュームとしてモデル化するスケーラブルで自己回帰的な動画生成モデルを提案する。ベンチマークで最先端の結果を達成し、複雑なKinetics調理動画を含む高精細で現実的な動画継続生成が可能であるが、多様性と長距離依存性の課題は残る。

ABSTRACT

Due to the statistical complexity of video, the high degree of inherent stochasticity, and the sheer amount of data, generating natural video remains a challenging task. State-of-the-art video generation models often attempt to address these issues by combining sometimes complex, usually video-specific neural network architectures, latent variable models, adversarial training and a range of other methods. Despite their often high complexity, these approaches still fall short of generating high quality video continuations outside of narrow domains and often struggle with fidelity. In contrast, we show that conceptually simple autoregressive video generation models based on a three-dimensional self-attention mechanism achieve competitive results across multiple metrics on popular benchmark datasets, for which they produce continuations of high fidelity and realism. We also present results from training our models on Kinetics, a large scale action recognition dataset comprised of YouTube videos exhibiting phenomena such as camera movement, complex object interactions and diverse human movement. While modeling these phenomena consistently remains elusive, we hope that our results, which include occasional realistic continuations encourage further research on comparatively complex, large scale datasets such as Kinetics.

研究の動機と目的

  • 多様で複雑な動画分布にわたる高精細で現実的な動画継続生成の課題に対処すること。
  • 効率的な3次元自己注意を活用することで、従来の自己回帰的モデルの生成遅延や不安定性の限界を克服すること。
  • 複雑なアーキテクチャや敵対的訓練を用いずに、概念的に単純な自己回帰的モデルが動画生成ベンチマークで競争力のある性能を達成できることを示すこと。
  • カメラの動きや物体同士の相互作用を含む複雑な現象を含む、Kinetics-600のような大規模で多様なデータセットで自己回帰的動画モデルを学習する可能性を検討すること。
  • 効率的でTPU最適化されたアーキテクチャを用いて、将来的な高複雑度動画生成研究のためのスケーラブルなベースラインを確立すること。

提案手法

  • 空間時間的依存関係を3次元ボリュームとして効率的にモデル化できるように、ブロック局所自己注意の3次元一般化を導入し、TPU上で効率的な学習を可能にする。
  • Menick & Kalchbrenner (2019) のインスピレーションを受けて、空間的および時間的パッチをサブスケーリングすることで、メモリと計算コストを削減する空間時間的サブスケーリングを適用する。
  • 空間次元と時間次元に差を設けない、一様なTransformerベースのアーキテクチャを採用し、マルチヘッド3次元自己注意に依存する。
  • 128個のTPU v3コアを用いて、ダウンサンプリングされたKinetics-600動画およびBAIR Robot PushingやMoving MNISTなどのベンチマークデータセットを100万ステップ学習する。
  • 生成サンプルの多様性と品質のバランスを図るため、温度0.9の温度ベースサンプリングを実装する。
  • 標準的な指標であるbits/dim(周辺度)およびFréchet Video Distance(FVD)を用いて評価し、複雑な動画現象についての定性的分析も行う。

実験結果

リサーチクエスチョン

  • RQ13次元自己注意に基づく単純な自己回帰的動画モデルは、複雑なアーキテクチャや敵対的訓練を用いずに、動画生成ベンチマークで競争力のある性能を達成できるか?
  • RQ2空間時間的サブスケーリングとブロック局所自己注意は、長距離の空間時間的モデリングを保持しつつ、メモリと計算コストをどの程度削減できるか?
  • RQ3このようなモデルは、カメラの動きや物体相互作用のような複雑な現象を含む、大規模で多様なデータセット(例:Kinetics-600)において、高精細で現実的な動画継続生成が可能か?
  • RQ4特に困難なデータセットにおいて、周辺度とFVDの観点から、従来の自己回帰的動画モデルと比較して、本モデルの性能はどの程度か?
  • RQ5Kineticsのような高確率的で多様な動画分布にスケーリングした自己回帰的動画モデルで、どのような失敗モードや限界が顕在化するか?

主な発見

  • 大規模な空間時間的サブスケーリングモデルは、BAIR Robot Pushingデータセットで1.19 bits/dimの周辺度と170のFVDスコアを達成し、従来の自己回帰的モデルを上回った。
  • 1フレームモデルは同データセットで1.14 bits/dimの周辺度を達成し、強力なモデリング能力を示したが、サンプルで不安定性や色の過剰発光(color explosions)が生じた。
  • Kinetics-600の調理サブセットでは、現実的なカメラの動き、物体同士の相互作用、炎や蒸気といった動的現象を含む妥当な継続生成が可能であった。
  • 定性的な分析から、モデルはズーム、視点のシフト、シーンチェンジ、微細な人間の動きといった複雑な動画現象を処理できることが示されたが、指や顔の動きは依然として課題であった。
  • ベンチマークで強力な性能を示したが、Kineticsでは時々歪みや色あせた生成が生じており、動画の複雑性を完全に捉えるには、より大きなモデルやデータセットの必要性が浮き彫りになった。
  • 結果として、スケーラブルで効率的な自己回帰的動画モデルが、多様で現実世界の動画データにおいて高精細な動画継続生成を実現できることを示し、将来的な研究のための新たなベースラインを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。