Skip to main content
QUICK REVIEW

[論文レビュー] Generative Video Transformer: Can Objects be the Words?

Yifu Wu, Jaesik Yoon|arXiv (Cornell University)|Jul 20, 2021
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本稿では、オブジェクトを視覚的トークンとして扱うことで、効率的で長期的な動画生成と推論を可能にする完全に教師なしの生成的動画モデル、Object-Centric Video Transformer (OCVT) を提案する。二部マッチングと自己回帰的トランスフォーマーを用いることで、CATERのスニッチ局在化タスクで最先端の性能を達成し、複雑な時空間的ダイナミクスを有する高品質な将来のフレームを生成する。

ABSTRACT

Transformers have been successful for many natural language processing tasks. However, applying transformers to the video domain for tasks such as long-term video generation and scene understanding has remained elusive due to the high computational complexity and the lack of natural tokenization. In this paper, we propose the Object-Centric Video Transformer (OCVT) which utilizes an object-centric approach for decomposing scenes into tokens suitable for use in a generative video transformer. By factoring the video into objects, our fully unsupervised model is able to learn complex spatio-temporal dynamics of multiple interacting objects in a scene and generate future frames of the video. Our model is also significantly more memory-efficient than pixel-based models and thus able to train on videos of length up to 70 frames with a single 48GB GPU. We compare our model with previous RNN-based approaches as well as other possible video transformer baselines. We demonstrate OCVT performs well when compared to baselines in generating future frames. OCVT also develops useful representations for video reasoning, achieving start-of-the-art performance on the CATER task.

研究の動機と目的

  • 動画トランスフォーマーにおける高い計算コストと自然なトークン化の欠如を解決するため、オブジェクト中心のアプローチを導入すること。
  • 時間経過に伴うオブジェクト間の相互作用をモデル化することで、効果的な長期的動画生成と推論を可能にすること。
  • オブジェクトレベルのアノテーションなしで、分離可能で構造的な動画シーンの表現を学習すること。
  • オブジェクトが動画トランスフォーマーのアーキテクチャにおいて意味のある「単語」として機能できることを示すこと。
  • CATERのような下流の動画理解タスクにおける動画生成と性能を両方で高めること。

提案手法

  • オブジェクトレベルの特徴(位置、サイズ、外観など)を抽出するため、オブジェクト中心の潜在表現モデル(SPACE)を用いる。
  • 連続するフレーム間のオブジェクト集合に対して二部マッチングを適用し、時間軸に沿ったオブジェクトの整合性を保ち、時間的モデリングを可能にする。
  • 各オブジェクトを離散的トークンとして扱い、オブジェクトトークン上で自己回帰的次フレーム予測の目的関数を用いてトランスフォーマーを訓練する。
  • 下流の分類タスク(例:スニッチ局在化)のため、CLSトークンを導入し、すべてのオブジェクトトークンに注目させる。
  • オブジェクトレベルの再構成と時間的整合性に基づく対照的損失を導入し、表現品質を向上させる。
  • 1枚の48GB GPUを用いて70フレームの動画を学習し、ピクセルベースのトランスフォーマーと比較してメモリ使用量を顕著に削減する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトは、長期的生成に適した効果的な視覚的トークンとして動画トランスフォーマーで機能するか?
  • RQ2ピクセルレベルやRNNベースの手法と比較して、オブジェクト中心の表現学習は、動画生成と推論をどの程度向上させるか?
  • RQ3完全に教師なしのオブジェクト中心モデルは、動画ダイナミクスにおける長期依存関係をどの程度学習できるか?
  • RQ4学習されたオブジェクト表現は、時間的推論を要する下流の動画理解タスクに一般化可能か?
  • RQ5品質と効率の観点から、エンドツーエンドのピクセルベース生成と比較して、自己回帰的オブジェクトレベル生成はどのように異なるか?

主な発見

  • OCVTは補助損失なしで、CATERのスニッチ局在化タスクにおいて、トップ1正答率76.0%、トップ5正答率94.4%の最先端性能を達成した。
  • 位置予測のためのL1損失を追加した場合、OCVTはHopper や OPNet を含む先行手法を上回る、L1距離0.39の最低水準を達成した。
  • 特に色の変化のような長期的ダイナミクスにおいて、RNNベースのベースライン(例:LSTM+GNN)や他の動画トランスフォーマーベースラインを上回った。
  • オブジェクトが遅延後に相互作用するような複雑な長距離依存関係を有するシナリオでも、高品質な将来のフレームを生成できた。
  • ピクセルベースのトランスフォーマーと比較して、OCVTはメモリ使用量を顕著に削減し、1枚の48GB GPUで70フレームの動画学習が可能になった。
  • 自己回帰的オブジェクトレベル生成(OCVT-AR)はRNNベースラインを上回ったが、完全なOCVTに劣っており、自己回帰的誤差蓄積を回避するための完全な自己注意機構の利点が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。