[論文レビュー] BEVT: BERT Pretraining of Video Transformers
BEVTは、ImageNet上で自己教師あり画像モデリングを用いて空間表現を事前学習した後、動画データ上で自己教師あり動画モデリングを用いて空間的・時間的ダイナミクスを同時に学習する、分離型のBERT風事前学習フレームワークを提案する。動画ストリームの注意重みを画像事前学習モデルから初期化し、両ストリームを重み共有で共同微調整することで、最先端の性能を達成し、Something-Something-V2とDiving-48でそれぞれ71.4%および87.2%のTop-1正答率を達成した。
This paper studies the BERT pretraining of video transformers. It is a straightforward but worth-studying extension given the recent success from BERT pretraining of image transformers. We introduce BEVT which decouples video representation learning into spatial representation learning and temporal dynamics learning. In particular, BEVT first performs masked image modeling on image data, and then conducts masked image modeling jointly with masked video modeling on video data. This design is motivated by two observations: 1) transformers learned on image datasets provide decent spatial priors that can ease the learning of video transformers, which are often times computationally-intensive if trained from scratch; 2) discriminative clues, i.e., spatial and temporal information, needed to make correct predictions vary among different videos due to large intra-class and inter-class variations. We conduct extensive experiments on three challenging video benchmarks where BEVT achieves very promising results. On Kinetics 400, for which recognition mostly relies on discriminative spatial representations, BEVT achieves comparable results to strong supervised baselines. On Something-Something-V2 and Diving 48, which contain videos relying on temporal dynamics, BEVT outperforms by clear margins all alternative baselines and achieves state-of-the-art performance with a 71.4\% and 87.2\% Top-1 accuracy respectively. Code will be made available at \url{https://github.com/xyzforever/BEVT}.
研究の動機と目的
- 自然言語処理と画像トランスフォーマーのBERT事前学習の成功を動画理解へと拡張し、動画トランスフォーマーにおけるBERT風事前学習の可能性を検討すること。
- 動画トランスフォーマーを訓練から行う場合の高い計算コストと一般化性能の低さを、画像データからの事前学習済み空間的事前知識を活用することで是しんすること。
- 動画表現学習を空間的および時間的コンポーネントに分離し、空間的知識を保持しながら時間的依存性を学習すること。
- 画像と動画データを共有重みとマスク化モデリング目的関数を用いて共同事前学習することで、動画認識ベンチマークにおける性能を向上させること。
- 画像事前学習から得た空間的事前知識を明示的に保持することで、時間的ダイナミクスに依存する動画において、下流の動画認識性能が向上することを示すこと。
提案手法
- BEVTは二ストリームアーキテクチャを採用する:画像ストリームは空間表現学習を、動画ストリームは時間的ダイナミクス学習を担当する。
- 画像ストリームは、VQ-VAEから得られる潜在コードを用いたマスク画像モデリングによりImageNetで事前学習され、自己教師ありで空間的事前知識を学習する。
- 動画ストリームは画像ストリームの注意重みを初期値として使用し、空間的知識を転送し、学習コストを低減する。
- 動画ストリームは、3次元チューブ(空間時間的パッチ)を用いたマスク動画モデリングを実行し、対照的目的関数によりマスクされたチューブを予測する。
- 両ストリームは共有バックボーン重みを用いて動画データ上で共同で学習され、空間的および時間的モデリングの相互作用を可能にする。
- マスク化モデリングのための離散トークンに、DALL-E や PeCo などの視覚トークナイザーが使用される。
実験結果
リサーチクエスチョン
- RQ1動画データの動的性を考慮すると、BERT風事前学習が動画トランスフォーマーに効果的に拡張可能かどうか。
- RQ2空間的および時間的表現学習を分離することで、動画理解タスクにおける効率性と性能が向上するかどうか。
- RQ3画像事前学習済み空間的事前知識を初期値として用いることで、下流の動画認識正答率にどのような影響を与えるか。
- RQ43次元動画チューブに対するマスキング戦略の中で、マスク動画モデリングの性能を最も高めるのはどれか。
- RQ5視覚トークナイザーの選択(例:DALL-E と PeCo)が、最終的な動画認識性能に与える影響は何か。
主な発見
- Kinetics-400では81.1%のTop-1正答率を達成し、強力な教師ありベースラインの80.6%を上回った。
- Something-Something-V2では71.4%のTop-1正答率を達成し、すべての先行ベースラインを上回り、新たな最先端性能を樹立した。
- Diving-48では87.2%のTop-1正答率を達成し、前例の方法を著しく上回り、新たな最先端性能を確立した。
- アブレーションスタディの結果、ImageNet-1Kで画像ストリームを事前学習することが不可欠であることが確認され、画像事前学習重みから初期化されたモデルが優れた性能を示した。
- DALL-EではなくPeCoトークナイザーを用いることで、より良い結果が得られ、SSv2とDiving48でそれぞれ71.4%および87.2%の正答率を達成した。
- 時間的範囲が0.5TからTで、マスキング比が50%のチューブマスキングが最適な性能を発揮したが、極端に短いまたは長い時間的マスクは性能を低下させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。