Skip to main content
QUICK REVIEW

[論文レビュー] Multiview Transformers for Video Recognition

Shen Yan, Xuehan Xiong|arXiv (Cornell University)|Jan 12, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本論文では、複数の時空間的ビュー(異なる時間的持続時間を持つチューブレットを用いて)を別々のトランスフォーマーエンコーダーで処理し、横方向の特徴統合を実施する、動画認識のための新規アーキテクチャMultiview Transformers (MTV) を提案する。MTVは6つの動画データセットにおいて最先端の精度を達成しており、より深い単一ビューのトランスフォーマーモデルよりも少ないFLOPsで性能を上回り、JFT-300M や WTS のような大規模な事前学習データセットを用いることでさらなる性能向上が達成される。

ABSTRACT

Video understanding requires reasoning at multiple spatiotemporal resolutions -- from short fine-grained motions to events taking place over longer durations. Although transformer architectures have recently advanced the state-of-the-art, they have not explicitly modelled different spatiotemporal resolutions. To this end, we present Multiview Transformers for Video Recognition (MTV). Our model consists of separate encoders to represent different views of the input video with lateral connections to fuse information across views. We present thorough ablation studies of our model and show that MTV consistently performs better than single-view counterparts in terms of accuracy and computational cost across a range of model sizes. Furthermore, we achieve state-of-the-art results on six standard datasets, and improve even further with large-scale pretraining. Code and checkpoints are available at: https://github.com/google-research/scenic/tree/main/scenic/projects/mtv.

研究の動機と目的

  • 動画理解におけるマルチスケールの時空間的文脈をモデル化する際の単一ビューのトランスフォーマーの限界を解決すること。
  • ピラミッドベースやサブサンプリングベースのマルチスケール処理を、複数の入力ビューを用いた統一的で柔軟なフレームワークに置き換えること。
  • 多様な時間的解像度を並列処理することで、動画認識における精度と計算量のトレードオフを改善すること。
  • モデルの深さを増やすのではなく、ビューの数を増やすことでより大きな精度向上が達成されることを示すこと。
  • 教師ありおよび自己教師あり事前学習を用いて、標準的な動画ベンチマークで最先端の性能を達成すること。

提案手法

  • モデルは、動画クリップを異なる時間的持続時間を持つチューブレットにトークン化することで、複数の入力ビューを生成する(短い時間は細粒度の動作、長い時間はシーンの文脈に対応)。
  • 各ビューは、容量が異なる(例:広いビューに対してはより小さい隠れ層サイズと層数を持つ)専用のトランスフォーマーエンコーダーで処理される。
  • エンコーダー間の横方向接続により、クロスビュー特徴統合が可能となり、粗いと細かい表現が相互に作用する。
  • 最終的なグローバルトランスフォーマーエンコーダーが、すべてのビューからの特徴を統合して一貫性のある表現を生成し、分類に用いられる。
  • アーキテクチャはビュー数を可変にでき、'Small' から 'Huge' までのさまざまなモデルサイズにスケーリング可能である。
  • さらに性能向上のため、JFT-300M や WTS のような大規模なデータセットを用いた事前学習が実施される。
Figure 1 : Overview of our Multiview Transformer. We create multiple input representations, or “views”, of the input, by tokenizing the video using tubelets of different sizes (for clarity, we show two views here). These tokens are then processed by separate encoder streams, which include lateral co
Figure 1 : Overview of our Multiview Transformer. We create multiple input representations, or “views”, of the input, by tokenizing the video using tubelets of different sizes (for clarity, we show two views here). These tokens are then processed by separate encoder streams, which include lateral co

実験結果

リサーチクエスチョン

  • RQ1単一ビューのトランスフォーマーと比較して、複数のビューを並列に処理することで動画認識の精度が向上するか?
  • RQ2モデルの深さを増やすのではなく、ビューの数を増やすことでより大きな精度向上が達成されるか?
  • RQ3ピラミッドベースやサブサンプリングベースのアプローチと比較して、マルチビュー設計がより優れた精度-計算量トレードオフを達成できるか?
  • RQ4ウェブ規模の動画データセットを用いた大規模事前学習と組み合わせた場合、マルチビュー設計はどの程度有効か?
  • RQ5MViT や Swin に見られる既存のマルチスケールアテンション機構と比較して、マルチビューアプローチは補完的か?

主な発見

  • Kinetics-400 において、MTV-Base は ViViT-L-FE よりも40%少ないFLOPsで89.9%のTop-1精度を達成した。
  • WTS での事前学習を経て、MTV は Kinetics-400 で89.9%のTop-1精度を達成し、以前の最先端(CoVeR)より2.7%の向上を達成した。
  • Kinetics-600 において、WTS 事前学習を用いた MTV は90.3%のTop-1精度を達成し、以前の最先端より2.4%の絶対的向上を達成した。
  • Epic-Kitchens-100 において、MTV-B(320p) はWTS事前学習を経て50.5%のTop-1アクション精度を達成し、新規の最先端を記録した。
  • Something-Something V2 において、MTV は ViViT-L-FE より2.6%、MFormer より0.4%の向上を達成した。
  • Moments in Time において、MTV-L はWTS事前学習を経て47.2%のTop-1精度を達成し、HowTo100M での事前学習を用いた VATT を上回った。
(a) An example of CVA for fusion.
(a) An example of CVA for fusion.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。