Skip to main content
QUICK REVIEW

[論文レビュー] Shifted Chunk Transformer for Spatio-Temporal Representational Learning

Xuefan Zha, Wentao Zhu|arXiv (Cornell University)|Aug 26, 2021
Human Pose and Action Recognition参考文献 55被引用数 7
ひとこと要約

本稿では、空間時系列表現学習向けのメモリおよび計算効率に優れたTransformerアーキテクチャ、シフトドチャネルTransformer(SCT)を提案する。画像チャネル自己注意に局所性に敏感なハッシュ(LSH)を適用し、フレーム間の動きをモデル化するためのシフト付きマルチヘッド自己注意を導入することで、従来手法より少ないパラメータ数およびFLOPsで、Kinetics-400、Kinetics-600、UCF101、HMDB51の各データセットにおいて最先端の精度を達成した。

ABSTRACT

Spatio-temporal representational learning has been widely adopted in various fields such as action recognition, video object segmentation, and action anticipation. Previous spatio-temporal representational learning approaches primarily employ ConvNets or sequential models,e.g., LSTM, to learn the intra-frame and inter-frame features. Recently, Transformer models have successfully dominated the study of natural language processing (NLP), image classification, etc. However, the pure-Transformer based spatio-temporal learning can be prohibitively costly on memory and computation to extract fine-grained features from a tiny patch. To tackle the training difficulty and enhance the spatio-temporal learning, we construct a shifted chunk Transformer with pure self-attention blocks. Leveraging the recent efficient Transformer design in NLP, this shifted chunk Transformer can learn hierarchical spatio-temporal features from a local tiny patch to a global video clip. Our shifted self-attention can also effectively model complicated inter-frame variances. Furthermore, we build a clip encoder based on Transformer to model long-term temporal dependencies. We conduct thorough ablation studies to validate each component and hyper-parameters in our shifted chunk Transformer, and it outperforms previous state-of-the-art approaches on Kinetics-400, Kinetics-600, UCF101, and HMDB51.

研究の動機と目的

  • 動画理解タスクにおける純粋なTransformerモデルの高い計算コストとメモリ要件を軽減すること。
  • 動画シーケンス内の細粒度なフレーム内特徴と複雑なフレーム間の動きのばらつきを効果的にモデル化すること。
  • 高い精度を維持しつつFLOPsとモデルサイズを削減できる、効率的で階層的なTransformerアーキテクチャを設計すること。
  • 最小限の追加計算コストで、純粋なTransformerによるクリップエンコーダーを用いて長距離時系列依存性を効果的にモデル化すること。

提案手法

  • 局所性に敏感なハッシュ(LSH)を用いた画像チャネル自己注意により、注目計算コストを低減するとともに、小さなパッチから細粒度な局所的特徴学習を可能にする。
  • 空間的にずらされたパッチを隣接フレーム間で注目することで、動きを明示的にモデル化するためのシフト付きマルチヘッド自己注意モジュールを導入し、フレーム間のばらつきを捉える。
  • 局所的画像チャネルからグローバルな動画クリップへ特徴を処理する階層的設計により、マルチスケール表現学習を実現する。
  • 追加計算コストを最小限に抑えた純粋なTransformerによるクリップエンコーダーを導入し、フレーム間の長距離時系列依存性をモデル化する。
  • 標準的なRGB入力で、ImageNet-21Kで事前学習し、行動認識ベンチマークで微調整する。
  • ハイパーパramーターやコンponentsは、Kinetics-400、Kinetics-600、UCF101、HMDB51における広範な除去研究を通じて検証された。

実験結果

リサーチクエスチョン

  • RQ1純粋なTransformerアーキテクチャは、計算コストを抑えたまま、動画行動認識で最先端の性能を達成できるか?
  • RQ2局所性に敏感なハッシュ(LSH)は、特徴品質を損なわずに動画Transformerにおける注目計算をどれほど低減できるか?
  • RQ3シフト付き自己注意は、動画シーケンスにおける動きとフレーム間関係のモデル化をどの程度効果的に向上させるか?
  • RQ4純粋なTransformerに基づくクリップレベルの注目モジュールは、最小限のオーバーヘッドで長距離時系列依存性を効果的にモデル化できるか?

主な発見

  • シフトドチャネルTransformer(SCT-L)は、Kinetics-400で事前学習した場合、HMDB51で84.6%のトップ1精度、UCF101で98.7%のトップ1精度を達成し、従来の最先端手法を上回った。
  • SCT-Lは、Kinetics-400で83.0%、Kinetics-600で84.3%のトップ1精度を達成し、ViViT-LおよびTimeSformerをそれぞれ1.7%および1.3%上回った。
  • SCT-Sは、ImageNetでのみ事前学習した状態でUCF101で98.0%のトップ1精度を達成し、最小限の事前学習データで優れた一般化性能を示した。
  • SCT-Lは、わずか0.343 TFLOPsおよび6000万パラメータで実行され、ViViT-L(399.2 TFLOPs)よりもはるかに少ない計算量で、より高い精度を達成した。
  • 除去研究により、LSHベースのチャネル注目とシフト付き自己注意の両方が性能に不可欠であることが確認され、いずれかを除去すると精度が2%以上低下した。
  • SCT-Mの推論時間は、1枚のV100 GPUで0.072秒であり、高い性能を維持しながらも、高い推論効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。