Skip to main content
QUICK REVIEW

[論文レビュー] ACTION-Net: Multipath Excitation for Action Recognition

Zhengwei Wang, Qi She|arXiv (Cornell University)|Mar 11, 2021
Human Pose and Action Recognition参考文献 46被引用数 11
ひとこと要約

ACTION-Net は、空間的・時間的、チャネルワイズ、モーション特徴を同時にモデル化することで、2次元畳み込みニューラルネットワーク(2D CNN)の動画行動認識性能を向上させる軽量で即座に統合可能なマルチパス励起モジュール(ACTION)を導入する。3つの並列励起パス(空間的・時間的、チャネル、モーション励起)を統合することで、計算コストの増加を最小限に抑えつつ、Something-Something V2、Jester、EgoGestureで最先端の精度を達成し、TSM や 2D CNN ベースラインを常に上回る性能を発揮する。

ABSTRACT

Spatial-temporal, channel-wise, and motion patterns are three complementary and crucial types of information for video action recognition. Conventional 2D CNNs are computationally cheap but cannot catch temporal relationships; 3D CNNs can achieve good performance but are computationally intensive. In this work, we tackle this dilemma by designing a generic and effective module that can be embedded into 2D CNNs. To this end, we propose a spAtio-temporal, Channel and moTion excitatION (ACTION) module consisting of three paths: Spatio-Temporal Excitation (STE) path, Channel Excitation (CE) path, and Motion Excitation (ME) path. The STE path employs one channel 3D convolution to characterize spatio-temporal representation. The CE path adaptively recalibrates channel-wise feature responses by explicitly modeling interdependencies between channels in terms of the temporal aspect. The ME path calculates feature-level temporal differences, which is then utilized to excite motion-sensitive channels. We equip 2D CNNs with the proposed ACTION module to form a simple yet effective ACTION-Net with very limited extra computational cost. ACTION-Net is demonstrated by consistently outperforming 2D CNN counterparts on three backbones (i.e., ResNet-50, MobileNet V2 and BNInception) employing three datasets (i.e., Something-Something V2, Jester, and EgoGesture). Codes are available at \url{https://github.com/V-Sense/ACTION-Net}.

研究の動機と目的

  • 2次元畳み込みニューラルネットワークの計算効率と性能のトレードオフを改善するため、複数の特徴タイプを同時にモデル化する手法を用いて 2D CNN を強化すること。
  • 既存の 2D CNN アーキテクチャに大規模な変更を加えずに容易に統合可能な、軽量で汎用的なモジュールを設計すること。
  • 光学フロー計算にかかるコストを回避しつつ、特徴レベルで明示的にモーションパターンを捉えることで、2D CNN の時間的モデリングを向上させること。
  • 大規模な行動認識ベンチマークで優れた性能を発揮するとともに、推論コストを低く保つこと。

提案手法

  • ACTION モジュールは、3つの並列励起パス(空間的・時間的励起(STE)、チャネル励起(CE)、モーション励起(ME))から構成される。
  • STE パath は、特徴マップから空間的・時間的表現を抽出するために 1x1x1 の 3次元畳み込みを用いる。
  • CE パath は、時間方向にグローバル平均プーリングを適用し、チャネル間の依存関係に基づいてチャネルワイズ特徴を再キャリブレーションする squeeze-and-excitation メカニズムを適用する。
  • ME パath は、連続する特徴マップ間の時間的差分を計算し、学習可能な変換を用いてモーションに敏感なチャネルを励起する。
  • 3つのパスの出力を連結し、最終的な強化された特徴マップを生成するために学習可能なゲートを通過させる。
  • このモジュールは、2D CNN の残差ブロック(例:ResNet-50、MobileNet V2、BNInception)に挿入され、ACTION-Net アーキテクチャを形成する。

実験結果

リサーチクエスチョン

  • RQ1空間的・時間的、チャネルワイズ、モーション特徴を同時にモデル化することで、軽量で即座に統合可能なモジュールが 2D CNN の動画行動認識性能を効果的に向上させられるか?
  • RQ2TSM や 3次元CNN と比較して、提案手法のマルチパス励起機構は、精度と計算効率の両面で優れているか?
  • RQ3各個別の励起パス(STE、CE、ME)が全体の性能向上に果たす寄与度はどの程度か?
  • RQ4ネットワークに挿入する ACTION モジュールの数を増やすと、認識精度と計算コストにどのような影響があるか?
  • RQ5異なるパラメータ数と FLOPs バジェットを持つ多様な 2D CNN ベースに、ACTION モジュールを効率的に適用できるか?

主な発見

  • EgoGesture データセットにおいて、ACTION-Net は FLOPs を 5.3% 増加させるのみで、TSM よりも Top-1 精度を 2.1% アブソリュートで向上させた。
  • Something-Something V2 において、ResNet-50 を用いた ACTION-Net は TSM よりも Top-1 精度を 1.40% 向上させた。一方、MobileNet V2 では FLOPs の増加が最小限でありながら 0.22% の向上を達成した。
  • 効率性指標 η(1% Top-1 精度向上当たりの追加 FLOPs)は、STE が最も低く(0.18%)、ME が最も高い(2.83%)ことから、STE が最も効率的なコンponent であることが示された。
  • 残差段階(res2 から res5 まで)に ACTION モジュールを増やすことで、性能向上が一貫して見られ、モジュールのスケーラビリティと有効性が裏付けられた。
  • すべての3つのバックボーン(ResNet-50、BNInception、MobileNet V2)と3つのデータセットにおいて、ACTION-Net は TSM を常に上回った。これは汎用性と頑健性を示している。
  • MobileNet V2 では、TSM を ACTION に置き換えることで、最も高い効率(最小の η)を達成した。これは、モジュールが軽量モデルにおいて特に効果的であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。