Skip to main content
QUICK REVIEW

[論文レビュー] CAST: Cross-Attention in Space and Time for Video Action Recognition

Dong-Ho Lee, Jongseo Lee|arXiv (Cornell University)|Nov 30, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

CASTは、RGB入力のみを用いて空間的・時間的理解のバランスをとる二重ストリーム動画行動認識モデルを提案する。ボトルネックアーキテクチャ内で空間的エキスパートと時間的エキスパートの間で相互に注意機構を適用することで、協調的な情報交換を実現し、多様なデータセットにおいて77.9%という最先端の調和平均精度を達成した。この手法は、静的バイアスと時間的バイアスの両方のベンチマークで、光学フローもマルチモodal入力も使用しない状態で、バランスの取れた性能を発揮した。

ABSTRACT

Recognizing human actions in videos requires spatial and temporal understanding. Most existing action recognition models lack a balanced spatio-temporal understanding of videos. In this work, we propose a novel two-stream architecture, called Cross-Attention in Space and Time (CAST), that achieves a balanced spatio-temporal understanding of videos using only RGB input. Our proposed bottleneck cross-attention mechanism enables the spatial and temporal expert models to exchange information and make synergistic predictions, leading to improved performance. We validate the proposed method with extensive experiments on public benchmarks with different characteristics: EPIC-KITCHENS-100, Something-Something-V2, and Kinetics-400. Our method consistently shows favorable performance across these datasets, while the performance of existing methods fluctuates depending on the dataset characteristics.

研究の動機と目的

  • 既存の動画行動認識モデルに見られる空間的・時間的理解の不均衡を是正すること。
  • 光学フローもマルチモーダル入力も使用せず、静的バイアスと時間的バイアスの両方のデータセットで性能を向上させること。
  • 空間的エキスパートと時間的エキスパートがクロスアテンションを通じて協調的に行動を予測する二重ストリームアーキテクチャを設計すること。
  • ボトルネックにおけるクロスアテンション機構の有効性が、バランスの取れた表現学習を可能にすることを検証すること。
  • 特性の異なる多様な動画行動認識ベンチマークで一貫した性能を示すことを確認すること。

提案手法

  • モデルは、空間的文脈を処理する空間的エキスパートと、時間的ダイナミクスを処理する時間的エキスパートの2つのエキスパートネットワークを採用し、両者ともRGB動画クリップを入力とする。
  • 空間的エキスパートと時間的エキスパートの間でクロスアテンションを適用し、双方向の情報交換と協調的予測を可能にする。
  • 特徴の精錬と学習効率の向上を図るため、クロスアテンション機構をボトルネックアーキテクチャに配置する。
  • 最終的な予測は、両エキスパートの補完的特徴を活かした重み付き組み合わせである。
  • 標準的な交差エントロピー損失を用いて、行動分類タスクでエンドツーエンドに学習する。
  • アブレーションスタディにより、両エキスパートストリームおよびボトルネッククロスアテンション設計の必要性が検証された。

実験結果

リサーチクエスチョン

  • RQ1空間的エキスパートと時間的エキスパートの間でクロスアテンションを有する二重ストリームアーキテクチャは、単一ストリームモデルに比べ、より優れたバランスの取れた空間的・時間的理解を達成できるか?
  • RQ2ボトルネッククロスアテンション機構は、標準アテンションや早期融合に比べ、表現学習を改善するか?
  • RQ3本手法は、静的バイアス(例:Kinetics-400)、時間的バイアス(例:Something-So)、および詳細な行動(例:EPIC-KITCHENS-100)を持つデータセットで、それぞれどのように性能を発揮するか?
  • RQ4既存手法の性能は、データセットによって顕著に不均衡になっており、CASTはこの問題を緩和できるか?
  • RQ5各エキスパートストリームおよびクロスアテンション機構は、全体の性能にそれぞれどのように寄与しているか?

主な発見

  • CASTは、EK100、SSV2、K400の3つのデータセットで77.9%という調和平均精度を達成し、同じ指標でAIM(75.4%)とVideoMAE(75.8%)を上回った。
  • K400データセットでは、トップ1精度85.3%を達成し、VideoMAE(81.5%)を上回り、このベンチマークで最も高い性能を示す手法と同等の結果を得た。
  • SSV2データセットでは、トップ1精度71.6%を達成し、VideoMAE(70.8%)を上回り、時間的バイアスの強いこのベンチマークでAIM(68.1%)を大きく上回った。
  • 詳細な行動認識を要するEPIC-KITCHENS-100データセットでは、行動精度49.3%を達成し、比較手法の中で2位となった。
  • アブレーションスタディにより、空間的エキスパートと時間的エキスパートの両方が不可欠であり、ボトルネッククロスアテンション機構がベースライン手法に比べて顕著に性能向上をもたらすことが確認された。
  • CASTは、すべてのデータセットで一貫した優れた性能を示しており、既存手法よりもよりバランスの取れた空間的・時間的理解が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。