Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Modal Learning with 3D Deformable Attention for Action Recognition

Sangwon Kim, Dasom Ahn|arXiv (Cornell University)|Dec 12, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、アクション認識のための3次元可変アテンションとクロスモーダル学習を組み合わせたアーキテクチャを提案する。アダプティブな空間時間的アテンションにより、関連する関節と時間的セグメントに焦点を当てる。事前学習なしでNTU60、NTU120、FineGYM、PennActionで最先端の性能を達成するとともに、関節と時間的ストライドの可視化により説明可能なアテンションを実現する。

ABSTRACT

An important challenge in vision-based action recognition is the embedding of spatiotemporal features with two or more heterogeneous modalities into a single feature. In this study, we propose a new 3D deformable transformer for action recognition with adaptive spatiotemporal receptive fields and a cross-modal learning scheme. The 3D deformable transformer consists of three attention modules: 3D deformability, local joint stride, and temporal stride attention. The two cross-modal tokens are input into the 3D deformable attention module to create a cross-attention token with a reflected spatiotemporal correlation. Local joint stride attention is applied to spatially combine attention and pose tokens. Temporal stride attention temporally reduces the number of input tokens in the attention module and supports temporal expression learning without the simultaneous use of all tokens. The deformable transformer iterates L-times and combines the last cross-modal token for classification. The proposed 3D deformable transformer was tested on the NTU60, NTU120, FineGYM, and PennAction datasets, and showed results better than or similar to pre-trained state-of-the-art methods even without a pre-training process. In addition, by visualizing important joints and correlations during action recognition through spatial joint and temporal stride attention, the possibility of achieving an explainable potential for action recognition is presented.

研究の動機と目的

  • ビジョントランスフォーマーにおける固定受容 field の制限を是正すること。
  • 単一のトランスフォーマー・アーキテクチャ内でビデオとスケルトンモダリティ間の効果的なクロスモーダル学習を可能にすること。
  • アダプティブなアテンション機構を通じて、計算コストを低減しつつ時間的・空間的相関を保持すること。
  • アクション認識中に重要な関節と時間的セグメントを可視化することで、説明可能なアテンションマップを提供すること。

提案手法

  • すべてのトークンにアテンションを適用するのではなく、関連する空間時間的トークンをアダプティブに選択する3次元可変アテンションモジュールを導入し、計算コストを低減するとともに特徴の集中を向上させる。
  • 単一のトランスフォーマー・ブロック内でビデオとポーズモダリティ間の双方向的文脈交換を可能にするクロスモーダル・トークン機構を採用する。
  • スライディングウインドウを用いて関節トークンをグループ化することで、局所的な関節ストライドアテンションを適用し、空間的相関を維持するとともに効率性を向上させる。
  • 時間的ストライドアテンションを用いて時間軸に沿って入力トークンをダウンサンプリングし、長距離の時間的依存関係を保持しつつシーケンス長を短縮する。
  • 3次元可変アテンション、局所的関節ストライドアテンション、時間的ストライドアテンションの3つのアテンションモジュールを統合し、1つの反復的トランスフォーマーブロックとして組み合わせ、エンドツーエンドの特徴学習を実現する。
  • スケルトンデータを関節トークンに変換し、クロスアテンションを通じてビデオ特徴と統合することで、補助サブモデルの必要性を排除する。

実験結果

リサーチクエスチョン

  • RQ13次元可変アテンション機構は、関連する領域をアダプティブに注目することで、ビジョントランスフォーマーにおける空間時間的特徴学習を向上させることができるか?
  • RQ2分離されたエンコーダーを用いず、統合されたトランスフォーマー・アーキテクチャとクロスモーダル・トークンを用いることで、ビデオとスケルトンモダリティの特徴統合はどの程度効果的か?
  • RQ3局所的関節ストライドと時間的ストライドアテンションは、空間的・時間的相関を保持しつつ、効率性と性能をどの程度向上させることができるか?
  • RQ4提案されたアテンション機構は、人間の行動要因の認識と整合する説明可能なアテンションマップを生成できるか?
  • RQ5精度と計算コストのバランスを取るために、最適な入力フレーム数とアテンションウインドウの設定は何か?

主な発見

  • 提案された3次元可変アテンションは、PennActionデータセットでトップ-1正解率99.7%を達成し、このコンponentを含まないモデルを上回った。
  • アブレーションスタディの結果、3次元可変アテンションを削除すると正解率が4.9ポイント低下し、性能向上におけるその重要性が裏付けられた。
  • クロスモーダル・トークンを導入することで、正解率が92.2%(トークンなし)から99.7%に向上し、クロスモーダル特徴統合における有効性が実証された。
  • PennActionデータセットにおける最適な入力フレーム数は12と特定され、フレーム数が少ない場合に性能が低下した。
  • ウインドウサイズの半分のストライドを用いた時間的ストライドアテンションが最良の性能を示し、中程度の重複が時間的相関学習を強化することが示された。
  • 可視化の結果、動いている関節(例:頭部、右腕、右脚)でアテンションが強く活性化されていることが確認され、行動ダイナミクスと整合しており、モデルの解釈可能性を裏付けるものとなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。