Skip to main content
QUICK REVIEW

[論文レビュー] Combined CNN Transformer Encoder for Enhanced Fine-grained Human Action Recognition

Mei Chee Leong, Haosong Zhang|arXiv (Cornell University)|Aug 3, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本論文は、微細な人間の行動認識のための2つのハイブリッドCNN-Transformerアーキテクチャを提案する:3Dビジョントランスフォーマーエンコーダーとビデオ・テキストクロストランスフォーマーエンコーダー。3D CNN特徴量と自己注意およびクロス注意メカニズムを組み合わせることで、モデルは強化された時間的意味論と視覚的・言語的クロス注意を学習し、FineGymベンチマークで94.6%のトップ1精度(Gym99)および90.1%(Gym288)を達成し、新たなSOTA性能を実現した。

ABSTRACT

Fine-grained action recognition is a challenging task in computer vision. As fine-grained datasets have small inter-class variations in spatial and temporal space, fine-grained action recognition model requires good temporal reasoning and discrimination of attribute action semantics. Leveraging on CNN's ability in capturing high level spatial-temporal feature representations and Transformer's modeling efficiency in capturing latent semantics and global dependencies, we investigate two frameworks that combine CNN vision backbone and Transformer Encoder to enhance fine-grained action recognition: 1) a vision-based encoder to learn latent temporal semantics, and 2) a multi-modal video-text cross encoder to exploit additional text input and learn cross association between visual and text semantics. Our experimental results show that both our Transformer encoder frameworks effectively learn latent temporal semantics and cross-modality association, with improved recognition performance over CNN vision model. We achieve new state-of-the-art performance on the FineGym benchmark dataset for both proposed architectures.

研究の動機と目的

  • クラス間の差が微細で、強力な時間的推論と意味的区別が必要な微細な行動認識の課題に対処すること。
  • CNN(空間時間的特徴抽出)とトランスフォーマー(グローバル依存関係モデリング)の相補的利点を活用して、認識精度を向上させること。
  • 視覚的特徴とテキスト記述の間の弱い教師付きクロスアテンションを活用し、視覚的に類似した行動の区別を高めること。
  • 微細な体操行動認識のための挑戦的なデータセットであるFineGymベンチマークで、SOTA性能を達成すること。
  • 時間的依存関係と潜在的意味論を捉えるために、純粋な視覚的およびマルチモーダルなビデオ・テキストエンコーダーの有効性を調査すること。

提案手法

  • ビデオクリップから空間時間的特徴量を抽出するため、3D CNNバックボーン(SlowOnly)を用い、それを視覚トークンに変換する。
  • 視覚トークンをトランスフォーマーエンコーダーに供給し、長距離の時間的依存関係をモデル化し、潜在的意味表現を学習する。
  • クロスエンコーダーのため、行動クラスのテキスト記述を抽出し、それをテキストトークンに埋め込み、共通のトランスフォーマーエンコーダーで視覚トークンと共に入力する。
  • 行動クラスラベルからの弱教師付き学習により、アトリビュートレベルのアノテーションが不要な状態で、視覚的・言語的アテンションのエンドツーエンド学習を可能にする。
  • トレーニングにAdamW最適化法を用い、学習率スケジューリングにコサインアニーリングと重み減衰0.05を適用する。
  • 特徴レベルの統合とマルチヘッド自己アテンション機構を用いて、効果的なマルチモーダル相互作用と表現学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1微細な行動認識において、CNNで抽出された視覚的特徴量からトランスフォーマーエンコーダーが潜在的な時間的意味論を効果的に学習できるか?
  • RQ2テキスト記述を組み込むことで、視覚的に類似した微細な行動の区別がどの程度向上するか?
  • RQ3アトリビュートレベルのアノテーションが存在しない状態で、弱教師付きビデオ・テキストクロスアテンションが意味的な視覚的・言語的関連性をどの程度効果的に学習できるか?
  • RQ4CNNとトランスフォーマーの統合が、微細なベンチマークで単独のCNNまたはビジョンオンリートランスフォーマーベースラインを上回るか?
  • RQ5視覚的および言語的モダリティ間のクロスアテンションが、属性豊富な複雑な行動データセットにおける全体の認識精度にどの程度寄与するか?

主な発見

  • 3Dビジョントランスフォーマーエンコーダーは、Gym99で94.0%のトップ1精度、Gym288で90.5%を達成し、TSN、TRNms、TSM、I3D、NL I3Dを含むすべてのCNNベースラインを上回った。
  • ビデオ・テキストクロストランスフォーマーエンコーダーは、Gym99で94.6%、Gym288で90.1%のトップ1精度を達成し、FineGymベンチマークで新たなSOTA性能を樹立した。
  • クロスエンコーダーフレームワークは、SlowOnlyベースラインと比較してGym288で3.28パーセンテージポイントのトップ1精度向上を達成し、弱教師付き視覚的・言語的アライメントの利点を示した。
  • VTクロスエンコーダーは、クエリ・リクエスト機構を用いた先行SOTAモデルTQNを、Gym99で0.8%、Gym288で0.5%上回り、優れたクロスエンコーディング能力を示した。
  • 両モデルともSlowOnlyベースラインを顕著に上回り、特にクロスエンコーダーが最大の向上を示し、マルチモーダル学習の価値を強調した。
  • 結果は、グローバルな時間的意味論とマルチモーダル関連性の学習が、空間的・時間的差が微細な行動認識における区別を強化することを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。