Skip to main content
QUICK REVIEW

[論文レビュー] GroupFormer: Group Activity Recognition with Clustered Spatial-Temporal Transformer

Shuai Cheng Li, Qianggang Cao|arXiv (Cornell University)|Aug 28, 2021
Human Pose and Action Recognition参考文献 48被引用数 5
ひとこと要約

GroupFormerは、クラスタリングされた空間時系列トランスフォーマー(CSTT)を用いて空間的・時系列的依存関係を統合的にモデル化する、グループ活動認識のための新しいトランスフォーマー基盤フレームワークを提案する。動的に個々の人物をクラスタにグループ化し、内部およびクラスタ間のアテンションを適用することで、表現学習を向上させ、バドミントンおよびコラボラティブアクティビティデータセットで最先端の性能を達成し、グループ活動認識の精度は94.1%に達する。

ABSTRACT

Group activity recognition is a crucial yet challenging problem, whose core lies in fully exploring spatial-temporal interactions among individuals and generating reasonable group representations. However, previous methods either model spatial and temporal information separately, or directly aggregate individual features to form group features. To address these issues, we propose a novel group activity recognition network termed GroupFormer. It captures spatial-temporal contextual information jointly to augment the individual and group representations effectively with a clustered spatial-temporal transformer. Specifically, our GroupFormer has three appealing advantages: (1) A tailor-modified Transformer, Clustered Spatial-Temporal Transformer, is proposed to enhance the individual representation and group representation. (2) It models the spatial and temporal dependencies integrally and utilizes decoders to build the bridge between the spatial and temporal information. (3) A clustered attention mechanism is utilized to dynamically divide individuals into multiple clusters for better learning activity-aware semantic representations. Moreover, experimental results show that the proposed framework outperforms state-of-the-art methods on the Volleyball dataset and Collective Activity dataset. Code is available at https://github.com/xueyee/GroupFormer.

研究の動機と目的

  • 空間的・時系列的関係を別々に扱うか、ノイズを引き起こすフルアテンション機構を用いる既存手法とは対照的に、グループ活動認識における共同空間時系列依存関係をモデル化する課題に対処すること。
  • 意味的関連性に基づいて人物を動的にクラスタリングすることで、関係のない相互作用からの干渉を低減し、グループ表現学習を向上させること。
  • グループ内およびグループ間の関係を効果的に捉えることで、より良いアクティビティに適した特徴表現学習を実現する、エンドツーエンドで学習可能なフレームワークを構築すること。
  • グループ活動認識のベンチマークデータセットにおいて、既存の最先端手法を上回ること。

提案手法

  • 空間的・時系列的特徴を統合的にモデル化する目的で、スタックされたエンコーダーとクロスアテンションデコーダーを用いた、カスタマイズされたトランスフォーマー・アーキテクチャ、すなわちクラスタリングされた空間時系列トランスフォーマー(CSTT)を導入する。
  • クラスタリングアテンション機構により、人物をC個のクラスタに動的に分割し、クラスタ内での局所的情報伝達とクラスタ間のグローバル相互作用モデリングを可能にする。
  • 複数のCSTTブロックによる表現精錬の前に、個々の人物とシーン全体の文脈を統合するためのグループ表現ジェネレータを用いる。
  • 空間的特徴と時系列的特徴の間のブリッジを構築するために、クロスアテンションの形でデコーダーを採用し、空間時系列的文脈の統合的モデリングを可能にする。
  • グループ内アテンション(クラスタ内)とグループ間アテンション(クラスタ間)の両方を用いることで、特徴表現学習を強化する。
  • アーキテクチャはエンドツーエンドで学習可能であり、クエリ・キー機構を活用して動画シーケンス内の長距離依存関係をモデル化する。

実験結果

リサーチクエスチョン

  • RQ1空間的・時系列的依存関係の共同モデリングは、グループ活動認識の性能向上に寄与するか?
  • RQ2意味的に関連するグループに人物を動的にクラスタリングすることは、表現学習の向上と、関係のない相互作用に起因するノイズの低減に寄与するか?
  • RQ3グループ内およびグループ間アテンション機構は、アクティビティに適した表現学習にどのように寄与するか?
  • RQ4認識精度を最大化するために最適なクラスタ数とCSTTブロック数は何か?
  • RQ5提案されたフレームワークは、標準ベンチマークで既存の最先端手法を上回る性能を示せるか?

主な発見

  • GroupFormerは、バドミントンデータセットにおけるグループ活動認識で94.1%の精度を達成し、以前の最先端手法を上回った。
  • アブレーションスタディの結果、標準的な空間時系列トランスフォーマーをクラスタリングアテンション機構(CSTT)に置き換えることで、性能が93.4%から94.1%に向上した。
  • 4つのクラスタを使用した場合が最良の性能を示し、1つのクラスタや他のクラスタ数と比較して顕著な向上が見られた。
  • グループ内およびグループ間アテンション機構の併用が最も高い性能(94.1%)を達成し、両者の相補的な利点を実証した。
  • 3つのCSTTブロックをスタックした場合が最良の性能を示したが、4つのブロックではわずかな劣化が見られたことから、特徴精錬の最適な深さが存在することが示された。
  • t-SNE可視化の結果、CSTTバージョンがベースラインと比較して、より判別力があり、明確に分離された特徴表現を学習していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。