Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Deep Temporal Models for Group Activity Recognition

Mostafa S. Ibrahim, S. Muralidharan|arXiv (Cornell University)|Jul 9, 2016
Human Pose and Action Recognition参考文献 14被引用数 17
ひとこと要約

本論文では、個々の人物の行動を人物レベルのLSTMでモデル化し、時間的プーリングを用いてそれらを統合してグループレベルの表現を生成することで、グループアクティビティ認識のための2段階階層的深層LSTMモデルを提案する。この手法は、新規のバドミントンデータセット上で81.9%の正確性を達成し、強力な手作業特徴ベースのベースラインを上回り、空間的・時間的ダイナミクスの構造的階層的モデリングにより一般化性能が向上していることを示している。

ABSTRACT

In this paper we present an approach for classifying the activity performed by a group of people in a video sequence. This problem of group activity recognition can be addressed by examining individual person actions and their relations. Temporal dynamics exist both at the level of individual person actions as well as at the level of group activity. Given a video sequence as input, methods can be developed to capture these dynamics at both person-level and group-level detail. We build a deep model to capture these dynamics based on LSTM (long short-term memory) models. In order to model both person-level and group-level dynamics, we present a 2-stage deep temporal model for the group activity recognition problem. In our approach, one LSTM model is designed to represent action dynamics of individual people in a video sequence and another LSTM model is designed to aggregate person-level information for group activity recognition. We collected a new dataset consisting of volleyball videos labeled with individual and group activities in order to evaluate our method. Experimental results on this new Volleyball Dataset and the standard benchmark Collective Activity Dataset demonstrate the efficacy of the proposed models.

研究の動機と目的

  • 動画内のグループアクティビティ認識の課題に取り組むこと。ここでは、グループレベルのラベルが個々の人物間の複雑な空間的・時間的関係に依存する。
  • 手作業特徴や浅いモデルが、人物レベルおよびグループレベルでの階層的時間的ダイナミクスを捉えることにおける限界を克服すること。
  • 人物レベルの行動ダイナミクスを明示的にモデル化し、それらを統合してグループアクティビティ分類を行う深層学習アーキテクチャを設計すること。
  • 個々のアクティビティおよびグループアクティビティの詳細なアノテーションが付与された、バドミントン動画の新しい大規模データセットを用いてモデルを評価すること。
  • 階層的モデリングが、包括的または非階層的深層学習アプローチと比較して性能を向上させることを示すこと。

提案手法

  • モデルは2段階のアーキテクチャを採用する。まず、個々の人物の軌跡が個別のLSTMによって処理され、人物レベルの行動ダイナミクスが学習される。
  • 次に、人物レベルのLSTM出力が最大プーリングまたは平均プーリングを用いて統合され、グループアクティビティ認識のためのシーンレベル表現が形成される。
  • グループレベルのLSTMが、プールされた表現を時間的に処理し、全体のグループアクティビティを分類する。
  • 背景の雑音を低減するため、検出・追跡された人物を入力とし、バウンディングボックスから特徴量を抽出する。
  • LSTMノード数とタイムステップのハイパーパrameterをアブレーションスタディにより最適化し、時間的シーケンスの人物レベル特徴をエンド・トゥ・エンドで学習する。
  • 本研究では、学習および評価用に個々のアクティビティおよびグループアクティビティの両方をアノテートした1000本の動画クリップを含む新規のバドミントンデータセットを収集した。

実験結果

リサーチクエスチョン

  • RQ1階層的深層学習モデルは、グループアクティビティ認識において、人物レベルおよびグループレベルの両方の時間的ダイナミクスを効果的に捉えることができるか?
  • RQ2個々の行動を統合する前にモデル化することで、包括的動画レベル分類と比較して性能が向上するか?
  • RQ3プーリング戦略の選択(最大プーリング対平均プーリング)が、グループアクティビティタスクの認識正確性にどのように影響するか?
  • RQ4階層的モデリングは、左チームと右チームのアクティビティのような類似したグループアクティビティ間の誤りをどの程度低減するか?
  • RQ5改善された密な軌跡(IDTF)のような強力な手作業特徴ベースのベースラインと比較して、本手法はどのように差をつけるか?

主な発見

  • 提案された2段階階層的LSTMモデルは、新規のバドミントンデータセットで81.9%の正確性を達成し、改善された密な軌跡ベースライン(73.4%)を顕著に上回った。
  • 左チームおよび右チームという2つのサブグループを用いた表現学習により、左勝利および右勝利アクティビティの間の誤りが低減され、分類の堅牢性が向上した。
  • グループレベル層に3000ノードのLSTMを使用し、3000タイムステップを用いたモデルが最高の正確性(81.9%)を達成した。これは、タスクに最適な容量であることを示している。
  • アブレーションスタディの結果、LSTMノード数を増やすことで性能が向上するが、3000ノードを超えると効果の逓減が見られ、限界に達した。
  • セットとパスのアクティビティ間の誤りは、従来の研究でよく見られた問題であったが、本モデルではより優れた時間的モデリングとより多くの学習データのおかげで解消された。
  • 可視化結果から、モデルは大多数のシーンを正しく分類していることが確認された。失敗は主に曖昧な行動ケースや左/右チームの誤分類に起因していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。