Skip to main content
QUICK REVIEW

[論文レビュー] A Hierarchical Deep Temporal Model for Group Activity Recognition

Moustafa Ibrahim, S. Muralidharan|arXiv (Cornell University)|Nov 19, 2015
Human Pose and Action Recognition参考文献 36被引用数 9
ひとこと要約

本稿では、個々の人物の行動をLSTMでまずモデル化し、その後それらの表現を統合して集団的行動を認識する2段階の階層的深層LSTMモデルを提案する。このモデルは、Collective Activity Datasetおよび新たに導入されたバドミントンデータセットの両方でベースライン手法を上回り、個々の人物間の空間的・時間的関係を構造的にモデル化することで、より高い正確性を達成している。

ABSTRACT

In group activity recognition, the temporal dynamics of the whole activity can be inferred based on the dynamics of the individual people representing the activity. We build a deep model to capture these dynamics based on LSTM (long-short term memory) models. To make use of these ob- servations, we present a 2-stage deep temporal model for the group activity recognition problem. In our model, a LSTM model is designed to represent action dynamics of in- dividual people in a sequence and another LSTM model is designed to aggregate human-level information for whole activity understanding. We evaluate our model over two datasets: the collective activity dataset and a new volley- ball dataset. Experimental results demonstrate that our proposed model improves group activity recognition perfor- mance with compared to baseline methods.

研究の動機と目的

  • 動画内の集団的行動を認識する課題に、個人レベルおよび集団レベルの両方の時間的ダイナミクスをモデル化することで対処すること。
  • 人物間の複雑な空間的・時間的関係を捉えるために、手作業で作成された特徴量や浅いモデルの限界を克服すること。
  • 個人レベルの行動を明示的にモデル化し、それらを上位の集団的行動表現に統合する深層学習アーキテクチャを開発すること。
  • ベンチマークの支援を目的として、人物レベルおよび集団的行動ラベルが付与された、公開可能な新しいバドミントンデータセットを構築すること。
  • 階層的時間的モデリングが、集団的行動認識の正確性を向上させる有効性を評価すること。

提案手法

  • 2段階の深層学習アーキテクチャを提案:第1段階では、外観および運動特徴に基づいて追跡された個々の人物の時間的ダイナミクスをLSTMでモデル化する。
  • 第2段階では、別のLSTMを用いて個人レベルの表現を統合し、全体の集団的行動を推論する。
  • 2段階目のLSTMの入力前に、個人レベル特徴をマックスプーリングで統合し、アブレーションスタディによりマックスプーリングが平均プーリングや和プーリングを上回ることを示した。
  • 人物検出を伴う動画シーケンス上でエンド・ツー・エンドに訓練され、時間的モデリングにより逐次的依存関係を捉える。
  • 人物レベルの行動ラベルと集団的行動ラベルを備えた、新しいバドミントンデータセットを導入し、動画レベルおよび人物レベルの評価を可能にする。
  • ベースラインモデルには、画像分類、人物レベル分類、画像または人物特徴を用いた時間的モデルが含まれ、比較評価に用いられる。

実験結果

リサーチクエスチョン

  • RQ1個々の行動を別々にモデル化し、その後統合する階層的深層学習モデルは、集団的行動認識のパフォーマンスを向上させることができるか?
  • RQ2個々の人物のダイナミクスを明示的にモデル化することは、統合的画像ベースのアプローチと比較して、集団的行動認識をどのように改善するか?
  • RQ3第1段階(人物レベル)と第2段階(集団レベル)のLSTMが、全体のパフォーマンスに果たす相対的寄与度は何か?
  • RQ4スパarsな動的集団行動と高速なカメラモーションを特徴とする、新たな挑戦的なバドミントンデータセットでは、モデルの性能はいかがなっているか?
  • RQ5階層的時間的モデリングは、非階層的または非時間的ベースラインを上回る性能を発揮するか?

主な発見

  • 提案された2段階の階層的LSTMモデルは、新しいバドミントンデータセットで51.1%の正確性を達成し、画像分類ベースライン(46.7%)を含むすべてのベースライン手法を上回った。
  • アブレーションスタディにより、第1段階のLSTM(人物レベルモデリング)がパフォーマンスにより顕著な寄与をしていることが示された。第1段階のLSTMを削除すると、性能は48.8%に低下した。
  • 個人レベル特徴の統合にマックスプーリングが最も効果的であり、和プーリングや平均プーリングは一貫して低い正確性を示した。
  • 誤り行列の結果から、視覚的および運動的類似性のため、「セット」と「パス」の行動を最も頻繁に混同しているが、他の大多数の集団的行動では高い全体的な正確性を維持している。
  • 背景の雑音やカメラの動きに対してもモデルは頑健であることが示された。背景や人物を明示的にモデル化しないベースライン(B4:37.4%正確性)は著しく性能が低く、人物を意識した時間的ベースライン(B5)は画像分類ベースライン(45.9%)とほぼ同等の性能を示した。
  • 新たに導入されたバドミントンデータセットは公開可能であり、バランスの取れた集団的行動ラベルを持つが、人物行動ラベルは非バランスである。これは、現実のシーンにおけるレアな動的行動の課題を反映している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。