Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Level Sequence GAN for Group Activity Recognition

Harshala Gammulle, Simon Denman|arXiv (Cornell University)|Dec 18, 2018
Human Pose and Action Recognition参考文献 26被引用数 4
ひとこと要約

本稿では、LSTMを用いて人物レベルおよびシーンレベルの特徴を共同で学習し、新たなゲート付き融合ユニットを介して判別的な「アクションコード」を生成する半教師ありマルチレベルシーケンス GAN(MLS-GAN)を提案する。このモデルは、手動でのアクションアノテーションを必要とせず、長期的な依存関係を効果的にモデル化することで、バレーイングルおよびコラボラティブアクティビティデータセットにおいて最先端の手法を上回る性能を発揮する。

ABSTRACT

We propose a novel semi-supervised, Multi-Level Sequential Generative Adversarial Network (MLS-GAN) architecture for group activity recognition. In contrast to previous works which utilise manually annotated individual human action predictions, we allow the models to learn it's own internal representations to discover pertinent sub-activities that aid the final group activity recognition task. The generator is fed with person-level and scene-level features that are mapped temporally through LSTM networks. Action-based feature fusion is performed through novel gated fusion units that are able to consider long-term dependencies, exploring the relationships among all individual actions, to learn an intermediate representation or `action code' for the current group activity. The network achieves its semi-supervised behaviour by allowing it to perform group action classification together with the adversarial real/fake validation. We perform extensive evaluations on different architectural variants to demonstrate the importance of the proposed architecture. Furthermore, we show that utilising both person-level and scene-level features facilitates the group activity prediction better than using only person-level features. Our proposed architecture outperforms current state-of-the-art results for sports and pedestrian based classification tasks on Volleyball and Collective Activity datasets, showing it's flexible nature for effective learning of group activities.

研究の動機と目的

  • 動的かつ相互作用的な複数人の個体が関与する動画におけるグループアクティビティ認識の課題に対処すること。
  • 手動でアノテートされた個々のアクションラベルへの依存を減らし、モデルが内部表現を自動的に学習できるようにすること。
  • 統一された生成的対抗フレームワーク内で人物レベルおよびシーンレベルの視覚的特徴を統合することで、認識性能を向上させること。
  • ラベル付きおよびラベルなしデータを活用する半教師ありアーキテクチャを構築し、一般化性能を向上させること。
  • 個々のアクションとそれらの相互作用の重み付けを学習する注目メカニズムに類似したゲート付き融合ユニットを導入し、より優れたアクションコード表現を実現すること。

提案手法

  • 生成器は、各レベルの時間的ダイナミクスをモデル化するため、別個のLSTMを用いて人物レベルおよびシーンレベルのRGB特徴のシーケンスを処理する。
  • 新規のゲート付き融合ユニット(GFU)は、LSTMの出力を統合し、長期的な依存関係および個々のアクションの関連性を捉える中間のアクションコードを学習する。
  • 識別器は二重のタスクを実行する:グループアクティビティの分類および、実際(真の値)のアクションコードと生成されたものの区別。
  • モデルは、ラベル付きデータにおける分類目的の教師あり学習と、GANの目的(本物/偽物分類)を組み合わせることで、半教師ありで訓練される。
  • 生成器は、意味的に意味のあるだけでなく、本物のものと区別がつかないアクションコードを生成するように訓練され、識別器は敵対的フィードバックを通じて改善される。
  • GFUは、学習された注目メカニズムに基づいて、個々のエージェントとシーンコンテキストからの寄与度を動的に重み付けするため、エンドツーエンドで訓練可能である。

実験結果

リサーチクエスチョン

  • RQ1手動でアノテートされた個々のアクションラベルに依存せずに、グループアクティビティ表現を効果的に学習できる半教師あり GAN アーキテクチャは存在するか?
  • RQ2人物レベルおよびシーンレベルの特徴を統合することで、グループアクティビティ認識モデルの性能にどのような影響を与えるか?
  • RQ3個々のアクション間の長期的依存関係をモデル化するゲート付き融合ユニットが、アクションコードの質および認識精度をどの程度向上させるか?
  • RQ4提案された MLS-GAN フレームワークは、スポーツや歩行者ベースのアクティビティなど多様なデータセットに一般化可能か?
  • RQ5分類と本物/偽物の区別という二重目的を持つ敵対的訓練を組み込むことで、標準的な教師あり学習に比べて特徴学習がどの程度向上するか?

主な発見

  • 提案された MLS-GAN は、コラボラティブアクティビティデータセットで 91.7% の MPCA を達成し、以前の最先端手法を大きく上回った。
  • バレーイングルデータセットでは、MLS-GAN は最先端の性能を達成し、スポーツ動画分析分野における有効性を示した。
  • アブレーションスタディの結果、シーンレベルの特徴を削除した場合(MLS-GAN-ẑ)の性能は 91.2% MPCA に低下し、シーンコンテキストの重要性が示された。
  • ゲート付き融合ユニット(GFU)は、ベースラインの cGAN-GFU モデルに比べて MPCA で 2.4% の向上を達成し、エージェント間の関係性をモデル化する有効性が裏付けられた。
  • GAN の目的関数は特徴学習を顕著に向上させた:生成されたアクションコード上で訓練された分類器は 90.7% MPCA を達成したが、分類損失のみで生成器を訓練した場合の性能は 60.5% MPCA にとどまった。
  • 1つのCPUコアで100件の予測を20.4秒で生成でき、実世界の導入にふさわしい推論効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。