Skip to main content
QUICK REVIEW

[論文レビュー] Detecting events and key actors in multi-person videos

Vignesh Ramanathan, Jonathan Huang|arXiv (Cornell University)|Nov 9, 2015
Human Pose and Action Recognition参考文献 6被引用数 20
ひとこと要約

本論文は、人物の明示的アノテーションを必要とせず、複数人のビデオにおいてイベントを検出するとともに、関連する主要な参加者を特定するアテンションベースのディープラーニングモデルを提案する。個々の人物を追跡し、時間的に変化するアテンションを追跡された人物特徴に適用する再帰的ニューラルネットワーク(RNN)を用いることで、14,000件の密度高いイベントアノテーションを含む新しい大規模バスケットボールビデオデータセットにおいて、最先端の性能を達成するとともに、関連する選手を自動的に局所化する。

ABSTRACT

Multi-person event recognition is a challenging task, often with many people active in the scene but only a small subset contributing to an actual event. In this paper, we propose a model which learns to detect events in such videos while automatically "attending" to the people responsible for the event. Our model does not use explicit annotations regarding who or where those people are during training and testing. In particular, we track people in videos and use a recurrent neural network (RNN) to represent the track features. We learn time-varying attention weights to combine these features at each time-instant. The attended features are then processed using another RNN for event detection/classification. Since most video datasets with multiple people are restricted to a small number of videos, we also collected a new basketball dataset comprising 257 basketball games with 14K event annotations corresponding to 11 event classes. Our model outperforms state-of-the-art methods for both event classification and detection on this new dataset. Additionally, we show that the attention mechanism is able to consistently localize the relevant players.

研究の動機と目的

  • イベントに関与する人物の一部のみが関連する複数人ビデオにおけるイベント認識の課題に対処すること。
  • トレーニング時にそれらの主要参加者に対する明示的アノテーションが不要な弱教師付き手法を開発すること。
  • 複数人イベント認識モデルの強固な評価を可能にするために、バスケットボールビデオの大型で密度高いアノテーション付きデータセットを作成すること。
  • アテンションメカニズムがイベントレベルの監視情報のみに依存して、自動的に主要参加者を局所化できるかどうかを示すこと。

提案手法

  • 人物検出と再識別を用いてフレーム間で人物を追跡し、時間的トラックを形成する。
  • 各人物トラックは、時間的変化するスパatiotemporal特徴を符号化するために再帰的ニューラルネットワーク(RNN)で表現される。
  • RNNで埋め込まれたトラック特徴に対して、時間的に変化するアテンション機構を適用し、各タイムステップで最も関連性の高い人物を動的に選択する。
  • 注目された特徴は、第二のRNNによって処理され、イベント分類および時系列局所化が行われる。
  • 主にビデオレベルまたはクリップレベルのイベントラベルのみを用いて、エンド・ツー・エンドでモデルを学習する。主な参加者に関するアノテーションは一切不要。
  • 257本の長時間ビデオと11のイベントクラスにまたがる14,000件の密度高い時間的アノテーションを含む、新しい大規模バスケットボールビデオデータセットを収集した。

実験結果

リサーチクエスチョン

  • RQ1アテンションベースのモデルは、参加者の位置や身元に関するいかなる監視情報も得ずに、複数人ビデオにおいて主要参加者を自動的に特定できるか?
  • RQ2複雑で混雑したシーンにおけるイベント検出において、アテンション機構は関連する選手をどの程度正確に局所化できるか?
  • RQ3トラッキングを組み込むことで、モデルは時間的に一貫した主要参加者への注目を維持できるようになるか?
  • RQ4長時間でトリムされていないビデオにおいて、アテンション機構はさまざまな種類のイベントにどの程度一般化できるか?
  • RQ5新しい大規模な複数人ビデオデータセットにおいて、モデルの性能は最先端の手法と比べてどの程度優れているか?

主な発見

  • 提案されたモデルは、新しいバスケットボールデータセットにおいて、イベント分類および時系列検出の両タスクで最先端の手法を上回った。
  • アテンション機構は、イベントクリップにおけるシューターの特定において平均平均適合率(mAP)0.618を達成し、トラッキングなしのベースラインモデルを顕著に上回った。
  • モデルは、イベントの開始時に正しいシューターに注目するよう学習しており、フリースローイベントではフリースロー・ラインに注目し、3ポイントシュートでは3ポイントラインの外側に注目する。
  • 可視化結果から、アテンションはイベントの意味論と空間的に一貫しており、イベントの種類に応じてシューターまたは関連するディフェンスの位置に集中していることが示された。
  • トラッキングを用いたアテンションモデルは、イベント全体を通じて一貫して特定の選手に注目する傾向があり、フリースロー場面ではシューターよりもディフェンスを優先する場合がある。
  • 主な参加者に関する明示的監視が一切ないにもかかわらず、モデルのアテンション機構は11のイベントクラスのうち8つで主なアクターを信頼性高く局所化しており、強力な弱教師付き局所化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。