Skip to main content
QUICK REVIEW

[論文レビュー] Fusing Motion Patterns and Key Visual Information for Semantic Event Recognition in Basketball Videos

Lifang Wu, Zhou Yang|arXiv (Cornell University)|Jul 13, 2020
Human Pose and Action Recognition参考文献 37被引用数 5
ひとこと要約

本論文は、バスケットボールゴールからのキービジュアル情報(KVI)を用いて分離されたグローバルおよびローカルな運動パターンを融合する2ストリーム3次元畳み込みニューラルネットワーク(3D CNN)フレームワークを提案し、バスケットボール動画における意味的イベントを認識する。カメラの運動の一貫性を活用してグローバル運動を推定し、KVI抽出に深層畳み込みニューラルネットワーク(CNN)を用いてスコアリング結果を予測することで、NCAAデータセットで最先端の性能を達成するとともに、NBA/CBAデータへも良好な一般化性能を示す。

ABSTRACT

Many semantic events in team sport activities e.g. basketball often involve both group activities and the outcome (score or not). Motion patterns can be an effective means to identify different activities. Global and local motions have their respective emphasis on different activities, which are difficult to capture from the optical flow due to the mixture of global and local motions. Hence it calls for a more effective way to separate the global and local motions. When it comes to the specific case for basketball game analysis, the successful score for each round can be reliably detected by the appearance variation around the basket. Based on the observations, we propose a scheme to fuse global and local motion patterns (MPs) and key visual information (KVI) for semantic event recognition in basketball videos. Firstly, an algorithm is proposed to estimate the global motions from the mixed motions based on the intrinsic property of camera adjustments. And the local motions could be obtained from the mixed and global motions. Secondly, a two-stream 3D CNN framework is utilized for group activity recognition over the separated global and local motion patterns. Thirdly, the basket is detected and its appearance features are extracted through a CNN structure. The features are utilized to predict the success or failure. Finally, the group activity recognition and success/failure prediction results are integrated using the kronecker product for event recognition. Experiments on NCAA dataset demonstrate that the proposed method obtains state-of-the-art performance.

研究の動機と目的

  • 外見の変化や隠蔽によって従来のトラッキングベースの手法が困難となるバスケットボール動画における意味的イベント認識の課題に対処すること。
  • 標準的なオプティカルフローでは分離が難しい混合オプティカルフローから、グローバルおよびローカルな運動パターンを分離することで、グループ行動認識を向上させること。
  • バスケット周辺のキービジュアル情報(KVI)を活用してスコアリング結果の予測を向上させること、例えばネットの動きやボールの進入状況など。
  • 動的運動特徴と外見ベースの結果予測を統合的に統合した意味的イベント認識システムを構築すること。
  • NCAA、NBA、CBAを含む多様なデータセットで良好に動作する汎用性の高いフレームワークを開発すること。

提案手法

  • カメラの調整パターン(例:パン、ズーム)を活用して混合運動場からグローバル運動を分離する、新規のグローバル運動推定アルゴリズムを提案する。
  • 混合運動場から推定されたグローバル運動を差し引くことでローカル運動パターンを導出し、グループレベルのダイナミクスを別個にモデル化可能にする。
  • 2ストリーム3D CNNアーキテクチャを採用:1本目のストリームは分離されたグローバル運動を処理し、もう1本のストリームはローカル運動を処理してグループ行動認識を実現する。
  • CNNベースの物体検出モジュールを用いてバスケットゴール領域を検出し、KVI領域からの外見特徴を抽出してスコアの成功/失敗を予測する。
  • 2つのパイプライン(グループ行動認識と成功/失敗予測)の出力をクリーネッカー積を用いて統合し、最終的な意味的イベント予測を生成する。
  • クロスエントロピー損失を用いてエンドツーエンドで全フレームワークを訓練し、複数のデータセットで平均平均精度(mAP)と正答率を評価する。

実験結果

リサーチクエスチョン

  • RQ1カメラの運動の一貫性を活用することで、バスケットボール動画の混合オプティカルフローからグローバルおよびローカルな運動パターンを効果的に分離できるか?
  • RQ2分離された運動パターンとキービジュアル情報の統合は、運動または外見のみを用いる場合と比較して、意味的イベント認識性能をどのように向上させるか?
  • RQ3本手法は、カメラ設定や視覚的条件が異なるデータセット(例:NCAA 対 NBA/CBA)間でどの程度一般化可能か?
  • RQ4KVI特徴(例:ネットの動き、ボールの進入)は、チームスポーツにおけるスコアリング結果予測にどの程度寄与するか?
  • RQ5クリーネッカー積は、運動ベースのグループ行動認識と外見ベースの結果予測を効果的に統合し、統合的なイベント分類を可能にするか?

主な発見

  • 本手法はNBA/CBAデータセットでmAP 0.609、正答率 0.506を達成し、GCMP手法をmAPで16.7ポイント、正答率で8.9ポイント上回った。
  • NCAAデータセットでは、mAP 0.506、正答率 0.417を達成し、最先端の性能を示しており、優れた認識能力を実証した。
  • スティールイベントでは特に優れた性能(mAP: 0.909)を示し、選手の運動の急激な戦術的逆転を効果的に検出できることを示した。
  • フリースローおよびスラムダンクイベントの性能は低かった(mAP: 0.286 および 0.000 であり、主に訓練データが限られており、カテゴリ間で類似した運動パターンがあるため)。
  • Titan X GPU上での全パイプラインの実行時間は、1動画クリップあたり約41.8 msであり、リアルタイム推論が可能であることを示した。
  • アブレーションスタディにより、運動の分離が複雑なシーンにおける認識性能の向上に顕著に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。