Skip to main content
QUICK REVIEW

[論文レビュー] Self-Learning for Player Localization in Sports Video

Kenji Okuma, David Lowe|arXiv (Cornell University)|Jul 27, 2013
Human Pose and Action Recognition参考文献 2被引用数 10
ひとこと要約

本論文では、外観、動き、フィールドの色の手がかりを用いて、スポーツ動画内で追加のプレイヤーラベルを自動で発見する自己学習フレームワークを提案する。初期ラベルが最小限でも、検出性能を顕著に向上させる。高信頼度の誤検出(false negatives)およびフィールドセグメンテーション領域を繰り返し再訓練することで、わずか5枚のラベル付き画像でさえも、平均精度を20%以上向上させる。

ABSTRACT

This paper introduces a novel self-learning framework that automates the label acquisition process for improving models for detecting players in broadcast footage of sports games. Unlike most previous self-learning approaches for improving appearance-based object detectors from videos, we allow an unknown, unconstrained number of target objects in a more generalized video sequence with non-static camera views. Our self-learning approach uses a latent SVM learning algorithm and deformable part models to represent the shape and colour information of players, constraining their motions, and learns the colour of the playing field by a gentle Adaboost algorithm. We combine those image cues and discover additional labels automatically from unlabelled data. In our experiments, our approach exploits both labelled and unlabelled data in sparsely labelled videos of sports games, providing a mean performance improvement of over 20% in the average precision for detecting sports players and improved tracking, when videos contain very few labelled images.

研究の動機と目的

  • スポーツ動画のオブジェクト検出における手作業ラベリングの高コストを低減するため、ラベル取得を自動化すること。
  • 静的でないカメラと動くプレイヤーの数が不明な放送映像において、プレイヤー検出性能を向上させること。
  • 手作業による再ラベリングを必要とせず、ラベル付きおよびラベルなしデータを両方活用する自己学習フレームワークを開発すること。
  • 動きの制約とプレー場のセグメンテーションを用いて、完全に自動でラベルを発見し、人為的ラベルデータへの依存を減らすこと。

提案手法

  • フレームワークは、プレイヤーの形状と色を表現するため、可変部分モデル(DPM)を用いた潜在的SVMを用いる。動きの制約を組み込んで、ラベル発見を支援する。
  • 動きの制約を用いて、プレー場の色を学習するための穏やかなAdaboostアルゴリズムを適用し、候補検出における誤検出を低減する。
  • データ選択アルゴリズムにより、最も情報量の多い未ラベル付きフレーム(特に最も信頼度が高く、最も低い信頼度の検出)を特定し、反復的なモデル再訓練を実施する。
  • 新しく発見されたラベルを用いて検出器を繰り返し再訓練することで、時間の経過とともに検出の信頼性と局所化の正確性が向上する。
  • フレーム間での動きの一貫性を用いて、初期に検出されなかったプレイヤーの候補検出を検証する。特に、検出器が初期に見逃したプレイヤーに対して有効である。
  • プレイヤーのスケールの平均と標準偏差に基づくサイズの事前知識を用いて、計算の探索空間を制限し、推論を高速化する。

実験結果

リサーチクエスチョン

  • RQ1初期にわずか数フレームのラベル付きデータしか与えられていない状況で、自己学習フレームワークが未ラベル付きスポーツ動画データから有用なラベルを自動で発見できるか?
  • RQ2動きの制約とフィールド色セグメンテーションは、静的でないカメラの映像において、自己生成ラベルの信頼性をどのように向上させられるか?
  • RQ3トレーニングデータが極めてスパarsな状況下で、自己学習はプレイヤー検出性能をどの程度向上させられるか?
  • RQ4本手法は、1フレームあたりのプレイヤー数が不明で制約のない動画にも一般化可能か?

主な発見

  • わずか5枚のラベル付き画像で初期トレーニングを行った場合でも、スポーツ動画データセットにおけるプレイヤー検出の平均精度が20%以上向上した。
  • 4回の自己学習反復後、ホッケー動画シーケンスの平均精度は0.55から0.67に上昇し、一貫した改善が確認された。
  • 動きの一貫性とフィールドセグメンテーションを活用することで、複雑なシーンにおいても誤検出(false negatives)を効果的に発見・是正した。
  • フィールド色セグメンテーションの導入により、誤検出の発生が顕著に減少し、自己生成ラベルの信頼性が向上した。
  • フレームワークはホッケーとバスケットボールの両方の動画で頑健な性能を示し、より良い検出入力のおかげでトラッキング結果も改善された。
  • 計算コストに関しては、8コアのマシンで約4日間のCPU時間を要したが、その80%以上が検出推論とモデル再訓練に費やされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。