Skip to main content
QUICK REVIEW

[論文レビュー] Indoor Activity Detection and Recognition for Sport Games Analysis

Georg Waltner, Thomas Mauthner|arXiv (Cornell University)|Apr 25, 2014
Human Pose and Action Recognition参考文献 14被引用数 3
ひとこと要約

本論文は、バドミントンを含む屋内スポーツにおける1人1人のアクティビティ認識のための文脈に配慮したアプローチを提案する。空間的・時間的文脈を統合するアクティビティコンテキスト(AC)記述子を用い、時間的・空間的領域にわたって選手のアクティビティ確率を集約することで、バドミントン固有のアクティビティにおける平均プレーヤー中心分類精度を1.6秒のウィンドウ内で周囲の選手からの文脈的情報を統合することで、77.56%から90.19%に向上させる。

ABSTRACT

Activity recognition in sport is an attractive field for computer vision research. Game, player and team analysis are of great interest and research topics within this field emerge with the goal of automated analysis. The very specific underlying rules of sports can be used as prior knowledge for the recognition task and present a constrained environment for evaluation. This paper describes recognition of single player activities in sport with special emphasis on volleyball. Starting from a per-frame player-centered activity recognition, we incorporate geometry and contextual information via an activity context descriptor that collects information about all player's activities over a certain timespan relative to the investigated player. The benefit of this context information on single player activity recognition is evaluated on our new real-life dataset presenting a total amount of almost 36k annotated frames containing 7 activity classes within 6 videos of professional volleyball games. Our incorporation of the contextual information improves the average player-centered classification performance of 77.56% by up to 18.35% on specific classes, proving that spatio-temporal context is an important clue for activity recognition.

研究の動機と目的

  • チームメイトからのヒントを用いた屋内スポーツにおける1人1人のアクティビティ認識の向上を目的とする。
  • 選手間の空間的・時間的関係をモデル化する新しいアクティビティコンテキスト(AC)記述子の開発を目的とする。
  • プロのバドミントン動画における文脈的情報がアクティビティ認識性能に与える影響の評価を目的とする。
  • 6試合にわたる36,000フレームのアノテート済み新規実生データセットの提供を目的とする。
  • チームレベルの文脈が、『ブロック』や『サービス』といったスポーツ固有のアクティビティ認識をどのように向上させるかを示すことを目的とする。

提案手法

  • 本手法は、外観と運動をそれぞれHOGおよびHOFを用いてフレーム単位の特徴抽出を実施し、それに加えて実世界の選手座標(RWPC)と空間的文脈(SC)記述子を統合する。
  • これらの特徴に基づいてトレーニングされたサポートベクターマシン(SVM)を用いて、選手のアクティビティを分類する。
  • アクティビティコンテキスト(AC)記述子を導入し、kフレームの時間ウィンドウ内で全選手のアクティビティ確率を集約する。
  • AC記述子は、コート平面における空間的ビンニングを用いて、ターゲット選手に対する位置的およびアクティビティ的文脈をモデル化する。
  • 性能最適化のため、750通り以上の記述子およびSVMパラメータの組み合わせを評価する。
  • AC記述子は、時間的スパン(k = 10〜100フレーム)を変化させながら適用し、最適な文脈長を特定する。

実験結果

リサーチクエスチョン

  • RQ1チームメイトからの空間的・時間的文脈を統合することで、バドミントンにおける1人1人のアクティビティ認識はどの程度向上するか?
  • RQ2アクティビティ認識における文脈集約の最適な時間ウィンドウ長は何か?
  • RQ3AC記述子は、『レセプション』と『ディフェンス/ムーブ』のような類似クラスの混同をどの程度軽減するか?
  • RQ4HOG、HOF、RWPC、SCの異なる特徴組み合わせは、認識精度にどのように影響を与えるか?
  • RQ5文脈に基づくモデリングは、『ブロック』や『サービス』といったスポーツ固有のアクティビティ認識を向上させ得るか?

主な発見

  • アクティビティコンテキスト(AC)記述子の統合により、バドミントン固有のアクティビティにおける平均分類精度が、ベースラインの1人1人認識と比較して7.20%向上した。
  • 40フレーム(1.6秒)の文脈ウィンドウで最高の全体精度90.19%が達成され、ベースラインの77.56%を上回った。
  • 『ブロック』クラスはAC記述子を用いることで97.60%の認識率を達成し、最も高い精度を記録した。『サービス』クラスも97.13%に達した。
  • 『レセプション』クラスは、文脈情報導入により18.35%の最大向上を示し、73.27%から91.62%に上昇した。これは『ディフェンス/ムーブ』との混同を解消した。
  • 一般的なクラス『スタンド』と『ディフェンス/ムーブ』は、ACを用いることで精度が低下した。これは、ランダムに発生し、一貫した時間的文脈が欠けるためである。
  • RBFおよび多項式カーネルSVMが線形およびシグモイドカーネルを上回り、特に多項式カーネルが全体で最高のパフォーマンスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。