Skip to main content
QUICK REVIEW

[論文レビュー] TrackNet: A Deep Learning Network for Tracking High-speed and Tiny Objects in Sports Applications

Yu-Chuan Huang, I-No Liao|arXiv (Cornell University)|Jul 8, 2019
Video Analysis and Summarization参考文献 23被引用数 8
ひとこと要約

TrackNet は、複数の連続フレームを用いて、放送映像における高速で小さなスポーツ用ボール(テニスやバドミントンボールなど)を追跡する深層学習ベースのヒートマップネットワークである。軌道に配慮した特徴抽出とデコンボリューションによるアップサンプリングにより、正確な局所化が可能であり、テニス追跡では 98.5% の F1 スコア、バドミントン追跡では 68.7% の F1 スコアを達成し、従来の画像処理手法を大きく上回っている。

ABSTRACT

Ball trajectory data are one of the most fundamental and useful information in the evaluation of players' performance and analysis of game strategies. Although vision-based object tracking techniques have been developed to analyze sport competition videos, it is still challenging to recognize and position a high-speed and tiny ball accurately. In this paper, we develop a deep learning network, called TrackNet, to track the tennis ball from broadcast videos in which the ball images are small, blurry, and sometimes with afterimage tracks or even invisible. The proposed heatmap-based deep learning network is trained to not only recognize the ball image from a single frame but also learn flying patterns from consecutive frames. TrackNet takes images with a size of $640 imes360$ to generate a detection heatmap from either a single frame or several consecutive frames to position the ball and can achieve high precision even on public domain videos. The network is evaluated on the video of the men's singles final at the 2017 Summer Universiade, which is available on YouTube. The precision, recall, and F1-measure of TrackNet reach $99.7\%$, $97.3\%$, and $98.5\%$, respectively. To prevent overfitting, 9 additional videos are partially labeled together with a subset from the previous dataset to implement 10-fold cross-validation, and the precision, recall, and F1-measure are $95.3\%$, $75.7\%$, and $84.3\%$, respectively. A conventional image processing algorithm is also implemented to compare with TrackNet. Our experiments indicate that TrackNet outperforms conventional method by a big margin and achieves exceptional ball tracking performance. The dataset and demo video are available at https://nol.cs.nctu.edu.tw/ndo3je6av9/.

研究の動機と目的

  • 低解像度の放送映像における高速で小さなぼやけたスポーツボールの追跡という課題に対処すること。
  • 連続フレームからの時間的文脈を活用した深層学習により、従来の画像処理手法をはるかに上回る追跡精度を実現すること。
  • アマチュアおよびプロのスポーツ応用分野におけるボール軌道データ収集のためのスケーラブルで低コストなソリューションを開発すること。
  • 実際のテニスおよびバドミントン映像(異なるオブジェクト速度と視覚的品質を有する)を用いて、モデルの性能を評価すること。
  • 類似スポーツ(テニス vs. バドミントン)間での転移学習の可能性を検討し、速度および視覚的差異に起因する性能制限要因を同定すること。

提案手法

  • TrackNet は、入力画像から特徴を抽出するために VGG-16 バックボーンを用いる。単一フレームまたは複数の連続フレームを処理する。
  • ネットワークは、特徴マップをアップサンプリングしてオブジェクト局所化のためのヒートマップを生成するためのデコンボリューション層を備えた完全畳み込みネットワーク(FCN)アーキテクチャを採用する。
  • 入力フレームは 640×360 ピクセルにリサイズされ、ピーク位置がボール位置に対応するヒートマップを予測する。
  • 予測されたボール座標と正解座標の距離を最小化するため、ヒートマップ回帰損失を用いてエンドツーエンドでモデルを訓練する。
  • 時間的モデリングのため、複数の連続フレームを入力として用い、動きのパターンを学習し、ぼやけや隠蔽に対する耐性を高める。
  • 転移学習として、テニスで学習したモデルをバドミントンデータで微調整することで、異種スポーツ間での汎化性能を評価する。
Figure 1: Convolution operation in deep learning networks.
Figure 1: Convolution operation in deep learning networks.

実験結果

リサーチクエスチョン

  • RQ1高フレームレートや高解像度映像を必要とせずに、標準的な放送映像において高速で小さなぼやけたスポーツボールを深層学習モデルが効果的に追跡できるか?
  • RQ2単一フレーム推論と比較して、複数の連続フレームを用いることで、正確度、再現度、F1 スコアの観点で追跡性能がどのように向上するか?
  • RQ3ボールの速度、サイズ、軌道ダイナミクスの違いを考慮すると、テニスデータで学習したモデルがバドミントン追跡にどの程度一般化できるか?
  • RQ4非常に高速な物体(例:バドミントン)に適用した場合、モデルの性能にどのような制限があり、高い偽陰性率を引き起こす要因は何か?
  • RQ5複雑な現実世界のスポーツ映像環境において、ヒートマップベースの深層学習手法が従来のルールベース画像処理手法を上回ることができるか?

主な発見

  • 10 フォールド交差検証を用いた単一フレーム入力のテニス映像データセットにおいて、TrackNet は正確度 99.7%、再現度 97.3%、F1 メジャー 98.5% を達成した。
  • より挑戦的で部分的にラベル付けされたデータセットを 10 フォールド交差検証で評価した結果、TrackNet は正確度 95.3%、再現度 75.7%、F1 メジャー 84.3% を維持した。
  • テニスデータで学習したモデル(TrackNet-Tennis)はバドミントンでは性能が著しく低く、偽陰性率が高く、F1 メジャーはたった 35.2% にとどまり、一般化性能が低いことが示された。
  • バドミントンデータで微調整したモデル(TrackNet-Badminton)は、正確度 85.0%、再現度 57.7%、F1 メジャー 68.7% を達成し、ドメイン特化型の学習が性能向上に顕著に寄与することがわかった。
  • テニスとバドミントンの追跡性能の差は、バドミントンの平均速度が 417 km/h(テニスの 253 km/h と比較)であり、速度の変動が著しいことによる視覚的品質の低下とモデルの一般化性能の低下に起因していると特定された。
  • TrackNet は従来の画像処理アルゴリズムを大きく上回り、時間的文脈を活用した深層学習が高速で小さな物体の追跡に優れていることを実証した。
Figure 2: The ball image is hardly visible.
Figure 2: The ball image is hardly visible.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。