Skip to main content
QUICK REVIEW

[論文レビュー] Detecting key Soccer match events to create highlights using Computer Vision

Narayana Darapaneni, Prashant Kumar|arXiv (Cornell University)|Apr 6, 2022
Video Analysis and Summarization被引用数 4
ひとこと要約

本論文では、Faster R-CNNおよびYOLOv5モデルを用いて、サッカー試合のハイライト作成のためのキーワードイベントを自動的に検出するコンピュータビジョン手法を提案する。試合映像で訓練されたFaster R-CNN(ResNet50搭載)は95.5%の正確性を達成し、23分間の試合を4分50秒のハイライトに短縮しながら、重要なイベントを保持した。

ABSTRACT

The research and data science community has been fascinated with the development of automatic systems for the detection of key events in a video. Special attention in this field is given to sports video analytics which could help in identifying key events during a match and help in preparing a strategy for the games going forward. For this paper, we have chosen Football (soccer) as a sport where we would want to create highlights for a given match video, through a computer vision model that aims to identify important events in a Soccer match to create highlights of the match. We built the models based on Faster RCNN and YoloV5 architectures and noticed that for the amount of data we used for training Faster RCNN did better than YoloV5 in detecting the events in the match though it was much slower. Within Faster RCNN using ResNet50 as a base model gave a better class accuracy of 95.5% as compared to 92% with VGG16 as base model completely outperforming YoloV5 for our training dataset. We tested with an original video of size 23 minutes and our model could reduce it to 4:50 minutes of highlights capturing almost all important events in the match.

研究の動機と目的

  • コンピュータビジョンを用いてサッカー試合映像のキーワードイベントを自動的に特定するシステムを開発すること。
  • Faster R-CNN や YOLOv5 などのオブジェクト検出モデルが、サッカー固有のイベントを検出する際の性能を評価すること。
  • 検出されたイベントに基づいて、非重要な映像を除外することで、簡潔で情報豊富なハイライトを生成すること。
  • リアルワールドのスポーツ映像要約タスクにおいて、モデルの効率性と正確性を比較すること。
  • 最小限の人的介入で深層学習を用いたスポーツハイライト生成の実現可能性を示すこと。

提案手法

  • キーワードサッカーイベント(ゴール、ファウル、レッド・イエローカードなど)をラベル付けした、独自のサッカー試合フレームデータセットを用いて、Faster R-CNN と YOLOv5 を主なオブジェクト検出アーキテクチャとして採用した。
  • Faster R-CNN における特徴抽出の影響を評価するために、バックボーンとして ResNet50 と VGG16 を使用した。
  • 予測されたバウンディングボックスの精度を向上させ、誤検出を低減するために、非最大抑制(NMS)と信頼度しきい値処理を適用した。
  • ホールドアウトテストセットを用いて、平均平均精度(mAP)と分類正確性を用いてモデルの性能を評価した。
  • 最も優れた性能を示したモデルを用いて、23分間のフルマッチ映像を処理し、4分50秒の要約ハイライトクリップを生成した。

実験結果

リサーチクエスチョン

  • RQ1Faster R-CNN と YOLOv5 は、ゴール、ファウル、カードなどのキーワードサッカー試合イベントをどれほど効果的に検出できるか?
  • RQ2バックボーンネットワークの違い(ResNet50 対 VGG16)が、サッカー映像分析における検出正確性に与える影響は何か?
  • RQ3コンピュータビジョンモデルは、全試合映像を、すべての重要なイベントを保持したまま、簡潔なハイライト映像に短縮できるか?
  • RQ4リアルタイムまたはニアリアルタイムのハイライト生成の文脈において、Faster R-CNN と YOLOv5 の推論速度はどのように比較されるか?
  • RQ5モデルアーキテクチャは、スポーツ映像要約における正確性と処理時間のバランスに、どの程度影響を与えるか?

主な発見

  • Faster R-CNN に ResNet50 をバックボーンとして使用した場合、テストセットで最高の分類正確性95.5%を達成した。
  • Faster R-CNN は、著しく遅いにもかかわらず YOLOv5 よりも検出正確性で優れており、速度と精度のトレードオフが明確に示された。
  • VGG16 をバックボーンとする Faster R-CNN は92%の正確性を達成し、ResNet50 バリエーションに比べて劣っていた。これは、より深い残差特徴の優位性を示している。
  • 最終的なモデルは、23分間のサッカー試合映像を4分50秒のハイライトに短縮し、ほぼすべてのキーワードイベントを捉えた。
  • エンドツーエンドのディープラーニングを用いて、ゴール、イエローカード・レッドカード、ファウルなど多様なイベントを安定して同定できた。
  • 結果から、最先端のオブジェクト検出モデルは、高精度でスポーツ映像要約に効果的に適応可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。