Skip to main content
QUICK REVIEW

[論文レビュー] DeepSportLab: a Unified Framework for Ball Detection, Player Instance Segmentation and Pose Estimation in Team Sports Scenes

Seyed Abolfazl Ghasemzadeh, Gabriel Van Zandycke|arXiv (Cornell University)|Dec 1, 2021
Sports Analytics and Performance被引用数 6
ひとこと要約

DeepSportLabは、1つの畳み込みニューラルネットワーク(CNN)を用いて、チームスポーツにおけるボール検出、プレイヤーインスタンスセグメンテーション、および人体ポーズ推定を統合的に実行する包括的なディーブラーニングフレームワークを提案する。パーツ強度マップと空間埋め込みを活用することで、DeepSportバスケットボールデータセットにおいて最先端の性能を達成し、共有特徴抽出と軽量なデコード手法により計算コストを低減しながら、個別のモデルを上回る性能を発揮する。

ABSTRACT

This paper presents a unified framework to (i) locate the ball, (ii) predict the pose, and (iii) segment the instance mask of players in team sports scenes. Those problems are of high interest in automated sports analytics, production, and broadcast. A common practice is to individually solve each problem by exploiting universal state-of-the-art models, \\eg, Panoptic-DeepLab for player segmentation. In addition to the increased complexity resulting from the multiplication of single-task models, the use of the off-the-shelf models also impedes the performance due to the complexity and specificity of the team sports scenes, such as strong occlusion and motion blur. To circumvent those limitations, our paper proposes to train a single model that simultaneously predicts the ball and the player mask and pose by combining the part intensity fields and the spatial embeddings principles. Part intensity fields provide the ball and player location, as well as player joints location. Spatial embeddings are then exploited to associate player instance pixels to their respective player center, but also to group player joints into skeletons. We demonstrate the effectiveness of the proposed model on the DeepSport basketball dataset, achieving comparable performance to the SoA models addressing each individual task separately.

研究の動機と目的

  • 複雑なチームスポーツのシーンにおいて、市販のモデルを用いたボール検出、プレイヤーセグメンテーション、ポーズ推定の限界を解消すること。
  • 3つの関連タスクを1つの共有ディーブラーニングフレームワークに統合することで、計算コストを低減し、性能を向上させること。
  • 屋内スポーツにおける隠蔽、運動ブレ、低コントラストといった課題を、スポーツ固有のデータセットで学習することで克服すること。
  • 共同学習がインスタンスセグメンテーションおよびポーズ推定の性能を向上させることを示し、ボール検出の精度を競合可能な水準で維持すること。
  • リアルタイムのスポーツ放送およびアナリティクスアプリケーションに適した軽量でデプロイ可能なソリューションを提供すること。

提案手法

  • モデルは、セマンティッククラススコア、インスタンス中心への関連付けに必要なオフセットベクトル、および19種類のキーポイント(17部位、プレイヤー中心点、ボール中心点)を対象としたパーツ強度マップ(PIF)を、共有CNNバックボーンによって予測する。
  • パーツ強度マップは、各キーポイントの信頼度マップ、局所化ベクトル、スケールパラメータを提供し、ボールおよび身体部位の高分解能検出を可能にする。
  • 空間埋め込みを用いて、ピixeをそのインスタンス中心に関連付け、パーツキーポイントを一貫性のある骨格にグループ化する。この手法では、パーツアフィニティフィールド(PAFs)の使用が不要となる。
  • インスタンスセグメンテーションヘッドは、セマンティックスコア、オフセットベクトル、およびプレイヤー中心点の予測を統合し、正確なプレイヤーマスクを生成する。
  • ポーズデコードモジュールは、予測されたキーポイント信頼度マップとマスクを組み合わせて、完全なプレイヤーポーズを再構築する。一方、ボールの位置はボールキーポイントの信頼度マップから直接抽出される。
  • モデルは、COCOとDeepSportデータセットの組み合わせを用いて学習され、ボール検出およびポーズ推定の性能向上を図るべくスポーツ固有のデータでファインチューニングが行われる。

実験結果

リサーチクエスチョン

  • RQ1統合的なディーブラーニングフレームワークは、競合性能を維持しつつ、ボール検出、プレイヤーインスタンスセグメンテーション、ポーズ推定を同時に実行可能か?
  • RQ2個々のタスク用に別々に学習するのと比較して、共同学習が性能向上に寄与するか?
  • RQ3パーツ強度マップと空間埋め込みは、屋内チームスポーツのシーンにおける隠蔽や運動ブレを効果的に処理できるか?
  • RQ4パーツアフィニティフィールド(PAFs)を用いずに、空間埋め込みのみで十分にプレイヤー骨格を再構築できるか?これによりデコードの複雑さが低減されるか?
  • RQ5高精度なボール検出およびポーズ推定を達成するには、スポーツ固有のデータセットの使用がどれほど重要か?

主な発見

  • COCOとDeepSportの両方で学習した場合、DeepSportデータセットにおけるボール検出品質(bDQ)は52.07に達し、COCOでのみ学習した場合(bDQ = 23.19)に比べ顕著に優れている。
  • 共同学習のおかげでインスタンスセグメンテーションの性能が向上し、マスクAPは82.1、ARは42.4を達成した。一方、ポーズ推定ではpDQが90.1、pEQが87.5に達した。
  • 他のタスクと共同で学習させることでボール検出性能が向上し、共同学習設定ではbDQが54.72、フルマルチタスクモデルでは52.07となった。これはマルチタスク学習による一定の利点が存在することを示している。
  • 予測されたマスクを用いてキーポイントをインスタンスに割り当てるポーズデコードモジュールは、PAFベースのアプローチに比べてデコードの複雑さを低減している。
  • COCOでのみ学習した場合、ボール検出性能は著しく劣り(bDQ = 23.19)、スポーツ固有のデータセットの使用が高精度を達成するために不可欠であることを示している。
  • モデルの推論時間は1画像あたり436±106 msにまで短縮され、メモリ使用量は1757 MBに留まり、リアルタイムデプロイに実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。