Skip to main content
QUICK REVIEW

[論文レビュー] SPIN: A High Speed, High Resolution Vision Dataset for Tracking and Action Recognition in Ping Pong

Steven L. Schwarcz, Peng Xu|arXiv (Cornell University)|Dec 13, 2019
Human Pose and Action Recognition参考文献 43被引用数 5
ひとこと要約

本稿では、ピンポン球の動きを追跡するための高精度な球の軌道、人体のポーズ、スピンのラベルを備えた、150 fpsの高速で高解像度のステレオ動画データセット「SPIN」を紹介する。本稿では、オンライン推論タスクで優れた性能を示す新規のゲート付き再帰型アーキテクチャを提案し、マルチタスク学習がスピン分類を向上させることを示した。また、物理モデルに依存しない観測データから、スピンに起因する軌道のクラスタが3つに分かれることを明らかにした。

ABSTRACT

We introduce a new high resolution, high frame rate stereo video dataset, which we call SPIN, for tracking and action recognition in the game of ping pong. The corpus consists of ping pong play with three main annotation streams that can be used to learn tracking and action recognition models -- tracking of the ping pong ball and poses of humans in the videos and the spin of the ball being hit by humans. The training corpus consists of 53 hours of data with labels derived from previous models in a semi-supervised method. The testing corpus contains 1 hour of data with the same information, except that crowd compute was used to obtain human annotations of the ball position, from which ball spin has been derived. Along with the dataset we introduce several baseline models that were trained on this data. The models were specifically chosen to be able to perform inference at the same rate as the images are generated -- specifically 150 fps. We explore the advantages of multi-task training on this data, and also show interesting properties of ping pong ball trajectories that are derived from our observational data, rather than from prior physics models. To our knowledge this is the first large scale dataset of ping pong; we offer it to the community as a rich dataset that can be used for a large variety of machine learning and vision tasks such as tracking, pose estimation, semi-supervised and unsupervised learning and generative modeling.

研究の動機と目的

  • 高速で高解像度のステレオ動画を用いて、スポーツにおける高速移動物体と人体の動作を高精度に研究するための大規模かつ高忠実度のデータセットを構築すること。
  • データ収集速度と同等の150 fpsで動作するリアルタイムのオンライン推論モデルを可能にすること。
  • ピンポン球の軌道、人体ポーズ、スピンタイプの共同予測を目的としたマルチタスク学習の探求。
  • 物理的仮定に依存しない観測データから、ピンポン球の運動の実証的ダイナミクスを解明すること。
  • 高速スポーツにおける追跡、ポーズ推定、アクション認識のためのベンチマークデータセットとベースラインモデルの提供。

提案手法

  • SPINデータセットは、150 fps(1024×1280解像度)のステレオ動画を合計53時間分収録しており、ボールの位置、人体ポーズ、スピンのラベルは、事前学習済みモデルを用いた半教師付きの方法で取得された。
  • スピンラベルは直接的なラベリングではなく、真値のボール軌道から計算されており、正確なスピン分類を可能にしている。
  • ベースラインモデルには、新規のゲート付き再帰型アーキテクチャ(Conv-Gated-Sigmoid)、畳み込み層を備えたLSTM、および1フレームごとの畳み込みモデルが含まれる。
  • モデルはマルチタスク学習で訓練され、ボール追跡、ポーズ推定、スピン分類の損失が重み係数3を用いて統合されている。
  • リアルタイム性能を最適化するため、GPU負荷を軽減するためのBayerパターン入力を採用し、1対のステレオ画像あたり6.6 ms(約150 fps)を達成している。
  • 訓練および評価のため、データセットは「SPIN-OR」(オンライン再構築)と「SPIN-ALL」(完全に人手でラベル付けされた)に分割されている。

実験結果

リサーチクエスチョン

  • RQ1高速で高解像度のステレオデータセットは、ピンポン球のような高速スポーツにおける正確なリアルタイム追跡とアクション認識を可能にするか?
  • RQ2ボール軌道、人体ポーズ、スピンタイプの共同予測を伴うマルチタスク学習は、モデル性能をどのように向上させるか?
  • RQ3物理モデルに依存しない観測データから得られるピンポン球の運動に、どのような実証的パターンが現れるか?
  • RQ4ゲート付きアーキテクチャを用いた再帰的モデリングは、非再帰的または標準LSTMアーキテクチャに比べ、ボールの運動とスピン予測で優れた性能を示すか?
  • RQ5人体ポーズ情報はスピン分類をどの程度向上させるか?また、スピン予測はポーズ推定に恩恵をもたらすか?

主な発見

  • 提案されたゲート付き再帰型アーキテクチャは、標準LSTMおよび1フレームモデルを上回り、特に2ピクセルの精度閾値でボール追跡性能が優れている。
  • 1フレームモデルは2ピクセル精度で驚くほど良好な性能を示しており、これは訓練速度の速さによるものと考えられるが、5ピクセルの許容誤差では再帰型モデルに劣り、誤検出の抑制が優れていることが示された。
  • マルチタスク学習では、ポーズを補助タスクとして用いることでスピン分類が向上するが、ボール追跡はスピン予測に追加の利益をもたらさない。
  • ポーズ推定は、スピンやボール追跡と同時に訓練した場合に最も良好な性能を示すが、それ以外の場合は性能が低下し、タスク干渉の兆候が見られた。
  • 「SPIN-ALL」の分割は、全タスクにおいて顕著な性能向上をもたらし、高品質な人手ラベルデータがモデルの一般化性能を向上させることを示している。
  • 観測データから、スピンの強さに応じたボール軌道のクラスタが3つに分かれていることが明らかになったが、これは従来の物理モデルでは予測されていなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。