Skip to main content
QUICK REVIEW

[論文レビュー] SportsCap: Monocular 3D Human Motion Capture and Fine-grained Understanding in Challenging Sports Videos

Xin Chen, Anqi Pang|arXiv (Cornell University)|Apr 23, 2021
Human Pose and Action Recognition参考文献 61被引用数 4
ひとこと要約

SportsCapは、運動の意味的および時間的事前知識を組み込んだ動き埋め込み空間を活用することで、困難なスポーツ動画における新しいモノクローラル3次元人体モーショントラッキングと詳細な行動理解フレームワークを提案する。3次元ポーズ推定と部分的動き属性予測の両方を同時に向上させる。両タスクにおいて最先端の性能を達成し、SMARTデータセットでは61.7%、AQAデータセットでは86.2%の精度を達成した。

ABSTRACT

Markerless motion capture and understanding of professional non-daily human movements is an important yet unsolved task, which suffers from complex motion patterns and severe self-occlusion, especially for the monocular setting. In this paper, we propose SportsCap -- the first approach for simultaneously capturing 3D human motions and understanding fine-grained actions from monocular challenging sports video input. Our approach utilizes the semantic and temporally structured sub-motion prior in the embedding space for motion capture and understanding in a data-driven multi-task manner. To enable robust capture under complex motion patterns, we propose an effective motion embedding module to recover both the implicit motion embedding and explicit 3D motion details via a corresponding mapping function as well as a sub-motion classifier. Based on such hybrid motion information, we introduce a multi-stream spatial-temporal Graph Convolutional Network(ST-GCN) to predict the fine-grained semantic action attributes, and adopt a semantic attribute mapping block to assemble various correlated action attributes into a high-level action label for the overall detailed understanding of the whole sequence, so as to enable various applications like action assessment or motion scoring. Comprehensive experiments on both public and our proposed datasets show that with a challenging monocular sports video input, our novel approach not only significantly improves the accuracy of 3D human motion capture, but also recovers accurate fine-grained semantic action attributes.

研究の動機と目的

  • 複雑なスポーツ動作を含むモノクローラル動画における正確な3次元人体モーショントラッキングと詳細な行動理解の課題に対処すること。
  • 学習された埋め込み空間内で意味的および時系列に構造化された部分的動き事前知識を活用し、深刻な自己遮蔽や深度の曖昧さに対しても耐性を高めること。
  • マルチタスク学習フレームワーク内で3次元モーショントラッキングと詳細な行動属性予測を同時に最適化すること。
  • プロのスポーツ用に豊富な2次元/3次元ポーズアノテーションと詳細な行動ラベルを備えた新しいデータセット(SMART)を構築すること。
  • 詳細な意味的モーショントラッキングを提供することで、モーショングレーディング、パフォーマンス評価、VR/AR応用の実用的応用を可能にすること。

提案手法

  • 本手法は、バランスビーム、ボクシング、ハードル走などのスポーツにおける部分的動きの妥当なポーズ多様体をモデル化するため、主成分分析(PCA)を用いた動き埋め込み空間を導入する。
  • 暗黙の動き埋め込みネットワークがフレームごとの埋め込みパラメータを推定し、マッピング関数を介して3次元モーショントラッキングの詳細を回復する。同時に、部分的動き分類器が中位の動きカテゴリを特定する。
  • マルチストリーム空間的時間的グラフ畳み込みネットワーク(ST-GCN)が、暗黙の埋め込みと明示的な3次元モーショントラッキングの両ストリームを処理し、詳細な意味的行動属性を予測する。
  • 意味的属性マッピングブロックが相関する行動属性を統合し、包括的なシーケンス理解のための高レベルの行動ラベルを生成する。
  • 部分的動き分類には交差エントロピー損失を適用し、モーショントラッキングと行動解析の両タスクを統合的に学習する。
  • 本手法は新しいデータセット(SMART)で学習され、行動理解とモーショントラッキングの両方において、SMARTおよびAQAデータセットで評価される。

実験結果

リサーチクエスチョン

  • RQ1統一されたフレームワークは、モノクローラルスポーツ動画における3次元人体モーショントラッキングと詳細な行動理解を同時に向上させることができるか?
  • RQ2学習された埋め込み空間における意味的および時系列に構造化された部分的動き事前知識は、遮蔽や深度の曖昧さに対してどのように耐性を高めるか?
  • RQ3暗黙の動き埋め込みと明示的な3次元モーショントラッキングの詳細を、どのように共同で活用して正確な行動属性予測を実現できるか?
  • RQ4マルチストリームST-GCNは、暗黙および明示的なモーショントラスティング表現を効果的にモデル化し、詳細な行動解析を可能にするか?
  • RQ5本手法は、3次元ポーズ精度と行動理解性能の両面で、最先端の手法と比較してどのように優れているか?

主な発見

  • SportsCapは、行動解析タスクにおいてSMARTデータセットで61.7%の精度を達成し、詳細な意味的行動属性予測の強力な性能を示した。
  • 本手法はAQAデータセットでも86.2%の精度を達成し、多様なスポーツ動作理解タスクへの汎用性の高さを示した。
  • 動き埋め込みモジュールは、モノクローラル環境下での深刻な自己遮蔽や深度の曖昧さに対しても、3次元モーショントラッキングの耐性を顕著に向上させた。
  • 意味的属性マッピングを備えたマルチストリームST-GCNは、相関する行動属性および高レベルの行動ラベルの正確な予測を可能にした。
  • 統合されたマルチタスク学習フレームワークにより、3次元モーショントラッキングと行動理解の両方が相互に向上し、単一タスクベースラインを上回った。
  • 失敗事例は主に未学習のポーズ、極端な遮蔽、画像の切り出しに起因しており、まれなまたは不完全な入力の処理における改善の余地があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。