Skip to main content
QUICK REVIEW

[論文レビュー] Motion Guided 3D Pose Estimation from Videos

Jingbo Wang, Sijie Yan|arXiv (Cornell University)|Apr 29, 2020
Human Pose and Action Recognition参考文献 43被引用数 10
ひとこと要約

本論文は、2D動画シーケンスからの単眼3次元人体ポーズ推定のため、動き損失関数とU字型グラフ畳み込みネットワーク(UGCN)を提案する。ペアワイズの動き符号化を用いてキーポoinの動きをモデル化することで、時間的整合性と精度が向上し、Human3.6MとMPI-INF-3DHPでそれぞれ25.6 mm MPJPEおよび68.1 mm MPJPEという最先端の性能を達成した。

ABSTRACT

We propose a new loss function, called motion loss, for the problem of monocular 3D Human pose estimation from 2D pose. In computing motion loss, a simple yet effective representation for keypoint motion, called pairwise motion encoding, is introduced. We design a new graph convolutional network architecture, U-shaped GCN (UGCN). It captures both short-term and long-term motion information to fully leverage the additional supervision from the motion loss. We experiment training UGCN with the motion loss on two large scale benchmarks: Human3.6M and MPI-INF-3DHP. Our model surpasses other state-of-the-art models by a large margin. It also demonstrates strong capacity in producing smooth 3D sequences and recovering keypoint motion.

研究の動機と目的

  • 標準的なミンコフスキー距離損失が3次元ポーズ推定の際の時間的動き構造を捉えることの限界を解消すること。
  • 明示的な動きダイナミクスのモデル化により、予測された3次元ポーズシーケンスの滑らかさと自然さを向上させること。
  • ポーズシーケンス内の短期的および長期的時間的依存関係を捉えることができるディープラーニングアーキテクチャの設計。
  • 動きに基づく監視が、標準的な3次元位置損失を上回る3次元ポーズ推定精度を著しく向上させることの実証。
  • 2次元ポーズ入力からの動画ベースの3次元人体ポーズ推定のための新しいベンチマークの確立。

提案手法

  • 異なる可微分なペアワイズ動き符号化表現を用いて、予測されたキーポイントの動き軌跡と真値の類似度を評価する、新規の動き損失関数を導入。
  • 動き符号化を、時間間隔を変化させた2D/3Dキーポイント位置間のペアワイズベクトル(例:差分による)の連結として定義し、マルチスケールの動きダイナミクスを捉える。
  • U-NetにインspiredされたU字型GCN(UGCN)アーキテクチャを提案。長距離の時間的依存関係をモデル化するとともに、3次元ポーズシーケンスにおける細かい動きの詳細を保持する。
  • 時間的整合性の向上を図るため、標準的な3次元キーポイント回帰(ℓ2損失)と提案された動き損失を組み合わせたマルチタスク損失を用いてUGCNモデルを訓練。
  • モノクローラル動画からのエンドツーエンド学習を可能にするために、最先端の検出器(例:CPN、HR-Net)から得られる2Dポーズシーケンスをモデルの入力として使用。
  • 骨格の運動学的関係をモデル化するためのグラフ畳み込みネットワークを採用。学習可能な重みは、可微分な動き符号化を介してバックプロパゲーションにより更新される。

実験結果

リサーチクエスチョン

  • RQ1新規の損失関数による明示的な動きモデリングが、単眼動画推定における3次元ポーズシーケンスの時間的整合性を向上させることができるか?
  • RQ2標準的なℓ2/ℓ1損失と比較して、提案された動き損失は3次元ポーズ精度およびシーケンスの滑らかさにおいてどのように優れているか?
  • RQ3U字型GCNアーキテクチャは、3次元ポーズシーケンスにおける短期的および長期的動き依存関係を効果的に捉えることができるか?
  • RQ4動きに基づく監視は、予測されたポーズシーケンスにおける速度誤差をどの程度低減させ、自然な動きを改善するか?
  • RQ5動き損失とUGCNの組み合わせは、標準ベンチマークで既存の最先端手法を上回る性能を示すか?

主な発見

  • グランドトゥルースの2Dポーズを用いた場合、Human3.6MでProtocol 2において25.6 mm MPJPEを達成し、すべての先行手法を上回った。
  • 動き損失を導入したことで、MPJVEが32%(3.4 mmから2.3 mm)低下し、著しく向上した動きの滑らかさが確認された。
  • MPI-INF-3DHPでは86.9 PCK、62.1 AUC、68.1 mm MPJPEを達成し、新たな最先端性能を樹立した。
  • 複雑な動作や大規模な動きの可視化による定性的な評価から、動き損失がポーズシーケンスの品質を顕著に向上させたことが示された。
  • UGCNアーキテクチャに動き損失を組み合わせることで、特に高速かつ複雑な動きシーケンスの処理において、より優れた一般化性能とロバスト性を示した。
  • アブレーションスタディにより、動き損失自体が性能向上に寄与することが確認され、UGCNと組み合わせた場合が全指標で最良の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。