Skip to main content
QUICK REVIEW

[論文レビュー] Cross View Fusion for 3D Human Pose Estimation

Haibo Qiu, Chunyu Wang|arXiv (Cornell University)|Sep 3, 2019
Human Pose and Action Recognition参考文献 23被引用数 10
ひとこと要約

本稿では、複数視点の画像から絶対的3次元人体ポーズ推定を実現する2段階アプローチを提案する。畳み込みニューラルネットワーク(CNN)を用いて視点間の特徴を統合し、2次元ポーズ推定を向上させるとともに、再帰的ペイントチャーブ・ストラクチャーモデル(RPSM)を用いて計算コストを低く抑えながら3次元ポーズを精緻化する。本手法は、H36Mで26 mmの平均関節位置誤差(MPJPE)、Total Captureで29 mmのMPJPEを達成し、従来手法よりも50%以上の誤差低減を実現し、最先端の性能を達成した。

ABSTRACT

We present an approach to recover absolute 3D human poses from multi-view images by incorporating multi-view geometric priors in our model. It consists of two separate steps: (1) estimating the 2D poses in multi-view images and (2) recovering the 3D poses from the multi-view 2D poses. First, we introduce a cross-view fusion scheme into CNN to jointly estimate 2D poses for multiple views. Consequently, the 2D pose estimation for each view already benefits from other views. Second, we present a recursive Pictorial Structure Model to recover the 3D pose from the multi-view 2D poses. It gradually improves the accuracy of 3D pose with affordable computational cost. We test our method on two public datasets H36M and Total Capture. The Mean Per Joint Position Errors on the two datasets are 26mm and 29mm, which outperforms the state-of-the-arts remarkably (26mm vs 52mm, 29mm vs 35mm). Our code is released at \url{https://github.com/microsoft/multiview-human-pose-estimation-pytorch}.

研究の動機と目的

  • 複数視点のキャリブレーション済み画像から、ワールド座標系における絶対的3次元人体ポーズを推定すること。
  • 遮蔽や運動歪みの影響で2次元ポーズ推定が不正確になる状況において、複数視点の幾何的整合性を活用して精度を向上させること。
  • 従来のペイントチャーブ・ストラクチャーモデル(PSM)と比較して、量子化誤差と計算コストを低減すること。
  • 手動アノテーションを一切用いずに、新しいカメラセットアップに一般化可能な手法を開発すること。

提案手法

  • 複数視点の2次元ポーズを同時に推定するために、視点間の特徴を統合するクロスビュー融合CNNを用いる。視点間の特徴相互作用により、精度が向上する。
  • 融合ネットワークは、中間監督を必要とせず、任意の2次元ポーズ推定器とエンドツーエンドで統合可能である。
  • 3次元ポーズを回帰するために、再帰的ペイントチャーブ・ストラクチャーモデル(RPSM)を提案する。RPSMは、前回の推定値の周囲で段階的に細分化されたグリッド上で関節位置を繰り返し精緻化する。
  • RPSMは1イテレーションあたりのグリッドサイズを小さく(例:N=8)することで、全空間の離散化と比較して推論コストを低減する。
  • 投影誤差を最小化するとともに、関節間の空間的制約構造を強制することで、最適化を実現する。
  • 本手法はエンドツーエンドで学習可能であり、既存の2次元ポーズ推定器と組み合わせて利用可能である。

実験結果

リサーチクエスチョン

  • RQ1遮蔽やぼやけの影響を受ける状況下でも、視点間特徴統合により2次元ポーズ推定の精度が向上するか?
  • RQ2再帰的精緻化戦略により、3次元ポーズ推定における量子化誤差を低減しつつ、計算効率を維持できるか?
  • RQ3公開ベンチマーク上での3次元ポーズ精度において、本手法は最先端の手法と比較してどのように優れているか?
  • RQ4手動アノテーションを一切用いずに、擬似ラベルデータのみで新しいカメラセットアップに一般化可能か?

主な発見

  • 提案手法はH36Mデータセットで26 mmの平均関節位置誤差(MPJPE)を達成し、従来の最先端手法(52 mm)を50%以上も上回る誤差低減を実現した。
  • Total Captureデータセットでは29 mmのMPJPEを達成し、前回最良手法(35 mm)と比較して17%の誤差低減を達成した。
  • 視点間統合により、H36Mにおける2次元ポーズ検出率が89%から96%に向上し、特に手首などの困難な関節で顕著な向上が見られた。
  • RPSMにおける再帰的精緻化により、標準的なPSMと比較して3次元ポーズ誤差が50%以上低減されたが、推論時間の増加は最小限に抑えられた。
  • 新しいカメラセットアップへの一般化性能が優れており、MPIIからの擬似ラベルデータのみを用いて、H36MでのMPJPEを109 mmから43 mmにまで低減した。
  • 統合モジュールが顕著な性能向上をもたらしたことが、H36Mで単一視点RPSMでは41 mmのMPJPE、融合RPSMでは29 mmのMPJPEを達成したことで裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。