Skip to main content
QUICK REVIEW

[論文レビュー] MonoCap: Monocular Human Motion Capture using a CNN Coupled with a Geometric Prior

Xiaowei Zhou, Menglong Zhu|arXiv (Cornell University)|Jan 9, 2017
Human Pose and Action Recognition参考文献 55被引用数 18
ひとこと要約

MonoCapは、EMフレームワークを介してCNNベースの2次元ポーズ推定器と幾何的3次元ポーズ事前分布を組み合わせることで、マーカーレスな単眼RGB動画からの3次元人体モーショングラフの再構成を可能にする単眼3次元人体モーションキャプチャ手法を提案する。2次元検出の不確実性をマージナライズし、時間的滑らかさを強制することで、同期された2次元-3次元アノテーションが不要な状況下でも、ベンチマークデータセットで最先端の精度を達成する。

ABSTRACT

Recovering 3D full-body human pose is a challenging problem with many applications. It has been successfully addressed by motion capture systems with body worn markers and multiple cameras. In this paper, we address the more challenging case of not only using a single camera but also not leveraging markers: going directly from 2D appearance to 3D geometry. Deep learning approaches have shown remarkable abilities to discriminatively learn 2D appearance features. The missing piece is how to integrate 2D, 3D and temporal information to recover 3D geometry and account for the uncertainties arising from the discriminative model. We introduce a novel approach that treats 2D joint locations as latent variables whose uncertainty distributions are given by a deep fully convolutional neural network. The unknown 3D poses are modeled by a sparse representation and the 3D parameter estimates are realized via an Expectation-Maximization algorithm, where it is shown that the 2D joint location uncertainties can be conveniently marginalized out during inference. Extensive evaluation on benchmark datasets shows that the proposed approach achieves greater accuracy over state-of-the-art baselines. Notably, the proposed approach does not require synchronized 2D-3D data for training and is applicable to "in-the-wild" images, which is demonstrated with the MPII dataset.

研究の動機と目的

  • マーカーや同期された2次元-3次元アノテーションが存在しない単眼RGB動画からの3次元人体ポーズ推定の課題に対処すること。
  • 2次元外観特徴、3次元幾何的事前分布、時間的整合性を統合することで、単眼3次元ポーズ回復における本質的な曖昧性を克服すること。
  • 2次元関節位置を不確実性を伴う潜在変数として扱う確率的フレームワークを構築し、遮蔽や検出誤差の影響を受けてもロバストな推論を可能にすること。
  • マーカー式やマルチカメラシステムに依存しないようにすることで、制約のない「野生の」画像への応用を可能にすること。
  • 推論中に3次元幾何的制約を活用することで、2次元ポーズ局在化の精度を向上させること。

提案手法

  • 2次元関節位置の不確実性を表すヒートマップを生成するため、深く完全畳み込みニューラルネットワーク(アワークラス構造)を用いる。
  • 学習された3次元ポーズ辞書上のスパース表現を用いて3次元人体ポーズをモデル化する。
  • 2次元検出の不確実性を3次元ポーズ推定中にマージナライズするため、推論を期待最大化(EM)アルゴリズムとして定式化する。
  • 3次元ポーズおよび視点パラメータの時間的滑らかさを強制することで、ロバストネスを向上させ、トラッキングの失敗にも耐性を付ける。
  • 2次元外観特徴(CNNから得る)と3次元幾何的事前分布(スパース表現から得る)を統合的な確率的フレームワークに統合する。
  • 予測された2次元投影と観測されたヒートマップを一致させる再構成損失を最小化することで、3次元ポーズ推定を最適化する。

実験結果

リサーチクエスチョン

  • RQ1深く畳み込みニューラルネットワークベースの2次元ポーズ推定器と3次元幾何的事前分布を効果的に組み合わせることで、単眼動画からの3次元人体ポーズ推定の精度を向上させられるか?
  • RQ22次元関節検出の不確実性は、3次元再構成中にどのようにモデル化され、マージナライズされるか?その結果、ロバストネスが向上するか?
  • RQ33次元ポーズ系列における時間的滑らかさが、再構成精度と安定性をどの程度向上させるか?
  • RQ4提案手法は、同期された2次元-3次元トレーニングデータが不要な状況下でも、制約のない「野生の」画像に一般化可能か?
  • RQ53次元幾何的事前分布を統合することで、遮蔽や外観変動の影響を受ける状況下でも、2次元キーポイント局在化の精度が向上するか?

主な発見

  • MonoCapは、Human3.6MおよびMPIIベンチマークで、既存の単眼手法を上回る最先端の3次元ポーズ推定精度を達成した。
  • 128の辞書サイズを用いたS9 'Directions'シーケンスでは、平均3次元再構成誤差を44.4 mmまで低減し、より大きな辞書サイズでさらに改善された。
  • EMベースのフレームワークは2次元検出の不確実性を効果的にマージナライズし、ヒートマップがノイズが多い場合や不正確であっても、より正確な3次元ポーズ推定を可能にした。
  • 時間的滑らかさ制約は、ドリフトの低減とフレーム間の一貫性の向上により、ロバストネスを顕著に向上させた。
  • 本手法は、トレーニング時に同期された2次元-3次元アノテーションが不要な状況下でも、MPIIデータセット上で「野生の」画像に良好に一般化した。
  • 3次元事前分布の統合は、3次元再構成の精度向上に加え、2次元キーポイント局在化の精度向上にも寄与し、2次元と3次元モデリングの間で相互に利益をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。