Skip to main content
QUICK REVIEW

[論文レビュー] Generating Multiple Hypotheses for 3D Human Pose Estimation with Mixture Density Network

Chen Li, Gim Hee Lee|arXiv (Cornell University)|Apr 11, 2019
Human Pose and Action Recognition参考文献 29被引用数 21
ひとこと要約

本論文では、モノクローラルな3次元ポーズ推定における奥行きの曖昧さや隠蔽を解消するため、2次元関節入力から複数の幾何学的に妥当な3次元人体ポーズの仮説を生成する混合密度ネットワーク(MDN)を提案する。3次元ポーズ分布をガウス混合でモデル化することで、入力2次元関節に正確に再投影可能な複数の整合性のある仮説を生成し、Human3.6Mで最先端の性能を達成するとともに、MPIIおよびMPI-INF-3DHPデータセットでも優れた汎化性能を示す。

ABSTRACT

3D human pose estimation from a monocular image or 2D joints is an ill-posed problem because of depth ambiguity and occluded joints. We argue that 3D human pose estimation from a monocular input is an inverse problem where multiple feasible solutions can exist. In this paper, we propose a novel approach to generate multiple feasible hypotheses of the 3D pose from 2D joints.In contrast to existing deep learning approaches which minimize a mean square error based on an unimodal Gaussian distribution, our method is able to generate multiple feasible hypotheses of 3D pose based on a multimodal mixture density networks. Our experiments show that the 3D poses estimated by our approach from an input of 2D joints are consistent in 2D reprojections, which supports our argument that multiple solutions exist for the 2D-to-3D inverse problem. Furthermore, we show state-of-the-art performance on the Human3.6M dataset in both best hypothesis and multi-view settings, and we demonstrate the generalization capacity of our model by testing on the MPII and MPI-INF-3DHP datasets. Our code is available at the project website.

研究の動機と目的

  • モノクローラル画像または2次元関節からの3次元人体ポーズ推定における固有の曖昧さに対処すること。これは、複数の3次元ポーズが同じ2次元関節配置に投影される可能性があるためである。
  • 単一推定アプローチに代えて、単一のガウス分布を仮定する最小二乗誤差最小化を行う手法から脱却すること。このような手法は過学習を引き起こし、不確実性を適切に捉えられないことがある。
  • 混合密度ネットワーク(MDN)を用いて、妥当な3次元ポーズの多モーダルな性質をモデル化し、複数の整合性のある仮説を生成すること。
  • 3次元ポーズの不確実性を学習した分布を用いることで、未学習のドメインや困難なポーズ(例:隠蔽された関節)への汎化性能を向上させること。
  • ベンチマークデータセットにおいて、ベスト仮説およびマルチビュー設定の両方で最先端の性能を示すこと。

提案手法

  • 本手法は2段階のフレームワークを採用する。まず2次元ポーズ推定器が入力関節を提供し、その後に混合密度ネットワーク(MDN)に基づく3次元ポーズ仮説生成器が処理を行う。
  • MDNは3次元ポーズ分布をM個のガウスカーネルの混合としてモデル化し、各カーネルの混合係数、平均、分散を出力する。
  • ネットワークはガウス混合分布の負の対数尤度を最小化することで学習され、単一のガウス分布を仮定する回帰手法よりも多モーダルな不確実性をより適切に捉える。
  • 混合係数にディリクレ共役事前分布を適用することで、特に珍しいまたは曖昧なポーズにおいて1つのガウスカーネルに過学習するのを防ぐ。
  • 3次元ポーズ仮説はM個のガウスカーネルの平均として生成され、それらの2次元再投影が入力2次元関節と整合的かどうかを評価する。
  • 線形層に非線形活性化関数を用いたエンドツーエンドの学習が行われ、トレーニング中に追加の2次元整合性制約は課さない。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、同一の2次元関節入力に対して、3次元再構成問題の固有の曖昧性を反映した複数の妥当な3次元人体ポーズ仮説を生成できるか?
  • RQ23次元ポーズ分布を混合ガウス(MDN)としてモデル化することで、単一モードの回帰と最小二乗誤差を用いた手法に比べ、性能と不確実性推定が向上するか?
  • RQ3本手法は、3Dトレーニングラベルを含まないデータセット(例:MPII、MPI-INF-3DHP)に対しても十分に汎化できるか?
  • RQ4明示的な2次元整合性損失を課さない状況でも、生成された仮説の2次元再投影がどれほど整合的であるか?
  • RQ5ディリクレ事前分布の導入により、'SittingDown' や 'GettingDown' のようなレアまたは曖昧なポーズに対するロバストネスがどの程度向上するか?

主な発見

  • 提案手法であるMDNベースのアプローチは、Human3.6Mデータセットにおいて、ベスト仮説およびマルチビュー設定の両方で最先端の性能を達成した。
  • モデルが生成する3次元ポーズ仮説は2次元再投影において極めて整合的であり、PCKh@0.5スコアが1.0に近い値を示しており、すべての仮説が入力2次元関節にほぼ同一に再投影されることを示している。
  • 3Dトレーニングデータを一切使用しないMPIIおよびMPI-INF-3DHPデータセットにおいても、モデルは良好な汎化性能を示し、3DPCKスコアは同じデータで学習されたモデルと比較してわずかに低いが同等の水準であった。
  • アブレーションスタディの結果、M=5個のガウスカーネルが性能と計算コストの最良のトレードオフを提供しており、M>5では性能が頭打ちになることが分かった。
  • ディリクレ事前分布の導入により、'Sitting' や 'SittingDown' のような困難なポーズにおける性能が顕著に向上し、トレーニングデータに多い「立っている」ポーズに過学習するのを抑制した。
  • モデルは曖昧なポーズ(例:'GettingDown'、'SittingDown')に対してのみ明確に異なる仮説を生成するが、単純なポーズ(例:'Standing')では類似した仮説が得られる。これは、モデルが不確実性を適切に捉えていることを裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。