Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Reconstruct 3D Human Pose and Shape via Model-fitting in the Loop

Nikos Kolotouros, Pavlakos Georgios|arXiv (Cornell University)|Sep 27, 2019
Human Pose and Action Recognition被引用数 16
ひとこと要約

本論文では、3次元人体ポーズおよび形状推定のため、深層回帰と反復最適化を統合した自己改善型フレームワークSPINを提案する。回帰ネットワークの出力をSMPLフィッティングの初期値として用い、最適化結果を訓練中に特権的教師信号として用いることで、限られた3次元教師データでも最先端の性能を達成し、ペアドおよびアンペアドの両訓練設定において、先行手法を顕著に上回る。

ABSTRACT

Model-based human pose estimation is currently approached through two different paradigms. Optimization-based methods fit a parametric body model to 2D observations in an iterative manner, leading to accurate image-model alignments, but are often slow and sensitive to the initialization. In contrast, regression-based methods, that use a deep network to directly estimate the model parameters from pixels, tend to provide reasonable, but not pixel accurate, results while requiring huge amounts of supervision. In this work, instead of investigating which approach is better, our key insight is that the two paradigms can form a strong collaboration. A reasonable, directly regressed estimate from the network can initialize the iterative optimization making the fitting faster and more accurate. Similarly, a pixel accurate fit from iterative optimization can act as strong supervision for the network. This is the core of our proposed approach SPIN (SMPL oPtimization IN the loop). The deep network initializes an iterative optimization routine that fits the body model to 2D joints within the training loop, and the fitted estimate is subsequently used to supervise the network. Our approach is self-improving by nature, since better network estimates can lead the optimization to better solutions, while more accurate optimization fits provide better supervision for the network. We demonstrate the effectiveness of our approach in different settings, where 3D ground truth is scarce, or not available, and we consistently outperform the state-of-the-art model-based pose estimation approaches by significant margins. The project website with videos, results, and code can be found at https://seas.upenn.edu/~nkolot/projects/spin.

研究の動機と目的

  • 純粋な回帰ベースおよび最適化ベースの3次元人体ポーズ推定手法の限界を克服し、両者の長所を統合すること。
  • 訓練中にペアド3次元教師データを必要とせずに、深層ネットワークによる3次元人体再構築を可能にすること。
  • ピクセル単位の正確なモデルフィッティングを特権的教師信号として用いることで、ネットワークの一般化性能と精度を向上させること。
  • より良いネットワーク予測がより良い最適化結果をもたらし、逆により良い最適化がネットワークの教師信号を改善するという自己改善ループを確立すること。

提案手法

  • 深層ニューラルネットワークが画像ピクセルから初期SMPLパラメータ(ポーズおよび形状)を回帰する。
  • 回帰されたパラメータが、2次元関節検出に適合するSMPLモデルをフィッティングする反復的最適化手順(SMPLify)の初期値として使用される。
  • 最適化されたSMPLパラメータが、ネットワークの訓練のための強力で明示的な3次元教師信号として用いられ、弱い2次元再投影損失に代わる。
  • 全プロセスが訓練ループ内に統合され、回帰と最適化の閉ループ連携が形成される。
  • 3次元教師データが存在しない状況でも、最適化モジュールが2次元キーポイントのみから3次元教師信号を生成することで、3次元教師データなしでの訓練が可能になる。
  • フレームワークは自己改善型である:改善されたネットワーク予測がより良い最適化をもたらし、より良い最適化がネットワークの教師信号を向上させる。

実験結果

リサーチクエスチョン

  • RQ1深層回帰と反復的最適化の密接な統合が、現在の最先端技術を上回る3次元人体再構築を実現できるか?
  • RQ2反復的最適化が、3次元教師データが乏しいまたは存在しない状況で、ネットワーク訓練を顕著に改善する特権的教師信号を提供できるか?
  • RQ3回帰と最適化の間の自己改善ループが、異なるデータセットおよび訓練環境において一貫した性能向上をもたらすか?
  • RQ42次元キーポイントの監視と最適化に依存するだけで、ペアド3次元アノテーションが存在しない状況でも、ネットワークが3次元人体ポーズおよび形状推定を効果的に学習できるか?

主な発見

  • Human3.6Mデータセットでは、SPINは平均再構築誤差41.1 mmを達成し、以前のSOTA(HMR: 56.8 mm、NBF: 59.9 mm)を顕著に上回った。
  • ペアドなしの設定(3次元教師データが利用不可)においても、SPINは62.0 mmの再構築誤差を達成し、HMR(66.5 mm)とNBF(59.9 mm)を上回ったが、Human3.6Mの3次元データを訓練に使用していない。
  • MPI-INF-3DHPデータセットでは、剛体アライメント後のMPJPEが67.5 mmであり、HMR(89.8 mm)とVNect(98.0 mm)を上回り、アンペアド設定でもMehtaら(117.6 mm)を上回った。
  • MPI-INF-3DHPでは、剛体アライメント後のPCKが92.5%、AUCが55.6%を達成し、HMR(86.3% と 47.8%)とVNect(83.9% と 47.3%)を上回った。
  • 遮蔽、複雑なポーズ、多人数シーンなどの困難なケースに対しても頑健であるが、まれな視点や曖昧な奥行き状況では失敗事例が観察された。
  • 自己改善ループにより一貫した性能向上が実現された:より良いネットワーク予測が最適化収束を改善し、より良い最適化結果がネットワークの教師信号を強化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。