Skip to main content
QUICK REVIEW

[論文レビュー] Coarse-to-Fine Volumetric Prediction for Single-Image 3D Human Pose

Georgios Pavlakos, Xiaowei Zhou|arXiv (Cornell University)|Nov 23, 2016
Human Pose and Action Recognition参考文献 41被引用数 15
ひとこと要約

本論文は、単一画像からの3次元人体ポーズ推定のための粗くから細かくまでのボリュメトリック予測フレームワークを提案する。ConvNetを用いて、被写体周囲の離散化された3次元空間における各ボクセルごとの尤度を予測する。深度方向の解像度を段階的に向上させることで反復的精錬を実現し、標準ベンチマーク上での相対誤差を30%以上低減し、エンドツーエンドおよび2段階アプローチを上回る性能を達成した。

ABSTRACT

This paper addresses the challenge of 3D human pose estimation from a single color image. Despite the general success of the end-to-end learning paradigm, top performing approaches employ a two-step solution consisting of a Convolutional Network (ConvNet) for 2D joint localization and a subsequent optimization step to recover 3D pose. In this paper, we identify the representation of 3D pose as a critical issue with current ConvNet approaches and make two important contributions towards validating the value of end-to-end learning for this task. First, we propose a fine discretization of the 3D space around the subject and train a ConvNet to predict per voxel likelihoods for each joint. This creates a natural representation for 3D pose and greatly improves performance over the direct regression of joint coordinates. Second, to further improve upon initial estimates, we employ a coarse-to-fine prediction scheme. This step addresses the large dimensionality increase and enables iterative refinement and repeated processing of the image features. The proposed approach outperforms all state-of-the-art methods on standard benchmarks achieving a relative error reduction greater than 30% on average. Additionally, we investigate using our volumetric representation in a related architecture which is suboptimal compared to our end-to-end approach, but is of practical interest, since it enables training when no image with corresponding 3D groundtruth is available, and allows us to present compelling results for in-the-wild images.

研究の動機と目的

  • 単一画像からの3次元人体ポーズ推定における直接的な3次元座標回帰の限界を克服すること。
  • 直接座標回帰を置き換えることで性能を向上させるために、関節尤度の密な3次元ボリュメトリック表現を採用すること。
  • ボリュメトリック出力の高次元性を、粗くから細かくまでの監督戦略によって管理すること。
  • 2次元から3次元へのパイプラインとは分離された手法と比較することで、エンドツーエンド学習の優位性を検証すること。
  • 3次元の真値が入手できない状況でも、非エンドツーエンドなアーキテクチャを用いて実用的なインカメラ画像への適用を可能にすること。

提案手法

  • 被写体周囲の3次元空間をボリュメトリックグリッドに離散化し、各ボクセルが関節位置の候補を表す。
  • 完全畳み込みネットワークが各関節の各ボクセルごとの尤度を予測し、3次元座標回帰よりも豊かな監督を提供する。
  • 粗くから細かくまでの戦略により、特に深度(z)方向に監督ボリュームの解像度を段階的に向上させ、計算複雑性を管理する。
  • 中間の特徴マップを段階を経て画像特徴と統合することで、予測の反復的精錬を可能にする。
  • 段階的監督を用いてネットワークを学習し、各段階で前の段階の出力を、徐々に高解像度のヒートマップを用いて精錬する。
  • 分離型アーキテクチャの検討も行われ、2次元関節検出器と別個の3次元再構成ネットワーク(MoCapデータで学習)を用いる。

実験結果

リサーチクエスチョン

  • RQ13次元関節尤度のボリュメトリック表現は、直接的な座標回帰に比べて3次元人体ポーズ推定を改善できるか?
  • RQ2粗くから細かくまでの精錬戦略は、3次元ボリュメトリック出力の高次元性を効果的に管理できるか?
  • RQ3ボリュメトリック監督を用いたエンドツーエンド学習は、2次元関節検出に依存する2段階パイプラインと比べてどのように性能を発揮するか?
  • RQ4提案されたボリュメトリック表現は、3次元真値が入手できない状況でも、インカメラ画像の推論に適応可能か?
  • RQ5深度方向における段階的な解像度上昇が、最終的なポーズ精度にどのような影響を与えるか?

主な発見

  • 提案手法は、標準ベンチマーク上、最先端手法と比較して平均で30%以上の相対誤差低減を達成した。
  • Human3.6Mデータセットでは、平均3次元関節誤差が67.38 mmにまで低下し、先行研究の最先端手法を上回った。
  • KTH Football IIデータセットでは、単一視点手法として最高の平均PCPスコア(96)を達成し、一部のケースでマルチビューのベースラインを上回った。
  • 粗くから細かくまでの精錬戦略は、単純なコンポONENTのスタッキングに比べて性能を顕著に向上させたことが、実証的に確認された。
  • 3次元真値が利用可能な状況では、分離型アーキテクチャ(別個の2次元・3次元ネットワーク)はエンドツーエンドアプローチに劣った。これは、共同最適化の利点を裏付けた。
  • 定性的な結果から、MPIIデータセットの挑戦的なインカメラ画像に対しても、強力な3次元ポーズ予測が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。