Skip to main content
QUICK REVIEW

[論文レビュー] AbsPoseLifter: Absolute 3D Human Pose Lifting Network from a Single Noisy 2D Human Pose

Ju Yong Chang, Gyeongsik Moon|arXiv (Cornell University)|Oct 26, 2019
Human Pose and Action Recognition参考文献 46被引用数 13
ひとこと要約

本稿では、カメラ座標系における絶対的3次元ポーズに、ノイズの多い1つの2次元人体ポーズをリフトする深層学習ネットワークPoseLifterを提案する。トレーニング中に現実的な2次元ポーズ誤差を活用することで、公開ベンチマークにおいて2次元から3次元へのポーズリフトと単一画像からの3次元人体ポーズ推定で最先端の性能を達成した。

ABSTRACT

This study presents a new network (i.e., PoseLifter) that can lift a 2D human pose to an absolute 3D pose in a camera coordinate system. The proposed network estimates the absolute 3D location of a target subject and generates an improved 3D relative pose estimation compared with existing pose-lifting methods. Using the PoseLifter with a 2D pose estimator in a cascade fashion can estimate a 3D human pose from a single RGB image. In this case, we empirically prove that using realistic 2D poses synthesized with the real error distribution of 2D body joints considerably improves the performance of our PoseLifter. The proposed method is applied to public datasets to achieve state-of-the-art 2D-to-3D pose lifting and 3D human pose estimation.

研究の動機と目的

  • 単一のRGB画像から、カメラ座標系における絶対的3次元ポーズに2次元人体ポーズをリフトする課題に対処すること。
  • 2次元キーポoinト予測における現実的なノイズ分布をモデリングすることで、3次元ポーズ推定の精度を向上させること。
  • 内在的な誤差を有する実世界の2次元ポーズ出力に一般化しやすい手法を開発すること。
  • 2次元から3次元へのポーズリフトおよびエンドツーエンドの3次元人体ポーズ推定で最先端の性能を達成すること。

提案手法

  • ネットワークは、1つの2次元ポーズ入力からカメラ座標系における絶対的3次元関節位置を予測するように、エンドツーエンドでトレーニングされる。
  • 実世界の2次元キーポイント推定器に一致する現実的なノイズ分布を持つ2次元ポーズを合成する、新しいトレーニング戦略を採用する。
  • 相対的3次元ポーズ推定を絶対的3次元座標に精練するため、2次元ポーズエンコーダと3次元ポーズデコーダを組み合わせたアーキテクチャを採用する。
  • 2次元ポーズ推定器を備えたカスケード設定を採用し、トレーニング中に2次元出力を現実的なノイズで補強する。
  • 3次元キーポイント回帰損失と幾何的整合性正則化の組み合わせにより、ネットワークを最適化する。

実験結果

リサーチクエスチョン

  • RQ12次元から3次元へのポーズリフトネットワークは、現実的なノイズ分布を持つ実世界の2次元ポーズ出力に一般化できるか?
  • RQ2現実の誤差パターンを模倣する合成2次元ポーズを用いたトレーニングは、絶対的3次元ポーズ推定性能を向上させるか?
  • RQ3提案手法は、単一画像からの3次元人体ポーズ推定で最先端の結果を達成できるか?
  • RQ4ネットワークの絶対的3次元ポーズ予測能力は、相対的ポーズリフトベースラインと比べてどうか?

主な発見

  • 提案されたPoseLifterは、公開の2次元から3次元へのポーズリフトベンチマークで最先端の性能を達成した。
  • 現実的なノイズ分布を持つ2次元ポーズを合成して使用することで、ネットワークの一般化性能と最終的な3次元ポーズ精度が顕著に向上した。
  • 特にノイズの多い2次元入力下でも、既存のポーズリフトアプローチを上回る性能を示した。
  • 2次元ポーズ推定器とPoseLifterを組み合わせたカスケード設定により、単一のRGB画像からエンドツーエンドの3次元人体ポーズ推定が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。