Skip to main content
QUICK REVIEW

[論文レビュー] HEMlets PoSh: Learning Part-Centric Heatmap Triplets for 3D Human Pose and Shape Estimation

Kun Zhou, Xiaoguang Han|arXiv (Cornell University)|Mar 10, 2020
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、1枚のRGB画像から3次元人体ポーズとボディ形状を推定するための新規手法であるHEMlets PoShを提案する。Part-Centric Heatmap Triplets(HEMlets)を中間表現として用い、関節同士の相対的な奥行き順序と空間的重複確率を符号化することで、段階的学習戦略を可能にし、Human3.6Mで最先端手法と比較して約20%の精度向上を達成するとともに、実環境画像への一般化性能も優れている。

ABSTRACT

Estimating 3D human pose from a single image is a challenging task. This work attempts to address the uncertainty of lifting the detected 2D joints to the 3D space by introducing an intermediate state-Part-Centric Heatmap Triplets (HEMlets), which shortens the gap between the 2D observation and the 3D interpretation. The HEMlets utilize three joint-heatmaps to represent the relative depth information of the end-joints for each skeletal body part. In our approach, a Convolutional Network (ConvNet) is first trained to predict HEMlets from the input image, followed by a volumetric joint-heatmap regression. We leverage on the integral operation to extract the joint locations from the volumetric heatmaps, guaranteeing end-to-end learning. Despite the simplicity of the network design, the quantitative comparisons show a significant performance improvement over the best-of-grade methods (e.g. $20\%$ on Human3.6M). The proposed method naturally supports training with "in-the-wild" images, where only weakly-annotated relative depth information of skeletal joints is available. This further improves the generalization ability of our model, as validated by qualitative comparisons on outdoor images. Leveraging the strength of the HEMlets pose estimation, we further design and append a shallow yet effective network module to regress the SMPL parameters of the body pose and shape. We term the entire HEMlets-based human pose and shape recovery pipeline HEMlets PoSh. Extensive quantitative and qualitative experiments on the existing human body recovery benchmarks justify the state-of-the-art results obtained with our HEMlets PoSh approach.

研究の動機と目的

  • 2次元関節を3次元空間に写し込む際の曖昧さと、大きなドメインギャップを解消するため、学習可能な中間表現を導入すること。
  • 相対的奥行きアノテーションによる弱教師付き学習を活用することで、制約のない実環境画像への一般化性能を向上させること。
  • ボリュメトリックヒートマップ上の微分可能なソフトアーグマックスを用いて、エンドツーエンドで微分可能な3次元関節位置回帰を実現すること。
  • 1枚の画像から3次元ポーズとSMPLボディ形状を同時に回帰する、シンプルで効果的なパイプラインの開発。
  • Human3.6M、3DPW、SURREAL、UP-3Dといった標準ベンチマークで最先端の性能を示すこと。

提案手法

  • 本手法は、骨格部の端関節の3つの相対的奥行き状態(前方、後方、同じ奥行き)を3つの2次元ヒートマップで表現するPart-Centric Heatmap Triplets(HEMlets)を導入する。
  • 2段階のConvNetにより、入力RGB画像から2次元関節ヒートマップとHEMletsを予測し、その後、高レベル特徴量とHEMletsを補助的監視として用いて3次元ボリュメトリックヒートマップを回帰する。
  • 3次元関節位置は、微分可能なソフトアーグマックス操作により抽出され、勾配逆伝播を伴うエンドツーエンド学習が可能となる。
  • 同じ特徴空間からSMPLボディ形状(β)とポーズ(θ)パラメータを回帰するため、浅い軽量なネットワークヘッドを追加する。
  • 相対的奥行き順序アノテーションのみを備えたデータセットを用いた弱教師付き事前学習をサポートし、実環境画像への耐性を高める。
  • モデルは段階的に学習される:まず2次元関節検出とHEMlets予測を行い、次に3次元ヒートマップ回帰を行うことで、過学習を低減し収束性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1相対的奥行き順序を符号化する、パーツ中心の中間表現が、1枚の画像からの3次元人体ポーズ推定を向上させ得るか?
  • RQ22次元観測と3次元予測の間をつなぐHEMletsを学習することで、ドメインギャップが軽減され、実環境画像への一般化性能が向上するか?
  • RQ33次元ポーズ推定の精度が、その後のSMPLボディ形状およびポーズ回帰の品質にどの程度影響を及えるか?
  • RQ4段階的監視を備えたシンプルでモジュール的なネットワーク設計が、3次元人体回復タスクで最先端の性能を達成できるか?
  • RQ5弱教師付きアノテーション(相対的奥行き情報)のみで学習した場合、本手法の有効性はどの程度か?

主な発見

  • HEMlets PoShは、Human3.6Mベンチマークで平均関節位置誤差(MPJPE)39.9mmを達成し、最も優れた競合手法[42]と比較して約20%の改善を示した。
  • 屋外シーンにおける困難な照明条件やオクルージョンを伴う実環境画像に対しても、定性的な結果から一般化性能が優れていることが確認された。
  • 3DPWデータセットでは、完全なHEMlets PoShモデルが58.8mmの再構成誤差を達成し、アブレーションバージョンおよび先行手法を上回った。
  • アブレーションスタディの結果、3次元関節位置回帰ブランチが高レベル特徴ブランチ単体よりも、ボディメッシュ回復に寄与していることが示された。
  • 推定ポーズを真値ポーズに置き換えると誤差は9.4mmに低下し、ポーズ精度がボディ形状回復品質の主要因であることが示唆された。
  • SURREALおよびUP-3Dデータセットの両方で、最低の表面誤差を達成し、複数のベンチマークで最先端の性能を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。