Skip to main content
QUICK REVIEW

[論文レビュー] DenseRaC: Joint 3D Pose and Shape Estimation by Dense Render-and-Compare

Yuanlu Xu, Song‐Chun Zhu|arXiv (Cornell University)|Sep 30, 2019
Human Pose and Action Recognition参考文献 64被引用数 16
ひとこと要約

DenseRaC は、ピクセル単位の表面対応マップ(IUV)を中間表現として用い、入力画像とレンダリング出力の差異を最小化するための密度付きレンダリング・コンペアランス損失を採用する、モノクローラルRGB画像からの3D人体ポーズおよびボディ形状推定のエンドツーエンドフレームワークである。MOCA と呼ばれる大規模な合成データセットを活用し、3D再構築、ランドマーク再投影、パーツセグメンテーション、敵対的損失を統合的に最適化することで、複数のベンチマークで最先端の性能を達成している。

ABSTRACT

We present DenseRaC, a novel end-to-end framework for jointly estimating 3D human pose and body shape from a monocular RGB image. Our two-step framework takes the body pixel-to-surface correspondence map (i.e., IUV map) as proxy representation and then performs estimation of parameterized human pose and shape. Specifically, given an estimated IUV map, we develop a deep neural network optimizing 3D body reconstruction losses and further integrating a render-and-compare scheme to minimize differences between the input and the rendered output, i.e., dense body landmarks, body part masks, and adversarial priors. To boost learning, we further construct a large-scale synthetic dataset (MOCA) utilizing web-crawled Mocap sequences, 3D scans and animations. The generated data covers diversified camera views, human actions and body shapes, and is paired with full ground truth. Our model jointly learns to represent the 3D human body from hybrid datasets, mitigating the problem of unpaired training data. Our experiments show that DenseRaC obtains superior performance against state of the art on public benchmarks of various humanrelated tasks.

研究の動機と目的

  • 限られた監視情報のもとで、モノクローラルRGB画像からの3D人体ポーズおよびボディ形状推定の課題に対処すること。
  • ピクセル単位の密度の高い表現を用いることで、モノクローラル入力の曖昧さ、オクルージョン、テクスチャの変動を克服すること。
  • IUVマップとレンダリング・コンペアランスを統合することで、スパarsな2D/3Dキーポイントアノテーションへの依存度を低減すること。
  • 多様なポーズ、ボディシェイプ、カメラビューを備えた大規模な合成データセット(MOCA)を活用し、ロバストネスと一般化性能を向上させること。
  • 3D再構築、ポーズ、ボディシェイプ、セマンティックセグメンテーションを統合的に最適化するエンドツーエンド学習を可能にすること。

提案手法

  • 2段階のフレームワークを採用:まずDensePose-RCNNを用いてRGB画像からIUVマップを推定し、次にそのIUVマップから3Dポーズおよびボディシェイプを回帰する。
  • 3Dランドマーク、ボディパーツマスク、レンダリング画像を含む密度付き出力を生成する微分可能レンダラを導入する。
  • 入力RGB画像とレンダリング出力のピクセル単位の差異を最小化するため、密度付きレンダリング・コンペアランス損失を適用する。
  • 複数の損失項を最適化する:3D再構築損失(ℒ𝑟𝑟𝑟𝑟𝑟𝑟)、ランドマーク再投影損失(ℒ𝑟𝑟𝑟𝑟𝑟𝑟)、パーツセグメンテーション損失(ℒ𝑚𝑚𝑚𝑚𝑚)、および不可能配置に対する敵対的損失(ℒ𝑎𝑎𝑎𝑎𝑎𝑎)。
  • Webクロールされたモーショングラフシーケンス、3Dスキャン、アニメーションから生成された大規模な合成データセット(MOCA)を活用し、実データの事前学習および拡張に用いる。
  • 共有重みとエンドツーエンド学習を用いて、幾何的および外観的一致性を保ちながら、SMPLパラメータ(θ, β, α)を同時に回帰する。

実験結果

リサーチクエスチョン

  • RQ1IUVマップのようなピクセル単位の密度表現は、スパarsなキーポイント監視に比べ、3D人体再構築の性能向上に寄与するか?
  • RQ2ランドマーク、マスク、レンダリング画像といった密度付き出力に基づくレンダリング・コンペアランス方式は、より現実的かつ正確な3D再構築を実現するか?
  • RQ3合成データ(MOCA)は、3D人体推定における未対応または弱い監視情報を持つ実世界データの課題をどの程度軽減できるか?
  • RQ4再構築、再投影、セグメンテーション、敵対的損失といった異なる損失成分は、最終的な性能にどの程度寄与しているか?
  • RQ5このフレームワークは、オクルージョン、多様な衣服、複数人の人物を含む屋外画像にも一般化可能か?

主な発見

  • DenseRaC は、複数のベンチマークで3Dポーズ推定、セマンティックボディセグメンテーション、3Dボディ再構築の分野で最先端の性能を達成している。
  • H3.6Mベンチマークでは、平均MPVPEが58.2 mmにまで低下し、HMR や他のSOTA手法を上回った。
  • MOCA の合成データセットでは、平均MPVPEが48.7 mmにまで低下し、優れた一般化性能とロバストネスを示した。
  • アブレーションスタディの結果、スパarsキーポイント監視に比べ、密度付きレンダリング・コンペアランス損失が不自然なボディ配置を減少させることで、より大きな寄与を示した。
  • 定性的な結果では、DenseRaC はHMR、NBF、BodyNetに比べ、オクルージョンや厚い衣服下でもより自然で妥当な3Dボディを生成した。
  • 本手法は、再構築された3Dボディ上に段階的な衣装シミュレーションを可能にし、視覚的品質においてエンドツーエンドボリューム再構築を上回る効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。