Skip to main content
QUICK REVIEW

[論文レビュー] Photorealistic Monocular 3D Reconstruction of Humans Wearing Clothing

Thiemo Alldieck, Mihai Zanfir|arXiv (Cornell University)|Apr 19, 2022
3D Shape Modeling and Analysis被引用数 8
ひとこと要約

PHORHUM は、衣装を着た人の写実的単眼3次元再構成をエンドツーエンドの深層学習フレームワークとして提示する。幾何学的形状、アルベド、シェーディング、シーンの照度を同時に予測する。画像マットイングやマルチステージパイプラインを必要とせず、パッチベースのレンダリング損失を導入することで、可視領域および自己遮蔽領域における視覚的色再現精度を顕著に向上させ、最先端の結果を達成する。

ABSTRACT

We present PHORHUM, a novel, end-to-end trainable, deep neural network methodology for photorealistic 3D human reconstruction given just a monocular RGB image. Our pixel-aligned method estimates detailed 3D geometry and, for the first time, the unshaded surface color together with the scene illumination. Observing that 3D supervision alone is not sufficient for high fidelity color reconstruction, we introduce patch-based rendering losses that enable reliable color reconstruction on visible parts of the human, and detailed and plausible color estimation for the non-visible parts. Moreover, our method specifically addresses methodological and practical limitations of prior work in terms of representing geometry, albedo, and illumination effects, in an end-to-end model where factors can be effectively disentangled. In extensive experiments, we demonstrate the versatility and robustness of our approach. Our state-of-the-art results validate the method qualitatively and for different metrics, for both geometric and color reconstruction.

研究の動機と目的

  • 単一のモノクロムRGB画像から幾何学的形状、アルベド、シェーディングを同時に予測できるエンドツーエンドで学習可能な手法の不足を補う。
  • 従来の手法がシェーディングを外観に埋め込んでいるという制限を克服し、現実のシーンに統合可能なモデルを実現する。
  • 画像マットイングやマルチステージパイプラインに依存せず、ワンステップでの推論を可能にする。
  • 新しいレンダリング損失を通じて、特に非可視(自己遮蔽)領域における色再構成の視覚的忠実度を向上させる。
  • 幾何学的形状、アルベド、照度を分離することで、バーチャルトライオンやシーン合成などの後続応用においてより柔軟な対応を可能にする。

提案手法

  • 本手法は、3次元幾何学的形状の符号付き距離関数、表面のアルベド、シーンの照度を予測する、1つのエンドツーエンドで学習可能なニューラルネットワークを採用する。
  • 光度的一致性に基づいて色の外観を監視するパッチベースのレンダリング損失を導入し、視覚的品質を向上させる。
  • ネットワークは表面法線、アルベド、シェーディングを同時に推定することで、照度効果と固有の表面色の分離を実現する。
  • 学習された符号付き距離関数に対してマーチング・キューブスを適用してメッシュを抽出し、高解像度再構成のためのオクトリー採番を用いる。
  • モデルは64³ボクセルのバッチで入力画像を処理し、V100 GPU上で256³グリッドでは1.21秒、512³グリッドでは5.72秒の推論時間を要する。
  • 後処理として、2次元キーポイント検出に適合させ、ICPを用いてメッシュを整列させることで、GHUM統計的身体モデルによるリギングを実施する。

実験結果

リサーチクエスチョン

  • RQ1画像マットイングを必要とせず、1つのエンドツーエンドの深層学習モデルが、単一のRGB画像から詳細な3次元幾何学的形状、アルベド、シェーディングを同時に予測できるか?
  • RQ2レンダリング損失は、特に自己遮蔽領域において、色再構成の視覚的品質をどのように向上させるか?
  • RQ3幾何学的形状と外観を同時に最適化することで、逐次的またはマルチステージ的手法と比較して、アルベドと照度の分離がより良くなるか?
  • RQ4明示的な2次元の監視(例:画像マットイングからのもの)が欠落している場合、性能に悪影響を及ぼすか?また、モデルは多様な背景や照明条件下でも一般化可能か?
  • RQ5定量的および定性的に、幾何学的正確性と写実的外観の観点から、最先端の手法と比較して本手法はどのように差をつけるか?

主な発見

  • PHORHUM は、PeopleSnapshotデータセットにおいてPIFuHD や Tex2Shape を上回る最先端の性能を達成し、幾何学的再構成と色再構成の両面で優れた結果を示した。
  • 妥当なアルベドとシェーディングの推定が可能であり、再照明や新しいシーンへの合成に適したリアルな外観を実現した。
  • レンダリング損失のおかげで視覚的忠実度が顕著に向上し、特に色再構成が信頼性の低い非可視領域で顕著に改善された。
  • メッシュ再構成には256³グリッドで1.21秒、512³グリッドで5.72秒の時間がかかり、最大40万頂点を含む高解像度メッシュが生成された。
  • 訓練データに明示的に含まれていなかったが、固体の白い背景を持つ画像に対しても、良好な一般化性能を示した。
  • GHUMを用いた後処理によるリギングにより、標準のモーショントラッキングデータや潜在的ポーズサンプリングを用いたメッシュのアニメーションが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。