Skip to main content
QUICK REVIEW

[論文レビュー] Geometry-aware Two-scale PIFu Representation for Human Reconstruction

Zheng Dong, Ke Xu|arXiv (Cornell University)|Dec 3, 2021
Human Pose and Action Recognition被引用数 9
ひとこと要約

本稿では、スパースでノイジーなRGBD入力からの3次元人体再構成のための幾何学的注意を払った2スケールPIFu表現を提案する。深度ノイズ低減と3次元再構成のマルチタスク学習を活用することで、局所的幾何とグローバルトポロジーの両方を向上させる。顔とボディの再構成に別個のMLPを用いることで、高精細な顔貌の詳細と一貫性のあるボディジオメトリを実現し、困難なキャプチャ条件下でも最先端の手法を上回る詳細回復とトポロジー正確性を達成する。

ABSTRACT

Although PIFu-based 3D human reconstruction methods are popular, the quality of recovered details is still unsatisfactory. In a sparse (e.g., 3 RGBD sensors) capture setting, the depth noise is typically amplified in the PIFu representation, resulting in flat facial surfaces and geometry-fallible bodies. In this paper, we propose a novel geometry-aware two-scale PIFu for 3D human reconstruction from sparse, noisy inputs. Our key idea is to exploit the complementary properties of depth denoising and 3D reconstruction, for learning a two-scale PIFu representation to reconstruct high-frequency facial details and consistent bodies separately. To this end, we first formulate depth denoising and 3D reconstruction as a multi-task learning problem. The depth denoising process enriches the local geometry information of the reconstruction features, while the reconstruction process enhances depth denoising with global topology information. We then propose to learn the two-scale PIFu representation using two MLPs based on the denoised depth and geometry-aware features. Extensive experiments demonstrate the effectiveness of our approach in reconstructing facial details and bodies of different poses and its superiority over state-of-the-art methods.

研究の動機と目的

  • スパースでノイジーなRGBDキャプチャ環境下における、従来のPIFuベース手法の顔貌およびボディの詳細品質の低さを是正すること。
  • スパースな視点における深度ノイズの増幅によって引き起こされるトポロジー誤りや過剰に滑らかすぎる表面を克服すること。
  • 深度ノイズ低減と3次元再構成の相補的関係を活用することで、再構成の忠実度を向上させること。
  • 顔とボディに別個のMLPを用いた2スケールPIFu表現により、高周波数の顔貌詳細のモデリング能力を強化すること。
  • 軽量な重み付き統合戦略を用いて、再構成済みの顔とボディ部品を正確かつアーチファクトのない形で統合すること。

提案手法

  • 深度ノイズ低減と3次元再構成をマルチタスク学習問題として定式化し、局所的幾何的忠実度とグローバルトポロジーの一貫性の両方を同時に向上させる。
  • チャネル注意モジュール(CAM)と幾何学的注意モジュール(GAM)を用いて、RGBと深度特徴を効果的に統合し、幾何学的文脈を含んだ豊富な特徴を生成する。
  • ノイズ低減ヘッドを適用してノイジーな深度マップを精緻化し、局所的幾何的詳細を特徴表現に組み込む。
  • 顔とボディの占有フィールドを別個にモデル化するため、PIFu-FaceとPIFu-Bodyという2つの独立したMLPを採用し、計算複雑度を低減するとともに詳細モデリング能力を向上させる。
  • 2つのMLP出力をブレンドする重み付き顔→ボディ統合モジュールを導入し、境界部のステッチアーチファクトを最小限に抑える。
  • 顔とボディの境界部における段差ノイズを抑制するために、深度と占有予測の一貫性を強制する正則化損失 $L_{\text{reg}}$ を組み込む。

実験結果

リサーチクエスチョン

  • RQ1スパースでノイジーなRGBD入力からの3次元人体再構成品質を、深度ノイズ低減と3次元再構成のマルチタスク学習によって向上させることができるか?
  • RQ2顔とボディに別個のMLPを用いた2スケールPIFu表現は、単一の統合PIFuと比較して高周波数の詳細回復を向上させるか?
  • RQ3幾何学的注意特徴統合とアテンション機構は、ノイジーな深度条件下でも再構成のロバストネスを向上させるか?
  • RQ4提案された重み付き顔→ボディ統合は、単純な連結やブレンドと比較して、アーチファクトの除去にどの程度効果的か?
  • RQ5正則化損失 $L_{\text{reg}}$ は、接合部の整合性を向上させ、ステッチ領域のノイズをどの程度低減させるか?

主な発見

  • 深度ノイズ低減タスクを削除すると、メッシュ指標が14.84%低下し、法線指標が18.98%低下し、幾何的忠実度の維持においてその重要性が確認された。
  • 3次元の監視がなければ、ノイズ低減済み深度マップに誤った詳細(例:誤った顔貌特徴や衣装の折り目)が組み込まれるため、グローバルトポロジーのガイダンスの重要性が示された。
  • CAMをASPP+ResCBAMに置き換えたりGAMを削除したりすると性能が低下し、特徴統合と幾何的文脈の強化においてその有効性が裏付けられた。
  • PIFu-Faceモジュールは顔貌詳細再構成を顕著に向上させ、視覚的比較において唯一、細かいしわや髪の毛の一本一本を保持していることが示された。
  • 重み付き顔→ボディ統合モジュールはステッチアーチファクトを効果的に排除しており、ナマズな統合では目に見えるシームやずれが生じるのと対照的である。
  • 正則化損失 $L_{\text{reg}}$ は、顔とボディの境界部における段差ノイズを効果的に抑制し、アブレーションスタディの結果、より滑らかで明確な深度および占有予測が得られていることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。