[論文レビュー] A Hierarchical Representation Network for Accurate and Detailed Face Reconstruction from In-The-Wild Images
本稿では、顔ごとのブレンドシェイプ、頂点ごとの変形、ピクセルごとのデフォーメーションマップを用いて、顔の幾何学的構造を低周波数、中周波数、高周波数成分に分離することで、野生の画像からの高精細3D顔再構築を目的とした階層的表現ネットワーク(HRN)を提案する。本手法は、顔の詳細に関する3D事前知識とデレトゥーシングモジュールを統合し、正確性と現実性を向上させ、単一および複数視点のベンチマークで最先端の性能を達成しており、新たに高品質なデータセットFaceHD-100を含む。
Limited by the nature of the low-dimensional representational capacity of 3DMM, most of the 3DMM-based face reconstruction (FR) methods fail to recover high-frequency facial details, such as wrinkles, dimples, etc. Some attempt to solve the problem by introducing detail maps or non-linear operations, however, the results are still not vivid. To this end, we in this paper present a novel hierarchical representation network (HRN) to achieve accurate and detailed face reconstruction from a single image. Specifically, we implement the geometry disentanglement and introduce the hierarchical representation to fulfill detailed face modeling. Meanwhile, 3D priors of facial details are incorporated to enhance the accuracy and authenticity of the reconstruction results. We also propose a de-retouching module to achieve better decoupling of the geometry and appearance. It is noteworthy that our framework can be extended to a multi-view fashion by considering detail consistency of different views. Extensive experiments on two single-view and two multi-view FR benchmarks demonstrate that our method outperforms the existing methods in both reconstruction accuracy and visual effects. Finally, we introduce a high-quality 3D face dataset FaceHD-100 to boost the research of high-fidelity face reconstruction. The project homepage is at https://younglbw.github.io/HRN-homepage/.
研究の動機と目的
- 3DMMベースの手法がしわやくぼみなどの高周波数の顔の詳細を捉えることの限界を解消すること。
- 顔の幾何学的構造を低周波数、中周波数、高周波数成分に分離することで、再構築の正確性と視覚的忠実度を向上させること。
- デレトゥーシングモジュールを導入することで、皮膚の欠点と照明効果の混同を低減し、幾何学と外観をより効果的に分離すること。
- スパarsな入力視点でも性能が向上するように、フレームワークを複数視点再構築に拡張すること。
- 高精細でスパars視点の顔再構築を促進するため、2,000体の高精細3D顔モデルと高精細マルチビュー画像を備えた高品質な3D顔データセットFaceHD-100を提供すること。
提案手法
- フレームワークは、3DMM係数による低周波数幾何学的構造、頂点ごとの変形マップによる中周波数の詳細、ピクセルごとのデフォーメーションマップによる高周波数の詳細をモデル化する階層的表現戦略を採用する。
- 単一画像から変形マップとデフォーメーションマップを予測する2つの画像変換ネットワークを用い、粗いから細かい再構築を実現する。
- 実際の顔スキャンから学習した中周波数および高周波数の顔の詳細に関する3D事前知識を活用し、現実的な幾何学的構造モデリングを支援する。
- 皮膚のテクスチャと照明の曖昧さによって生じるアーティファクトを低減するため、ベーステクスチャを精緻化するデレトゥーシングモジュールを導入する。
- 詳細な幾何学の視点間の一貫性を強制することで、単一視点HRNフレームワークを複数視点顔再構築(MV-HRN)に拡張する。
- 顔の輪郭の正確性を向上させるための輪郭認識損失と、幾何的忠実度を確保するためのマルチスケール損失を用いて、エンドツーエンドでフレームワークを訓練する。
実験結果
リサーチクエスチョン
- RQ1標準的な3DMMの限界を超えて、中周波数および高周波数の顔の詳細を効果的に分離・モデリングできる階層的表現戦略は、有効であるか?
- RQ2顔の詳細に関する3D事前知識は、再構築された幾何学の現実性と正確性をどのように向上させるか?
- RQ3デレトゥーシングモジュールは、野生の画像における幾何学と外観の分離をどの程度向上させるか?
- RQ4単一視点HRNフレームワークは、スパarsな入力視点でも効果的に複数視点再構築に拡張可能か?
- RQ5提案されたFaceHD-100データセットは、既存のベンチマークと比較して、高精細でスパars視点の顔再構築をどの程度支援するか?
主な発見
- 複数視点のFaceScapeベンチマークにおいて、HRNは1.13mmの中央値再構築誤差を達成し、MV-FNet(1.76mm)やDFNRMVS(1.79mm)といった先行手法を上回った。
- 単一視点のFFHQベンチマークでは、HRNが中央値誤差1.13mmにまで低減し、DFNRMVS(1.79mm)やMV-FNet(1.76mm)といった最先端手法を上回った。
- アブレーションスタディの結果、階層的モデリングによりベース3DMMと比較して誤差が約0.5mm低減され、3D詳細事前知識が約0.3mmの改善に寄与した。
- デレトゥーシングモジュールにより、幾何学と外観の混同が軽減され、皮膚の欠点によって生じる不自然な詳細が除去され、より現実的なテクスチャが得られた。
- MV-HRNは2つの入力視点(誤差1.17mm)でも一貫した性能を発揮し、視点数が増えるにつれて性能が向上し、単純平均ベースラインを上回った。
- 2,000体の高精細3D顔モデルと高精細マルチビュー画像を備えたFaceHD-100の導入により、今後のスパars視点・高精細顔再構築研究を支援する基盤が整った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。