Skip to main content
QUICK REVIEW

[論文レビュー] Controllable 3D Face Synthesis with Conditional Generative Occupancy Fields

Keqiang Sun, Shangzhe Wu|arXiv (Cornell University)|Jun 16, 2022
Face recognition and analysis被引用数 16
ひとこと要約

本稿では、3次元可動モデル(3DMM)メッシュを介して3次元形状の一貫性を強制するNeRFベースの条件付き3次元顔合成フレームワーク、条件付き生成占有フィールド(cGOF)を提案する。3次元顔の細分化制御を実現するため、3次元ランドマークとボリュームワープング損失を組み合わせ、2次元ベースの最先端手法に比べて優れた3次元制御性と高精細な3次元認識顔生成を達成する。

ABSTRACT

Capitalizing on the recent advances in image generation models, existing controllable face image synthesis methods are able to generate high-fidelity images with some levels of controllability, e.g., controlling the shapes, expressions, textures, and poses of the generated face images. However, these methods focus on 2D image generative models, which are prone to producing inconsistent face images under large expression and pose changes. In this paper, we propose a new NeRF-based conditional 3D face synthesis framework, which enables 3D controllability over the generated face images by imposing explicit 3D conditions from 3D face priors. At its core is a conditional Generative Occupancy Field (cGOF) that effectively enforces the shape of the generated face to commit to a given 3D Morphable Model (3DMM) mesh. To achieve accurate control over fine-grained 3D face shapes of the synthesized image, we additionally incorporate a 3D landmark loss as well as a volume warping loss into our synthesis algorithm. Experiments validate the effectiveness of the proposed method, which is able to generate high-fidelity face images and shows more precise 3D controllability than state-of-the-art 2D-based controllable face synthesis methods. Find code and demo at https://keqiangsun.github.io/projects/cgof.

研究の動機と目的

  • 大規模なポーズおよび表情の変化に対して一貫性の欠ける結果を生じがちな2次元ベースの制御可能な顔合成の限界を解消すること。
  • 明示的な3次元事前知識を活用することで、合成された顔画像における正確な3次元制御性を実現すること。
  • 多様な顔の形状と表情においても、高精細なディテールを維持するとともに幾何学的整合性を保証する生成モデルの開発。
  • 3次元ランドマークとボリュームワープングのマルチスーパービジョン信号をニューラルレンダリングフレームワークに統合し、3次元形状の忠実度を向上させること。

提案手法

  • コアとなる手法は、3DMMメッシュを条件として用いる条件付き生成占有フィールド(cGOF)であり、形状の一貫性を強制する。
  • モデルはニューラルレンダランスフィールド(NeRF)アーキテクチャを用いて3次元顔ボリュームを暗黙的に表現し、学習された3次元幾何から新しいビューをレンダリングする。
  • 生成された顔と真値の顔ランドマーク間のキーポイントアライメントを監視するための3次元ランドマーク損失を導入し、局所的形状の正確性を向上させる。
  • 予測されたボリュームとターゲットボリューム間の変形を最小化することで、生成された3次元形状と参照用3DMMメッシュの整合性を高めるためにボリュームワープング損失を適用する。
  • 占有状態の監視、ビュー合成、ランドマーク、ワープング損失のマルチスーパービジョンを用いて、エンドツーエンドで訓練する。
  • 3DMMパラメータへの条件付き入力を通じて、推論時にアイデンティティ、表情、ポーズの分離制御を可能にする。

実験結果

リサーチクエスチョン

  • RQ1明示的な3次元事前知識(例:3DMMメッシュ)を活用することで、ニューラル暗黙的フィールドモデルが顔合成において正確な3次元制御性を達成できるか?
  • RQ23次元ランドマークとボリュームワープングの監視を組み込むことで、標準的なビュー合成損失のみに比べて、3次元顔生成における幾何的忠実度がどのように向上するか?
  • RQ3提案されたcGOFフレームワークは、大規模なポーズおよび表情の変化に対処する際、2次元ベースの制御可能な顔生成手法をどの程度上回るか?
  • RQ4モデルは、多様な条件下でも高精細でビュー一貫性のある3次元認識顔画像を生成し、正確な3次元形状構造を維持できるか?

主な発見

  • 提案手法は、特に大規模なポーズおよび表情の変化下でも、最先端の2次元ベース顔生成手法に比べて顕著に優れた3次元制御性を達成した。
  • 3次元ランドマークとボリュームワープング損失の統合により、ランドマークアライメントの向上と形状のずれの低減が確認され、より正確な3次元顔の幾何形状が得られた。
  • モデルは、困難な条件下でも一貫性のある3次元構造を保ちながら、高精細でビュー一貫性のある顔画像を生成した。
  • 定量的評価では、3DMMパラメータ再構成誤差やランドマーク精度といった3次元形状再構成指標において、ベースライン手法に比べて優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。