Skip to main content
QUICK REVIEW

[論文レビュー] FENeRF: Face Editing in Neural Radiance Fields

Jingxiang Sun, Xuan Wang|arXiv (Cornell University)|Nov 30, 2021
Face recognition and analysis被引用数 4
ひとこと要約

FENeRFは、形状とテクスチャの分離された潜在コードを用い、GAN逆投影を介して空間的に整合された3Dボリュームで、セマンティックおよびテクスチャ分野を共同最適化することで、視点一貫性があり高精細なローカル編集が可能な3Dに配慮した、局所的に編集可能なポートレート生成フレームワークを提案する。単一の画像とペアドセマンティックマスクのみを用いて、SOTAを上回る編集の忠実度と幾何的正確性を達成する。

ABSTRACT

Previous portrait image generation methods roughly fall into two categories: 2D GANs and 3D-aware GANs. 2D GANs can generate high fidelity portraits but with low view consistency. 3D-aware GAN methods can maintain view consistency but their generated images are not locally editable. To overcome these limitations, we propose FENeRF, a 3D-aware generator that can produce view-consistent and locally-editable portrait images. Our method uses two decoupled latent codes to generate corresponding facial semantics and texture in a spatial aligned 3D volume with shared geometry. Benefiting from such underlying 3D representation, FENeRF can jointly render the boundary-aligned image and semantic mask and use the semantic mask to edit the 3D volume via GAN inversion. We further show such 3D representation can be learned from widely available monocular image and semantic mask pairs. Moreover, we reveal that joint learning semantics and texture helps to generate finer geometry. Our experiments demonstrate that FENeRF outperforms state-of-the-art methods in various face editing tasks.

研究の動機と目的

  • 2D GANの視点不一致の問題と、3Dに配慮したGANの局所的編集性の欠如という、ポートレート合成における限界を解決すること。
  • 視点一貫性を厳密に保ちながら、インタラクティブかつ局所的な編集が可能なフリービュー・ポートレートの編集を可能にすること。
  • 単一の画像とセマンティックマスクから、顔のセマンティクス、幾何学、テクスチャの3Dに配慮した空間的に整合された表現を学習すること。
  • セマンティクスとテクスチャの共同学習を通じて、3D幾何学の品質を向上させること。
  • スタイリングトランスファー、属性編集、スタイリングミキシングなどの、3Dフリービュー環境下での後続応用を可能にすること。

提案手法

  • 生成器は、形状用の $\mathbf{Z}_s$ とテクスチャ用の $\mathbf{Z}_t$ という2つの分離された潜在コードを用い、空間的に整合された密度、セマンティクス、テクスチャ分野を共有する3Dボリュームを生成する。
  • レンダリング画像における高周波成分の保持を目的として、MLPに学習可能な座標埋め込み $e_{\text{coord}}$ を組み込む。
  • 色ディスクリミネータ $D_c$(画像の現実性を評価)とセマンティックディスクリミネータ $D_s$(画像とセマンティックマップ間のコンテンツ整合性を評価)を備えた二重ディスクリミネータ構造を採用する。
  • GAN逆投影を用いて実画像を潜在コードに変換し、3Dボリューム内のセマンティックマスクの操作によって局所的編集を実現する。
  • 画像とセマンティックの両方の監視による共同学習により、空間的整合性が保たれ、幾何学的品質と詳細の質が向上する。
  • マルチビューまたは3Dの監視を必要とせず、ペアドセマンティックマスクを備えた単一の画像で学習を行う。

実験結果

リサーチクエスチョン

  • RQ13Dに配慮したGAN生成器は、ポートレート合成において視点一貫性と局所的編集性の両方を達成できるか?
  • RQ2マルチビューまたは3Dの監視を用いずに、単一の画像とセマンティックマスクを効果的に用いて3Dに配慮したポートレート生成器を学習できるか?
  • RQ3セマンティクスとテクスチャの共同学習は、3D幾何学再構築の品質を向上させるか?
  • RQ4セマンティックマスクは、3Dポートレートの幾何学的形状とテクスチャのインタラクティブかつ局所的な編集に効果的なインターフェースとして機能するか?
  • RQ5学習可能な座標埋め込みの統合は、生成されたポートレートにおける高周波成分の保持にどのように影響を与えるか?

主な発見

  • FENeRFは、CelebAMask-HQ や FFHQ といった複数のベンチマークで、視点一貫性、編集忠実度、幾何的正確性においてSOTAを上回る性能を達成する。
  • 画像とセマンティックの両方の監視による共同学習は、より正確で滑らかなメッシュおよび深度マップの再構築を示しており、幾何学的品質の向上が顕著に確認された。
  • カラー分岐に学習可能な座標埋め込み $e_{\text{coord}}$ を組み込むことで、アーチファクトを最小限に抑えつつ、鋭い画像の詳細が再現可能となり、初期段階での埋め込みや省略に比べて優れた性能を示した。
  • GAN逆投影によるセマンティックマップの編集により、鼻の大きさ・形状といった顔貌属性の正確かつ局所的な操作が可能となり、複数の視点で一貫した幾何学的形状とテクスチャが維持された。
  • 本手法は、スタイリングミキシング、スタイリングトランスファー、明示的なカメラ制御を伴うフリービュー・アバター生成といった、複雑な編集タスクを効果的にサポートした。
  • アブレーションスタディの結果、セマンティック監視は信頼性の高い幾何学的学習に不可欠であり、画像レンダリングのみでは正確な顔貌構造を再構築できないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。