Skip to main content
QUICK REVIEW

[論文レビュー] Training and Tuning Generative Neural Radiance Fields for Attribute-Conditional 3D-Aware Face Generation

Jichao Zhang, Aliaksandr Siarohin|arXiv (Cornell University)|Aug 26, 2022
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本稿では、分離された属性制御を備えた3D認識面部生成のための条件付き生成的ニューラルレンダリング場(GNeRF)モデルを提案する。正規化フロー部と潜在空間最適化を組み合わせた、トレーニング・アズ・イニシャルとチューニング・フォー・チューニング(TRIOT)手法を導入することで、アイデンティティおよび幾何構造を保持しつつ、高精細でビュー一貫性のある編集を実現し、先行手法に比べて属性編集の精度と3D一貫性で優れる。

ABSTRACT

Generative Neural Radiance Fields (GNeRF)-based 3D-aware GANs have showcased remarkable prowess in crafting high-fidelity images while upholding robust 3D consistency, particularly face generation. However, specific existing models prioritize view consistency over disentanglement, leading to constrained semantic or attribute control during the generation process. While many methods have explored incorporating semantic masks or leveraging 3D Morphable Models (3DMM) priors to imbue models with semantic control, these methods often demand training from scratch, entailing significant computational overhead. In this paper, we propose a novel approach: a conditional GNeRF model that integrates specific attribute labels as input, thus amplifying the controllability and disentanglement capabilities of 3D-aware generative models. Our approach builds upon a pre-trained 3D-aware face model, and we introduce a Training as Init and Optimizing for Tuning (TRIOT) method to train a conditional normalized flow module to enable the facial attribute editing, then optimize the latent vector to improve attribute-editing precision further. Our extensive experiments substantiate the efficacy of our model, showcasing its ability to generate high-quality edits with enhanced view consistency while safeguarding non-target regions. The code for our model is publicly available at https://github.com/zhangqianhui/TT-GNeRF.

研究の動機と目的

  • 3D認識GANによる面部生成における意味的分離性の欠如と正確な属性制御の不足に対処すること。
  • アイデンティティおよび3D幾何構造を複数のビューで保持しつつ、顔の属性を細かく条件付きで編集できること。
  • バックボーンGNeRFモデルの再トレーニングなしに、編集精度を向上させる効率的なチューニングフレームワークの開発。
  • 複数属性編集やリファレンスベースの幾何転送といった複雑な編集タスクをサポートすること。

提案手法

  • 再トレーニングを回避するため、事前学習済みの3D認識GNeRFバックボーンに依存する。
  • 「トレーニング・アズ・イニシャル」戦略で訓練される条件付き正規化フロー部を導入し、分離された潜在空間操作を可能にする。
  • 2段階のTRIOTフレームワークを提案:第1段階でフロー部を訓練し、第2段階で潜在コードを最適化して属性編集精度を向上。
  • 最適化段階では、テクスチャ一貫性と幾何一貫性を組み合わせたマルチコンポonent損失を用い、非ターゲット領域の保持を図る。
  • リファレンスマッシュに一致するように潜在コードを最適化することで、リファレンスベースの幾何転送を実現。この際、外観を保持する。
  • 3D認識面部モデルの再構築と属性編集を適用することで、実画像のGANインバージョンを可能にする。

実験結果

リサーチクエスチョン

  • RQ1属性ラベルを効果的に3D認識GANに条件づけて、分離された顔の属性編集が可能か?
  • RQ2バックボーンモデルの再トレーニングなしに、3D認識GANにおける潜在空間の分離性をどのように達成できるか?
  • RQ3属性編集精度とアイデンティティ・幾何構造の保持の両立を図る最適化戦略は何か?
  • RQ4本手法は、複数属性編集やリファレンスベースの幾何転送といった複雑な編集タスクをサポートできるか?
  • RQ5ビュー一貫性と編集忠実度の観点から、先行手法と比較してどのように優れているか?

主な発見

  • 提案されたTRIOT手法は、ベースライン手法に比べてCA(属性精度)とLP(LPIPS)スコアで定量的な向上を達成し、優れた属性編集精度を実現。
  • 最適化段階により、髪や背景など非ターゲット領域においてもアイデンティティおよび幾何構造の保持が顕著に向上し、定性的な比較で明確に示された。
  • 100~150ステップの最適化で、編集精度とアイデンティティ保持の最良なトレードオフが達成され、LPおよびCAスコアの低下により確認された。
  • 複数の属性(表情、性別、髪の色など)を順次編集しても、複数のビューで強い3Dビュー一貫性を維持。
  • リファレンスマッシュに一致するように潜在コードを最適化することで、外観(アイデンティティおよびテクスチャを含む)を保持しつつ、リファレンスベースの幾何転送を成功。
  • 実画像に対する高品質なGANインバージョンが可能で、最小限の非ターゲット領域の歪みで正確な再構築と正確な属性編集を実現。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。