Skip to main content
QUICK REVIEW

[論文レビュー] IDE-3D: Interactive Disentangled Editing for High-Resolution 3D-aware Portrait Synthesis

Jingxiang Sun, Xuan Wang|arXiv (Cornell University)|May 31, 2022
Generative Adversarial Networks and Image Synthesis被引用数 13
ひとこと要約

IDE-3D は、ハイブリッド GAN リインバージョンとキャノニカルエディタを組み合わせた、インタラクティブで分離可能な顔の形状とテクスチャの編集を可能にするリアルタイムで高解像度の 3D-aware ポートレート合成システムを提案する。3D 意味論に配慮した StyleGAN2 生成器と、ビュー一貫性を持つトライプレーンレンダリング、最適化された潜在空間リインバージョンを組み合わせることで、マルチビューの監督を必要とせず、グローバルおよび領域レベルの編集タスクにおいて、画質、忠実度、視点一貫性に優れた最先端の性能を達成した。

ABSTRACT

Existing 3D-aware facial generation methods face a dilemma in quality versus editability: they either generate editable results in low resolution or high-quality ones with no editing flexibility. In this work, we propose a new approach that brings the best of both worlds together. Our system consists of three major components: (1) a 3D-semantics-aware generative model that produces view-consistent, disentangled face images and semantic masks; (2) a hybrid GAN inversion approach that initialize the latent codes from the semantic and texture encoder, and further optimized them for faithful reconstruction; and (3) a canonical editor that enables efficient manipulation of semantic masks in canonical view and product high-quality editing results. Our approach is competent for many applications, e.g. free-view face drawing, editing, and style control. Both quantitative and qualitative results show that our method reaches the state-of-the-art in terms of photorealism, faithfulness, and efficiency.

研究の動機と目的

  • 3D-aware ポートレート合成における、写実的品質と編集可能性のトレードオフを解消すること。
  • 視点一貫性を維持しながら、スタイリング、表情、アクセサリーなどの顔の属性をリアルタイムでインタラクティブに編集できること。
  • 最適化ベースの GAN リインバージョンの限界(遅く、インタラクティブ利用に不適切)を克服すること。
  • 3D 空間における顔の形状とテクスチャの意味を分離し、細分化された領域レベルの編集を可能にすること。
  • マルチビューの監督を必要とせず、高精細な再構築と編集を実現すること。

提案手法

  • マルチヘッドの StyleGAN2 特徴生成器が、浅い層と深い層に形状とテクスチャのコードを注入し、分離可能な 3D-aware 特徴を生成する。
  • 特徴は空間的に整合されたトライプレーン表現に符号化され、形状とテクスチャの効率的な 3D ボリューム構築が可能になる。
  • 2D CNN を用いたアップサンプラーが、ニューラルボリュームレンダリングを通じて高解像度でビュー一貫性を持つポートレートをレンダリングする。
  • ハイブリッド GAN リインバージョン法により、意味的およびテクスチャエンコーダーを用いて潜在コードを初期化し、ピvォタルチューニングにより高精細な再構築を最適化する。
  • キャノニカルエディタにより、ユーザーの編集をキャノニカルビューの意味的マスクにマッピングし、再インバージョンなしで潜在空間に反映することで、リアルタイム編集を実現する。
  • 訓練中にマルチビュー増強を活用することで、自己遮蔽下でのアーチファクトを低減し、視点一貫性を向上させる。

実験結果

リサーチクエスチョン

  • RQ13D-aware 生成モデルは、ポートレート合成において、写実的品質と細分化された編集可能性の両方を達成できるか?
  • RQ2再構築忠実度を維持したまま、GAN リインバージョンを高速化し、インタラクティブ利用に適したものにできるか?
  • RQ33D 空間において、視点一貫性を保ちながら顔の属性を分離して編集できるか?
  • RQ4マルチビューの監督を必要としない 2D 画像からの学習でも、妥当な 3D ジオメトリと一貫性のある新規視点が得られるか?
  • RQ53D-aware ポートレート編集において、領域レベルのテクスチャスタイルトランスファーを効率的かつ忠実に実現できるか?

主な発見

  • IDE-3D は、複数の編集タスクにおいて、写実的品質、忠実度、視点一貫性の面で最先端の性能を達成した。
  • ハイブリッド GAN リインバージョン法により、純粋な最適化ベース手法と比較して、大幅に最適化時間を短縮した高精細な再構築が可能になった。
  • キャノニカルエディタにより、潜在コードの再インバージョンなしでリアルタイム編集が可能になり、高い忠実度と効率性を維持した。
  • 意味ラベルに基づくスタイルトライプレーンを照合することで、領域レベルのテクスチャ編集が成功し、非対象領域のスタイルも保持された。
  • 画像品質と視点一貫性の両面で、SofGAN や FENeRF を上回った。特に、新規視点におけるアイデンティティとテクスチャディテールの保持が優れていた。
  • 訓練中にマルチビュー増強を適用することで、新規視点合成における視点一貫性の欠如や自己遮蔽アーチファクトが顕著に低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。