Skip to main content
QUICK REVIEW

[論文レビュー] Expanding the Latent Space of StyleGAN for Real Face Editing

Yu Yin, Ghasedi Kamran|arXiv (Cornell University)|Apr 26, 2022
Face recognition and analysis被引用数 6
ひとこと要約

本稿では、スタイルGANの2本の潜在空間拡張を提案し、アイデンティティ保持と分離された属性操作を分離することで、実写顔の編集を向上させる。スパーススタイル編集とアライメント正則化を伴う2次元コンテンツ特徴融合を導入することで、最小限の歪みと向上した属性分離度を達成し、再構成品質と編集品質の両方が最先端水準に達する。

ABSTRACT

Recently, a surge of face editing techniques have been proposed to employ the pretrained StyleGAN for semantic manipulation. To successfully edit a real image, one must first convert the input image into StyleGAN's latent variables. However, it is still challenging to find latent variables, which have the capacity for preserving the appearance of the input subject (e.g., identity, lighting, hairstyles) as well as enabling meaningful manipulations. In this paper, we present a method to expand the latent space of StyleGAN with additional content features to break down the trade-off between low-distortion and high-editability. Specifically, we proposed a two-branch model, where the style branch first tackles the entanglement issue by the sparse manipulation of latent codes, and the content branch then mitigates the distortion issue by leveraging the content and appearance details from the input image. We confirm the effectiveness of our method using extensive qualitative and quantitative experiments on real face editing and reconstruction tasks.

研究の動機と目的

  • 事前学習済みスタイルGANを用いた実写顔画像編集において、低歪み再構成と高編集性のトレードオフを解消すること。
  • 意味的編集中にアイデンティティや外見の詳細を保持できない既存のインバージョン手法の限界を克服すること。
  • スタイルコード操作にスパarsity制約を導入することで、分離可能で局所的な属性編集を可能にすること。
  • 入力画像からの2次元コンテンツ特徴を合成パイプラインに統合することで、編集歪みを低減すること。
  • 従来のPTIなどのように生成器のファインチューニングなしに、未学習の実写顔に対してもアイデンティティを保持した編集を可能にすること。

提案手法

  • 2本のブランチモデルを提案:1次元スタイルコードに対するスパarsity正則化による分離可能編集を実現するスタイルブランチと、2次元コンテンツ特徴を用いた歪み低減を実現するコンテンツブランチ。
  • スタイルコードの有効次元数を制限するスパarsity正則化($\mathcal{L}_{spa}$)を適用することで、局所的かつ分離可能な属性編集を可能にする。
  • 入力画像から抽出した2次元コンテンツ特徴を合成パスに統合し、照明、表情、髪型などの画像固有の詳細を保全しながら編集を精緻化する。
  • ソース画像と生成画像間の特徴アライメントを監視するアライメント損失($\mathcal{L}_{align}$)を用い、編集されていない領域が変化しないように保証する。
  • 複数の層でスタイル特徴とコンテンツ特徴を特徴融合モジュールを用いて統合し、グローバルな意味的制御とローカルなテクスチャ忠実度を統合する。
  • 再構成損失、スパarsity損失、アライメント損失、知覚損失の組み合わせを用いてエンドツーエンドでモデルを訓練し、忠実度と編集性の両方を最適化する。

実験結果

リサーチクエスチョン

  • RQ1単一で効率的な推論パイプラインを用いて、実写顔画像編集において同時に低歪み再構成と高編集性を達成できるか?
  • RQ2スタイルコード操作にスパarsity正則化を適用することで、属性分離度とアイデンティティや外見の不測の変化に与える影響は何か?
  • RQ3標準的な潜在空間インバージョンと比較して、入力画像からの2次元コンテンツ特徴が編集忠実度を向上させ、歪みを低減する程度はどの程度か?
  • RQ4アライメント正則化は、属性編集中に編集されていない画像領域(例:背景、表情)を効果的に保持できるか?
  • RQ5追加のコンテンツ特徴を用いて潜在空間を拡張することで、標準的な$\mathcal{W}$または$\mathcal{W+}$空間インバージョンに比べて性能が向上するか?

主な発見

  • アブレーションスタディにおいて、本手法はIDスコアが0.77と最高を記録し、ベースライン設定を著しく上回った。
  • スパarsity正則化とアライメント損失を併用した場合、L2再構成誤差は0.028、LPIPSは0.09にまで低下し、優れた画像忠実度を示した。
  • スパarsity正則化により分離可能な編集が可能となった:『メガネ』の編集は顔の色やヘアスタイルに影響を与えず、不測の属性変化が減少した。
  • コンテンツ精緻化ブランチにより歪みが低減され、pSp や e4e と比較して、生成画像におけるエッジの鋭さや細部(例:しわ、髪の毛)の質が向上した。
  • 定量的評価では、本手法がすべての指標(LPIPS、L2、PSNR、SSIM)において再構成タスクで最先端の手法を上回った。
  • アブレーションスタディにより、アライメント損失を除去すると色の不正確さが生じることが確認され、外見詳細の保持においてその重要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。