Skip to main content
QUICK REVIEW

[論文レビュー] Feature-Style Encoder for Style-Based GAN Inversion

Xu Yao, Alasdair Newson|arXiv (Cornell University)|Feb 4, 2022
Generative Adversarial Networks and Image Synthesis被引用数 12
ひとこと要約

本稿では、スタイルベースのGANの潜在空間において特徴量とスタイルの表現を分離するFeature-Styleエンコーダを提案する。これにより、推論時に最適化を必要とせず、高精細な画像再構成と頑健な編集が可能になる。本手法は、再構成用の特徴コードと編集用の潜在コードを同時に学習することで、50%低いLPIPSスコアを達成し、動画再構成の整合性においても最先端の性能を発揮する。

ABSTRACT

We propose a novel architecture for GAN inversion, which we call Feature-Style encoder. The style encoder is key for the manipulation of the obtained latent codes, while the feature encoder is crucial for optimal image reconstruction. Our model achieves accurate inversion of real images from the latent space of a pre-trained style-based GAN model, obtaining better perceptual quality and lower reconstruction error than existing methods. Thanks to its encoder structure, the model allows fast and accurate image editing. Additionally, we demonstrate that the proposed encoder is especially well-suited for inversion and editing on videos. We conduct extensive experiments for several style-based generators pre-trained on different data domains. Our proposed method yields state-of-the-art results for style-based GAN inversion, significantly outperforming competing approaches. Source codes are available at https://github.com/InterDigitalInc/FeatureStyleEncoder .

研究の動機と目的

  • 既存のGAN再構成手法が直面する、視覚的品質の低さ、高い再構成誤差、動画シーケンスにおける不安定性の問題を解消すること。
  • 推論時に最適化を必要としないエンドツーエンドのエンコーダを開発し、潜在空間における特徴量とスタイルの表現を分離することで、再構成と編集の両方を向上させること。
  • 推論時に最適化を不要とすることで、高速かつ一貫性のある画像および動画編集を実現すること。
  • 非正面のポーズを含む異常値データ(例:会話顔動画における非正面ポーズ)への一般化性能を向上させること。
  • 高精細な再構成と効果的な編集能力の間でバランスの取れたトレードオフを達成すること。

提案手法

  • モデルは二重ブランチエンコーダを採用:一方のブランチは空間的詳細を保持する特徴コードを予測し、もう一方はスタイル操作用の潜在コードを予測する。
  • 特徴コードは事前学習済みのStyleGAN2生成器の中間特徴マップから導出され、微細な構造を保持する。
  • 潜在コードはスタイルに敏感なヘッドを介して予測され、化粧や目の色といった外見的属性の分離可能な編集を可能にする。
  • 多スケールの知覚的損失を用いて特徴コードを監視し、再構成の忠実度を向上させる。
  • エンドツーエンドの学習を実現するため、特徴の知覚的損失、生成画像の再構成損失、および分離性を確保するためのサイクル整合性損失を組み合わせた損失関数を用いる。
  • 特に分布外入力に対して頑健性と一般化性能を向上させるために、学習時に合成画像を用いる。

実験結果

リサーチクエスチョン

  • RQ1潜在空間における特徴量とスタイルの表現を分離することで、推論時に最適化を必要とせずにGAN再構成の品質が向上するか?
  • RQ2特徴コードと潜在コードの共同学習が、再構成忠実度と編集能力に与える影響は何か?
  • RQ3提案手法は、動画シーケンスにおける非正面ポーズのような困難なケースにも一般化可能か?
  • RQ4多スケールの知覚的監視と合成データの導入が、再構成性能に与える影響は何か?
  • RQ5画像および動画の両面で、定量的・定性的に最先端のGAN再構成モデルと比較して、本手法はどのように優れているか?

主な発見

  • 本手法はFFHQデータセットでLPIPSスコア0.064を達成し、次に優れた手法(pSp: 0.143)と比較して50%の改善を示し、SOTA手法と比較しても20–50%の低減を達成した。
  • 動画再構成においては、SSIM 0.818、PSNR 26.64、LPIPS 0.122を達成し、再構成品質および知覚的品質の両面ですべてのベースラインを上回った。
  • アブレーションスタディの結果、多スケールの知覚的損失が知覚的品質を向上させること(FID: 19.03 vs. 22.63 without it)が確認され、特徴ブランチが忠実度の向上に不可欠であることも判明した(FID: 35.28 without it)。
  • 他の手法が非正面ビューで失敗するのに対し、本モデルは動画シーケンスにおける極端なポーズに対しても顔の同一性を維持した。
  • 学習時に合成データを導入することでFIDが著しく改善(19.03 vs. 20.45 without synthetic data)し、一般化性能の向上が示された。
  • 本手法は最適化を一切行わず、高速な推論が可能であり、リアルタイムの動画編集パイプラインに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。