Skip to main content
QUICK REVIEW

[論文レビュー] Near Perfect GAN Inversion

Qianli Feng, Viraj Shah|arXiv (Cornell University)|Feb 23, 2022
Generative Adversarial Networks and Image Synthesis被引用数 7
ひとこと要約

本論文では、固定されたエンコーダーや最適化ベースの潜在コード探索に依存せず、生成器ネットワーク $G(\cdot)$ を局所的に微調整することで、実写画像のほぼ完全な再構成を達成する新しいGAN逆問題手法を提案する。この手法は、最先端の手法と比較してMSEを1桁低減し、標準的なGAN編集手法で完全に編集可能な、見分けがつかないクローンを生成する。

ABSTRACT

To edit a real photo using Generative Adversarial Networks (GANs), we need a GAN inversion algorithm to identify the latent vector that perfectly reproduces it. Unfortunately, whereas existing inversion algorithms can synthesize images similar to real photos, they cannot generate the identical clones needed in most applications. Here, we derive an algorithm that achieves near perfect reconstructions of photos. Rather than relying on encoder- or optimization-based methods to find an inverse mapping on a fixed generator $G(\cdot)$, we derive an approach to locally adjust $G(\cdot)$ to more optimally represent the photos we wish to synthesize. This is done by locally tweaking the learned mapping $G(\cdot)$ s.t. $\| {\bf x} - G({\bf z}) \| 0$ a small scalar. We show that this approach can not only produce synthetic images that are indistinguishable from the real photos we wish to replicate, but that these images are readily editable. We demonstrate the effectiveness of the derived algorithm on a variety of datasets including human faces, animals, and cars, and discuss its importance for diversity and inclusion.

研究の動機と目的

  • 既存のGAN逆問題手法が固定された生成器容量の制限により、実写写真の正確なクローンを生成できないという根本的限界に対処すること。
  • 再構成画像が単に類似しているのではなく、同一のクローンであることを保証することで、実写画像の意味的編集を可能にすること。
  • 標準的手法でしばしば不正確に再構成される、代表が不足しているグループの画像に対しても信頼性の高い逆問題を可能にすることで、公平性と包摂性を向上させること。
  • GANの再トレーニングを伴わず、計算コストを最小限に抑えてほぼ完全な再構成を達成すること。

提案手法

  • 本手法は、生成器 $G(\cdot)$ を局所的に調整して $\|\mathbf{x} - G(\mathbf{z})\| < \epsilon$ を最小化する。ここで $\mathbf{x}$ はターゲットの実写画像、$\epsilon$ は小さなしきい値である。
  • エンコーダー $h(\cdot)$ の最適化や学習に代えて、潜在コード $\mathbf{z}$ の近傍における生成器重みを更新することで、ターゲット画像の再構成を改善する。
  • 局所的更新は、生成器パラメータに対する勾配ベースの最適化により実行され、元のGANの構造とスタイル変換機能を保持する。
  • 高精度な再構成を保証するため、評価指標として感知損失(LPIPS)とMSEを用いる。
  • 標準的なGAN編集ツール(例:StyleSpaceや非教師あり編集法)と互換性がある。
  • 生成器の微調整は軽量であり、1枚あたり数分から十数分で実行可能で、フル再トレーニングを必要としない。

実験結果

リサーチクエスチョン

  • RQ1潜在コードではなく生成器を変更することで、実写画像のほぼ完全な再構成をGAN逆問題で達成できるか?
  • RQ2生成器を局所的にチューニングすることで、エンコーダー型や最適化ベースの逆問題と比較して再構成の忠実度が向上するか?
  • RQ3再構成画像は、標準的なGAN編集手法を用いて意味的に編集可能であり、写真のようにリアルな質を維持できるか?
  • RQ4本手法は、トレーニングデータにおける代表が不足しているグループにも一般化可能であり、GAN応用における多様性と包摂性を向上させるか?

主な発見

  • CelebA-HQで平均MSEが 0.004 ± 0.006 を達成し、次に優れた手法(Projection: 0.074 ± 0.055)と比べて10倍以上低い。
  • LSUN-HorseデータセットではMSEが 0.005 ± 0.009 を達成し、ReStyle(0.159 ± 0.070)やProjection(0.240 ± 0.195)を著しく上回る。
  • すべてのデータセットでLPIPSスコアが顕著に低く、CelebA-HQでは 0.283 ± 0.050、LSUN-Horseでは 0.141 ± 0.043 であり、優れた知覚的類似性を示す。
  • 再構成画像は実写写真と見分けがつかず、StyleSpace や非教師あり編集法を含む標準的なGAN編集ツールで完全に編集可能である。
  • 本手法は、人間の顔、動物、車両など多様なドメインで高い性能を維持しており、広範な適用可能性を示している。
  • 本手法は、代表が不足しているグループに対しても頑健である。これは、分布外サンプルで性能が低下するデータ分布の仮定に依存していないためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。