Skip to main content
QUICK REVIEW

[論文レビュー] Disentangled Inference for GANs with Latently Invertible Autoencoder

Jiapeng Zhu, Deli Zhao|arXiv (Cornell University)|Jun 19, 2019
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、潜在空間に対称的な可逆ネットワークを埋め込むことで、GANにおける分離可能な推論を可能にする2段階手法であるLatently Invertible Autoencoder (LIA) を提案する。最初にGANデコーダーを訓練し、その後別個のオートエノードで分離可能なエンコーダーを学習することで、従来手法に比べて優れた画像再構成性能と高速な収束を達成し、FFHQおよびLSUNデータセットで最先端の結果を達成した。

ABSTRACT

Generative Adversarial Networks (GANs) play an increasingly important role in machine learning. However, there is one fundamental issue hindering their practical applications: the absence of capability for encoding real-world samples. The conventional way of addressing this issue is to learn an encoder for GAN via Variational Auto-Encoder (VAE). In this paper, we show that the entanglement of the latent space for the VAE/GAN framework poses the main challenge for encoder learning. To address the entanglement issue and enable inference in GAN we propose a novel algorithm named Latently Invertible Autoencoder (LIA). The framework of LIA is that an invertible network and its inverse mapping are symmetrically embedded in the latent space of VAE. The decoder of LIA is first trained as a standard GAN with the invertible network and then the partial encoder is learned from a disentangled autoencoder by detaching the invertible network from LIA, thus avoiding the entanglement problem caused by the random latent space. Experiments conducted on the FFHQ face dataset and three LSUN datasets validate the effectiveness of LIA/GAN.

研究の動機と目的

  • GAN推論における根本的な課題、すなわち実画像を潜在空間に信頼性高く符号化できないことに対処すること。
  • VAEベースのGAN推論手法における性能の低さの主な要因として、潜在空間(z空間)のエンタングルメントを特定すること。
  • 画像生成品質を損なわせることなく、正確で分離可能な潜在コード推論を可能にする手法を開発すること。
  • デコーダー事前学習とエンコーダー学習を分離する2段階訓練スキームを設計し、エンタングルメント問題を回避すること。

提案手法

  • LIAはオートエノードの潜在空間に、可逆ネットワークとその逆関数を対称的に埋め込み、潜在コードと画像特徴の間で双方向マッピングを可能にする。
  • デコーダーは、可逆ネットワークを用いて潜在空間から画像空間へマッピングする標準的なGANとして事前に訓練される。
  • その後、可逆ネットワークを分離して、分離可能なオートエノードからエンコーダーを学習することで、学習された潜在コードが分離されていることを保証する。
  • 本手法は2段階の訓練プロセスを用いる:まず可逆ネットワークを備えたGANを訓練し、次に分離可能な潜在空間上でエンコーダーを学習する。
  • 可逆ネットワークにより正確な再構成が可能となり、最適化の安定性を高めるために潜在コードの初期化が可能になる。
  • フレームワークは、デコーダーを任意のGAN生成器に置き換え可能であり、画像編集やデータ拡張など多様な応用が可能である。

実験結果

リサーチクエスチョン

  • RQ1VAEベースのGAN推論手法は変分推論を用いているにもかかわらず、なぜ高い再構成品質を達成できないのか?
  • RQ2元の潜在空間(z空間)のエンタングルメントと、中間潜在空間(y空間)の分離性の両者を比較した場合、推論性能にどのような差が生じるか?
  • RQ3潜在空間に対称的な可逆ネットワークを導入することで、GANインバージョンの精度と安定性が向上するか?
  • RQ4LIAのエンコーダー出力を最適化の初期化に用いることで、ランダム初期化や平均ベース初期化(Image2StyleGANで用いられるもの)に比べ、収束が速くなり、再構成品質が向上するか?
  • RQ52段階訓練スキームは、GAN生成とエンコーダー学習を効果的に分離しつつ、分離性を維持できるか?

主な発見

  • LIAはFFHQデータセットにおいて、比較手法の中で最高の再構成品質を達成し、FIDおよびLPIPSスコアが最高水準であった。
  • 図12に示すように、LIAのエンコーダー出力を初期化に用いることで、最適化中の収束が速く、再構成損失も低くなった。
  • 再構成忠実度と収束速度の両面で、ランダム初期化や平均ベース初期化(Image2StyleGANで用いられるもの)を著しく上回った。
  • 図9および表4の定性的な結果から、LIAは他の手法に比べてモナリザの髪型のような微細なディテールをより正確に回復していることが確認された。
  • y空間(分離済み)での最適化では、z空間(エンタングルド)での最適化に比べて優れた収束と再構成性能を示し、分離性が成功したGAN推論にとって不可欠であることを実証した。
  • 2段階訓練スキームはエンタングルメント問題を効果的に回避し、GANの生成能力を損なわせることなく、高品質なエンコーダー学習を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。