Skip to main content
QUICK REVIEW

[論文レビュー] Image Generation and Editing with Variational Info Generative AdversarialNetworks

Mahesh Gorijala, Ambedkar Dukkipati|arXiv (Cornell University)|Jan 17, 2017
Generative Adversarial Networks and Image Synthesis参考文献 4被引用数 8
ひとこと要約

この論文では、変分オートエンコーダー(VAEs)とInfoGANを組み合わせることで、画像とその視覚的記述を共同でモデリングする生成モデルであるVariational InfoGAN(ViGAN)を提案する。教師ありの潜在変数を用いた推論ネットワークを統合することで、ViGANは条件付き画像生成と属性ベースの画像編集を可能にするとともに、VAEsよりもシャープなサンプルを生成し、標準的なGANよりもより分離可能な表現を得られる。

ABSTRACT

Recently there has been an enormous interest in generative models for images in deep learning. In pursuit of this, Generative Adversarial Networks (GAN) and Variational Auto-Encoder (VAE) have surfaced as two most prominent and popular models. While VAEs tend to produce excellent reconstructions but blurry samples, GANs generate sharp but slightly distorted images. In this paper we propose a new model called Variational InfoGAN (ViGAN). Our aim is two fold: (i) To generated new images conditioned on visual descriptions, and (ii) modify the image, by fixing the latent representation of image and varying the visual description. We evaluate our model on Labeled Faces in the Wild (LFW), celebA and a modified version of MNIST datasets and demonstrate the ability of our model to generate new images as well as to modify a given image by changing attributes.

研究の動機と目的

  • 画像と視覚的記述の表現を共同で学習することで、より優れた分離性と解釈可能性を実現する生成モデルの開発。
  • 視覚的記述や属性に条件付けた画像生成を可能にする。
  • 他のコンテンツを保持したまま、特定の属性のみを変更することで、既存の画像を編集可能にする。
  • VAEsの再構成性能とGANのサンプル品質を統合し、両者の欠点を補完する。
  • 生成モデルと同時に推論ネットワークを共同で学習させ、事後分布推定と生成のエンドツーエンド学習を可能にする。

提案手法

  • VAEsとInfoGANをハイブリッド化したアーキテクチャを導入し、潜在変数のサブセット(c)を用いて分離可能で解釈可能な属性を表現する。
  • エンコーダーネットワークを用いて画像入力xの事後分布q(z|x)を推定し、生成器と判別器と併せてエンドツーエンド学習を可能にする。
  • 分離可能な潜在コードcと生成画像xの間の相互情報量を最適化することで、意味のある属性分離を促進する。
  • VAE再構成損失、KLダイバージェンス、GANの敵対的損失、および属性固有の識別損失を組み合わせた共同損失関数を用いてモデルを訓練する。
  • マルチヘッド識別ヘッドを導入し、潜在コードから視覚的属性を予測可能とし、推論時に属性編集を実現する。
  • Adam最適化手法を用い、生成器、判別器、エンコーダー、識別器それぞれに別々の学習率を設定し、ハイパーパrameter λ₁ と λ₂ で再構成と属性感受性のバランスを調整する。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、画像属性の分離可能な表現を学習するとともに、条件付きで現実的で高品質な画像を生成できるか?
  • RQ2特定の属性のみを変更することで、他のコンテンツを保持したまま意味のある画像編集が可能か?
  • RQ3VAEとInfoGANを組み合わせることで、単独のVAEsやGANよりもサンプル品質と分離性が向上するか?
  • RQ4生成器と判別器と同時に推論ネットワークをエンドツーエンドで学習させることで、より良い事後分布近似と生成性能が得られるか?
  • RQ5モデルの編集能力はハイパーパrameterの選択、特にλ₁ と λ₂ にどれほど敏感か?

主な発見

  • ViGANは、VAEで生成されるサンプルがぼやける傾向にあるのと比べ、より現実的でシャープな高品質な画像を生成した。
  • モデルは効果的な属性ベースの画像編集を実現した:MNISTでは数字ラベルの変更、CelebAでは眼鏡の追加、LFWでは顔の表情の変更が、空間的構造を保持したまま可能となった。
  • MNIST、CelebA、LFWにおける再構成結果から、モデルが高い忠実度を維持しており、エンコーダーが入力画像から正確に潜在変数を推定していることが示された。
  • 標準的なGANよりも優れた属性分離性を達成しており、意図した属性のみが変化する制御された編集によってそれが裏付けられた。
  • 画像編集の性能はハイパーパrameter λ₁ と λ₂ に強く依存しており、再構成精度と属性感受性のバランスをとるための慎重なチューニングが必要であることがわかった。
  • 定性的な比較から、ViGANのサンプルはVAEsやGAN単体よりも現実的であることが明らかとなり、両モデルの長所を効果的に融合したことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。