Skip to main content
QUICK REVIEW

[論文レビュー] Generate High Resolution Images With Generative Variational Autoencoder

Abhinav Sagar|arXiv (Cornell University)|Aug 12, 2020
Generative Adversarial Networks and Image Synthesis参考文献 35被引用数 6
ひとこと要約

本論文では、変分オートエンコーダー(VAE)とGANに類似した識別器を組み合わせた新規な生成モデルを提案する。VAEのデコーダーを識別器に置き換えることで、エンコーダーを維持したまま、画像のシャープネスと複数の指標における性能を向上させ、MNIST、LSUN、CelebAデータセットにおいて、先行する最先端手法を上回る性能を発揮する。

ABSTRACT

In this work, we present a novel neural network to generate high resolution images. We replace the decoder of VAE with a discriminator while using the encoder as it is. The encoder is fed data from a normal distribution while the generator is fed from a gaussian distribution. The combination from both is given to a discriminator which tells whether the generated image is correct or not. We evaluate our network on 3 different datasets: MNIST, LSUN and CelebA dataset. Our network beats the previous state of the art using MMD, SSIM, log likelihood, reconstruction error, ELBO and KL divergence as the evaluation metrics while generating much sharper images. This work is potentially very exciting as we are able to combine the advantages of generative models and inference models in a principled bayesian manner.

研究の動機と目的

  • 高解像度の画像を、改善された知覚的品質で生成できる深層生成モデルの開発。
  • 変分推論(VAE)と敵対的学習(GAN)の長所を、整合的なベイジアンフレームワーク内で統合すること。
  • 標準的なVAEがシャープな画像を生成する点で抱える制限を克服するため、デコーダーを識別器に置き換えること。
  • MMD、SSIM、対数尤度、再構成誤差を含む複数の指標を用いて、多様なデータセット上でモデルを評価すること。

提案手法

  • VAEのエンコーダーを保持し、標準正規分布からの潜在コードを潜在表現にマッピングする。
  • 同じ潜在コードを入力として受け取り、従来のVAEのデコーダーに代わる画像サンプルを生成する生成ネットワークを導入する。
  • 識別器を訓練し、実画像と生成画像を区別させ、敵対的フィードバックを提供する。
  • VAEの目的関数(ELBO、KLダイバージェンス)と敵対的損失を組み合わせて、エンドツーエンドでモデルを訓練することで、画像品質を向上させる。
  • 潜在コードはガウス事前分布からサンプリングされ、生成ネットワークはこれらのサンプルに条件付けられて画像を生成する。
  • 再構成、尤度、敵対的目的を同時に最適化することで、忠実性と多様性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1VAEのデコーダーを識別器に置き換えることで、生成される高解像度画像の品質が向上するか?
  • RQ2提案されたVAE-GANハイブリッドモデルは、画像のシャープネスと指標性能の面で、最先端手法と比較してどのように差をつけるか?
  • RQ3変分推論と敵対的学習を組み合わせることで、ベイジアンフレームワーク内での生成品質がどの程度向上するか?
  • RQ4モデルはMNIST、LSUN、CelebAのような多様なデータセットに一般化可能か?

主な発見

  • 提案モデルは、MMD、SSIM、対数尤度、再構成誤差を含む複数の評価指標において、MNIST、LSUN、CelebAデータセットで最先端の性能を達成した。
  • 知覚的品質の向上と再構成誤差の低減が裏付けられており、標準的なVAEと比較して、顕著にシャープな画像を生成している。
  • VAEとGANのコンポonentの組み合わせにより、ELBOが向上し、KLダイバージェンスが低減しており、事後分布の近似が改善されていることが示された。
  • 整合的なベイジアンフレームワーク内で、現実的で多様性に富んだ高解像度画像を、従来の手法を上回る形で生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。