Skip to main content
QUICK REVIEW

[論文レビュー] Variational Autoencoders with Normalizing Flow Decoders

Rogan Morrow, Wei-Chen Chiu|arXiv (Cornell University)|Apr 12, 2020
Generative Adversarial Networks and Image Synthesis参考文献 23被引用数 16
ひとこと要約

この論文では、変分オートエンコーダ(VAE)と正規化フロー・デコーダ(Glow)を組み合わせたハイブリッド生成モデルを提案する。これにより、画像品質を損なわずに訓練効率を向上させている。VAEを最初に訓練し、その後Glowフローでファインチューニングすることで、FIDスコアとビット/次元数において競争力のある性能を達成するとともに、単体のGlowと比較して3.5倍以上の高速化を実現した。

ABSTRACT

Recently proposed normalizing flow models such as Glow have been shown to be able to generate high quality, high dimensional images with relatively fast sampling speed. Due to their inherently restrictive architecture, however, it is necessary that they are excessively deep in order to train effectively. In this paper we propose to combine Glow with an underlying variational autoencoder in order to counteract this issue. We demonstrate that our proposed model is competitive with Glow in terms of image quality and test likelihood while requiring far less time for training.

研究の動機と目的

  • Glowのような正規化フロー・モデルは、構造的制約を補うために深層アーキテクチャを必要とし、計算コストが高く、訓練に時間がかかる問題に対処する。
  • 標準的なVAEは、制限的なガウス分布の仮定と独立した画素デコーダーのため、通常ぼやけた画像を生成する問題を改善する。
  • VAEのコンactな潜在空間を正規化フローの事前分布として活用することで、尤度ベースの生成モデルの訓練を高速化する。
  • 2段階の訓練手順(まずVAEを訓練し、その後Glowフローを追加)が、短時間で競争力のある画像品質を達成できることを示す。

提案手法

  • 深層残差エンコーダと学習可能な対角ガウス分布デコーダを備えた標準的なVAEを用い、コンactかつ分離可能な潜在表現を学習する。
  • VAEの潜在空間上に1層のGlow正規化フローを適用し、複雑で非ガウス的な尤度をモデル化し、生成画像を精緻化する。
  • VAEを最初に1,000エポック訓練し、その後Glowフローをさらに1,000エポックファインチューニングする。潜在空間と最適化スケジュールを共有する。
  • Glowフローを16段の結合層で実装し、各層はReLU活性化関数を備えた全結合層2つから構成され、可逆的で正規化フローに基づく変換を可能にする。
  • VAEデコーダに学習可能なスケールパラメータγを導入し、画素単位のガウス分布の分散を最適化することで、再構成品質を向上させる。
  • 2段階の訓練を実施:まずVAEを最適化して意味のある潜在空間を学習し、次にVAEの潜在コードをGlowフローの入力として用い、精緻化を行う。

実験結果

リサーチクエスチョン

  • RQ1VAEと正規化フロー・デコーダを組み合わせることで、単体のGlowと比較して訓練時間を短縮しつつ、画像品質を維持または向上させられるか?
  • RQ22段階の訓練手順(まずVAEを訓練し、その後Glowフローを追加)は、標準的なVAEと比較して、より高いサンプル多様性とよりシャープな画像をもたらすか?
  • RQ3VAEの潜在空間が、正規化フローの有効な事前分布としてどの程度機能するか?収束速度の向上と尤度スコアの向上に寄与するか?
  • RQ4CIFAR-10およびCelebAにおけるFIDスコアとビット/次元数において、Glow、PixelCNN、Residual Flowといった最先端の尤度ベースモデルと比較して、本モデルはどの程度優れているか?
  • RQ5Glowフローは、VAEの潜在表現を損なわずにコンテンツを保持しつつ、細部を強化する「シャープニング」モジュールとして機能するか?

主な発見

  • 提案モデルはCIFAR-10で42.14のFréchet Inception Distance(FID)を達成し、Glow(46.90)を上回り、他の尤度ベースモデルと同等またはそれを上回る性能を示した。
  • CelebAではFIDが20.59を記録し、Glowの19.00をわずかに上回ったが、競争可能な範囲内にあり、ビット/次元数は≤2.50であった。
  • 単体のGlowと比較して、訓練時間を3.5倍以上短縮した。1つのGTX 1080 Tiで1エポックあたり平均140秒(Glowは約512秒)を記録した。
  • 定性的な結果から、Glow層が「シャープニング」モジュールとして機能することが示された:VAEの出力はぼやけていたが、Glowを通過させた後は顕著にシャープになった。
  • 潜在空間の補間結果から、モデルがコンパクトで分離可能な表現を学習していることが確認され、生成画像間の滑らかな遷移が得られた。
  • VAEにおける学習可能なデコーダ分散の導入により、再構成品質が向上し、正規化フローと組み合わせた場合でも最適なVAEの目的関数に適切に一致するようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。