Skip to main content
QUICK REVIEW

[論文レビュー] Regularized Autoencoders via Relaxed Injective Probability Flow

Abhishek Kumar, Ben Poole|arXiv (Cornell University)|Feb 20, 2020
Generative Adversarial Networks and Image Synthesis参考文献 36被引用数 10
ひとこと要約

本稿では、可逆フローの双方向性制約を緩和することで、低次元の潜在空間から高次元のデータへの単射写像を用いる生成モデルであるInjective Flowを提案する。これにより、下界付き確率フローを介した tractable な学習が可能となり、VAE やオートエンコーダーを上回るサンプル品質が達成され、CIFAR-10 および CelebA で最先端の FID スコアを達成するとともに、圧縮された潜在空間を維持する。

ABSTRACT

Invertible flow-based generative models are an effective method for learning to generate samples, while allowing for tractable likelihood computation and inference. However, the invertibility requirement restricts models to have the same latent dimensionality as the inputs. This imposes significant architectural, memory, and computational costs, making them more challenging to scale than other classes of generative models such as Variational Autoencoders (VAEs). We propose a generative model based on probability flows that does away with the bijectivity requirement on the model and only assumes injectivity. This also provides another perspective on regularized autoencoders (RAEs), with our final objectives resembling RAEs with specific regularizers that are derived by lower bounding the probability flow objective. We empirically demonstrate the promise of the proposed model, improving over VAEs and AEs in terms of sample quality.

研究の動機と目的

  • 可逆フローのモデルが双方向性制約により入力と潜在空間の次元が等しくならなければならないことによる、高い計算コストとメモリ消費を緩和すること。
  • 双方向性を単射性に緩和することで、圧縮された潜在空間を有する効率的でスケーラブルな生成モデリングを可能にすること。
  • 確率フローから導出される tractable な学習目的を、従来の正則化オートエンコーダーで用いられる正則化戦略の自然な動機づけとする。
  • 低次元の潜在空間を維持しつつ、VAE や標準オートエンコーダーと比較してサンプル品質と FID スコアを向上させること。
  • 正則化オートエンコーダーを、導出された正則化子を有する確率フロー目的と結びつけることで、新たな視点を提供すること。

提案手法

  • 次元が $ d \ll D $ である $ g: \mathbb{R}^d \to \mathbb{R}^D $ のような単射で微分可能な写像 $ g $ を用い、$ g $ はその像 $ g(Z) $ 上でのみ逆写像を持つ。
  • 単射写像に適用可能な変数変換の公式を適用し、ヤコビアン行列式 $ \left| \det J_g(z)^\top J_g(z) \right|^{1/2} $ を含む対数尤度の式を導出する。
  • ヤコビアン項を最適化に tractable にするために、確率的近似を用いて確率フロー目的の下界を導出する。
  • 学習中に単射性を強制するために、アンモアタイズドエンコーダーとペナルティ法を用い、訓練データ点において $ g(h(x)) \approx x $ を近似する。
  • 確率フロー枠組みから自然に導かれる滑らかさ正則化子を導入し、従来のオートエンコーダー研究で用いられる正則化と類似した形をとる。
  • 潜在空間にガウス分布またはガウス混合モデルを事前分布として用い、FID スコアの向上を図るために、推定後に適合した事前分布をサンプリングに用いる。

実験結果

リサーチクエスチョン

  • RQ1単射写像は、次元削減と計算コストの低減を図るために、可逆フロー生成モデルにおける双方向写像の代わりに使用可能か?
  • RQ2双方向性を単射性に緩和しても、依然として tractable な学習目的を備えた高品質なサンプル生成が可能か?
  • RQ3確率フロー枠組みは、正則化オートエンコーダーで用いられる正則化戦略を自然に動機づけ、正当化できるか?
  • RQ4VAE やオートエンコーダーと比較して、Injective Flow モデルの性能は、サンプル品質と FID スコアの観点でどの程度か?
  • RQ5低次元の潜在空間を維持しつつ、Prior regularized autoencoders よりも優れた FID スコアを達成できるか?

主な発見

  • 提案された Injective Flow モデルは、CIFAR-10 および CelebA で、VAE や標準オートエンコーダーを上回る最先端の FID スコアを達成した。
  • MNIST では β-VAE と同等の性能を示したが、FID スコアではわずかに β-VAE が上回った。
  • アニールドでデータ依存の $ \lambda $ を用いる InjFlow ℓn は、固定値 $ \lambda=1 $ を用いた InjFlow よりも優れた FID スコアを達成しており、適応的正則化の重要性を示している。
  • 可視化結果から、VAE よりもシャープで、髪の毛の細かなディテールなど、より多くの微細な特徴を保持した InjFlow のサンプルが得られている。
  • VAE や標準オートエンコーダーと比較して、InjFlow の再構成はより微細なディテールを保持しており、FID スコアの向上と整合的である。
  • 単一のガウス分布ではなく、推定後に適合したガウス混合モデル(GMM)を事前分布として用いることで、FID スコアがさらに向上した。これは、事前分布の表現力がサンプル品質を向上させることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。