Skip to main content
QUICK REVIEW

[論文レビュー] Normalizing Flows Across Dimensions

Edmond Cunningham, Renos Zabounidis|arXiv (Cornell University)|Jun 23, 2020
Generative Adversarial Networks and Image Synthesis参考文献 24被引用数 6
ひとこと要約

本稿では、ノイズモデルを用いた単射変換を導入することで、低次元のデータ多様体を学習できる一般化された正規化フローであるノイズ付き単射フロー(NIF)を提案する。NIFは、調整可能なノイズパラメータにより多様体からの制御されたずれを許容することで、サンプル品質とFIDスコアを向上させつつ、正確な対数尤度計算を維持する。

ABSTRACT

Real-world data with underlying structure, such as pictures of faces, are hypothesized to lie on a low-dimensional manifold. This manifold hypothesis has motivated state-of-the-art generative algorithms that learn low-dimensional data representations. Unfortunately, a popular generative model, normalizing flows, cannot take advantage of this. Normalizing flows are based on successive variable transformations that are, by design, incapable of learning lower-dimensional representations. In this paper we introduce noisy injective flows (NIF), a generalization of normalizing flows that can go across dimensions. NIF explicitly map the latent space to a learnable manifold in a high-dimensional data space using injective transformations. We further employ an additive noise model to account for deviations from the manifold and identify a stochastic inverse of the generative process. Empirically, we demonstrate that a simple application of our method to existing flow architectures can significantly improve sample quality and yield separable data embeddings.

研究の動機と目的

  • 正規化フローが低次元データ多様体を学習できないという制限を解消し、高品質な画像生成を可能にすること。
  • 可逆性と正確な対数尤度計算を保ちながら、正規化フローにおける次元を跨ぐ変換を可能にすること。
  • 正確に多様体上ではなく、多様体に近いデータをモデル化するための原理的かつ整合性のある手法を提供すること。
  • 推論と学習をサポートする柔軟なサンプリングと向上した生成性能を実現する、確率的逆写像の定義。
  • 学習済み多様体からの制御されたずれが、対数尤度を劣化させることなくFIDスコアを向上させることを示すこと。

提案手法

  • NIFは、低次元の潜在空間を高次元のデータ空間における学習済み多様体へ写像する単射的かつ次元削減型の変換を用いる。
  • 実世界のノイズを含むデータ点を補完するため、多様体からのずれを扱うための確率的ノイズモデルを導入する。
  • 生成プロセスの確率的逆写像を定義することで、確率論的に整合性のある枠組みで学習と推論を両立させる。
  • 最終層のノイズ分散を制御するスカラー1つのパラメータ $ s $ が、サンプルのシャープネスと品質の事後調整を可能にする。
  • 既存の正規化フローのアーキテクチャと互換性があり、プラグイン型の拡張として適用可能である。
  • 単射的かつ非双射的写像であるにもかかわらず、変数変換の公式の下界を用いることで、最尤推定が可能となる。

実験結果

リサーチクエスチョン

  • RQ1正規化フローを、正確な対数尤度計算を維持したまま、低次元データ多様体を学習できるように一般化できるか?
  • RQ2多様体からのずれを、サンプル品質と生成性能の向上に寄与する形でどのようにモデル化できるか?
  • RQ3単射フローに対して、原理的かつ整合性のある方法で学習と推論を可能にする確率的逆写像を定義できるか?
  • RQ4サンプリング時に制御されたノイズを導入することで、対数尤度を劣化させることなくFIDスコアを向上させられるか?
  • RQ5同じモデルアーキテクチャを用いて、多様体上でのシャープな画像生成と、多様体外での多様なサンプル生成を両立できるか?

主な発見

  • CelebAでは、NIFがFIDスコア30.96を達成し、潜在次元128のベースライン正規化フロー(63.07)を著しく上回った。
  • Fashion MNISTでは、NIFがFIDスコア23.23を達成したのに対し、ベースライン正規化フローは42.77であった。これは顕著なサンプル品質の向上を示している。
  • 対数尤度性能は維持またはわずかに向上し、CelebAにおけるNIF-128のビット/次元値は0.835であったのに対し、ベースライン正規化フローは0.852であった。
  • FIDスコアは非ゼロのノイズレベル(例:$ s \approx 0.5 $)で最小値を示し、多様体からのわずかなずれが分類器ベースの指標を向上させることを示している。
  • 多様体上に直接生成されたサンプル($ s = 0.0 $)は、標準的な正規化フローのものよりも視覚的にシャープで整合性が高かった。
  • CIFAR-10やFashion MNISTを含む複数のデータセットで一貫した性能向上が得られ、最小限のハイパーパrameterチューニングで実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。