Skip to main content
QUICK REVIEW

[論文レビュー] Representational aspects of depth and conditioning in normalizing flows

Frederic Koehler, Viraj Mehta|arXiv (Cornell University)|Oct 2, 2020
Generative Adversarial Networks and Image Synthesis参考文献 27被引用数 7
ひとこと要約

本稿は、正規化フローの表現能力について、深さと条件付けの観点から調査する。アフィンカップリング層が定数深度で置換や1×1畳み込みを正確に表現できることを証明し、悪条件化を許容すれば浅いネットワークが Wasserstein 距離において普遍近似可能であることを示している。主な貢献は、有界リプシッツ定数と1層あたりのニューロン数が少ない一般逆変換アーキテクチャに対して理論的な深さの下界を確立することにある。

ABSTRACT

Normalizing flows are among the most popular paradigms in generative modeling, especially for images, primarily because we can efficiently evaluate the likelihood of a data point. This is desirable both for evaluating the fit of a model, and for ease of training, as maximizing the likelihood can be done by gradient descent. However, training normalizing flows comes with difficulties as well: models which produce good samples typically need to be extremely deep -- which comes with accompanying vanishing/exploding gradient problems. A very related problem is that they are often poorly conditioned: since they are parametrized as invertible maps from $\mathbb{R}^d o \mathbb{R}^d$, and typical training data like images intuitively is lower-dimensional, the learned maps often have Jacobians that are close to being singular. In our paper, we tackle representational aspects around depth and conditioning of normalizing flows: both for general invertible architectures, and for a particular common architecture, affine couplings. We prove that $Θ(1)$ affine coupling layers suffice to exactly represent a permutation or $1 imes 1$ convolution, as used in GLOW, showing that representationally the choice of partition is not a bottleneck for depth. We also show that shallow affine coupling networks are universal approximators in Wasserstein distance if ill-conditioning is allowed, and experimentally investigate related phenomena involving padding. Finally, we show a depth lower bound for general flow architectures with few neurons per layer and bounded Lipschitz constant.

研究の動機と目的

  • 正規化フローの表現制限が深さと条件付けによってどのように生じるかを理解すること。
  • 分割や置換層といったアーキテクチャ的選択がアフィンカップリングフローの表現力に制限を及えるかどうかを分析すること。
  • 複雑な分布を近似するための逆変換ネットワークに必要な深さの理論的境界を確立すること。
  • ヤコビアンの条件付け(例:特異ヤコビアン)がモデルの表現力と学習安定性に与える影響を調査すること。

提案手法

  • Θ(1) のアフィンカップリング層が任意の置換や1×1畳み込みを正確に表現できることを証明し、分割の選択が表現のボトルネックでないことを示した。
  • ランダムマスクとガウス混合分布を用いた構成により、悪条件化を許容すれば浅いアフィンカップリングネットワークが Wasserstein 距離において分布を普遍的に近似可能であることを示した。
  • パrameter空間上のエpsilonネットを用いて近似誤差の境界を定め、逆変換ネットワークのリプシッツ連続性を活用した。
  • ボブコフ=ゲーツェの不等式を用いて Wasserstein 距離とKL発散度の関係を確立し、Wasserstein 距離からKL発散度の下界を導出可能とした。
  • 一般逆変換アーキテクチャの深さの下界を、マルチモーダル分布の族と三角不等式の議論を用いて導出した。
  • 極値組合せ論の結果(RödlとThoma, 1996)を活用し、近似が難しい分布を構成するための高次元ベクトルの低重複部分集合を構築した。

実験結果

リサーチクエスチョン

  • RQ1固定された層数のアフィンカップリング層は、GLOW などのモデルで使われる1×1畳み込みや置換を正確に表現できるか?
  • RQ2悪条件化を許容すれば、浅いアフィンカップリングネットワークが Wasserstein 距離において普遍近似を達成できるか?
  • RQ3重みが有界で1層あたりのニューロン数が少ない場合、一般逆変換アーキテクチャが複雑な分布を表現するために必要な最小深さは何か?
  • RQ4ヤコビアンの条件付けは、正規化フローの表現力と学習安定性にどのように影響するか?
  • RQ5標準的な学習設定においてパディングや置換層なしに普遍近似を達成できるか?

主な発見

  • Θ(1) の深さを持つアフィンカップリング層は、任意の置換や1×1畳み込みを正確に表現可能であり、分割が表現のボトルネックでないことを証明した。
  • 悪条件化を許容すれば、浅いアフィンカップリングネットワークは Wasserstein 距離において普遍近似可能である。これはマスクを施したガウス混合分布を用いた構成により実証された。
  • 有界リプシッツ定数と1層あたりのニューロン数が少ない一般逆変換アーキテクチャに対して深さの下界を確立し、特定のマルチモーダル分布を表現するには深さが必須であることを示した。
  • 平均が分離されたk個のガウス分布の混合は、εに依存しないサイズO(k)のネットワークのプッシュフォワードによって近似可能であるが、重みはεに比例して増大する。
  • 標準ガウス分布をL-リプシッツ生成器でプッシュフォワードした分布は、サブガウス尾部条件を満たし、ボブコフ=ゲーツェの不等式を適用可能とし、Wasserstein 距離とKL発散度の関係を確立できる。
  • パrameter空間上のエpsilonネットを用いた議論により、理論的結果が裏付けられており、任意の逆変換ネットワークが期待値においてε以内に有限サイズO((LR/ε)^d')の集合で近似可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。