Skip to main content
QUICK REVIEW

[論文レビュー] Properties of f-divergences and f-GAN training

Matt Shannon|arXiv (Cornell University)|Sep 2, 2020
Adversarial Robustness in Machine Learning参考文献 21被引用数 5
ひとこと要約

本稿は、f-発散とf-GAN学習におけるその役割について厳密な分析を提供し、変分下界を導出し、同一分布に近い分布における勾配一致や、f-発散の普遍的一致といった重要な性質を明らかにする。また、評価器と生成器の更新を分離することで安定性を向上させる、わずかに一般化されたf-GAN学習フレームワークを提案する。

ABSTRACT

In this technical report we describe some properties of f-divergences and f-GAN training. We present an elementary derivation of the f-divergence lower bounds which form the basis of f-GAN training. We derive informative but perhaps underappreciated properties of f-divergences and f-GAN training, including a gradient matching property and the fact that all f-divergences agree up to an overall scale factor on the divergence between nearby distributions. We provide detailed expressions for computing various common f-divergences and their variational lower bounds. Finally, based on our reformulation, we slightly generalize f-GAN training in a way that may improve its stability.

研究の動機と目的

  • f-発散の数学的性質、特に分布の小さなずれにおける挙動を明確にすること。
  • f-GAN学習で用いられる変分下界を導出し、それを初等的な微積分に基づいて分析すること。
  • 低次元の生成器のサポートに起因するGAN学習における理論的病理的現象(無限大の発散や勾配の消失)を解消すること。
  • 評価器と生成器の更新を分離することで、学習安定性を向上させる一般化されたf-GAN学習スキームを提案すること。
  • 生成器にノイズを注入することで、全サポートを確保し、f-発散に基づく学習における病理的挙動を排除することを提唱すること。

提案手法

  • 凸共役双対性を用いてf-発散の変分下界を導出し、評価器ネットワークが対数尤度比を近似していることを示す。
  • 分布が近接しているとき、すべてのf-発散がスケール因子まで一致することを確立し、そのスケールはf''(1)によって決定され、局所的領域ではKL発散と関連づけられる。
  • 生成器と評価器の勾配が異なるf-発散関数から導かれる、一般化されたf-GAN更新ルールを導入し、ハイブリッド学習スキームを可能にする。
  • 生成器のすべての段階にノイズを注入することで、出力空間全体に全サポートを確保し、ゼロ密度領域や無限大の発散を排除する。
  • 有限サンプル近似と再パラメータライゼーションが勾配の分散に与える影響を分析し、fにアフィンシフトが再パラメータライゼーション下で勾配に影響しないことを示す。
  • f-発散の最適な評価器はd*(x) = log p(x) - log q(x)であり、生成器のサポートが低次元であると、この関数はほとんど至るところで無限大に発散することを示す。

実験結果

リサーチクエスチョン

  • RQ1真の分布とモデル分布がほぼ同一であるとき、f-発散はどのように振る舞うか?
  • RQ2f-発散がスケール因子まで一致する正確な数学的条件は何か?
  • RQ3なぜ低次元の生成器を備えた標準的なGANは、無限大の発散と勾配の消失を引き起こすのか?
  • RQ4評価器と生成器の更新を分離することで、f-GAN学習を安定化させる一般化は可能か?
  • RQ5生成器にノイズを注入することで、モデル分布のサポートとf-発散計算の有効性にどのような影響を与えるか?

主な発見

  • p ≈ qのとき、すべてのf-発散がスケール因子まで一致し、そのスケールはf''(1)で与えられる。これは、標準的なf-発散が局所的に区別不能であることを意味する。
  • f-発散の変分下界は凸共役双対性を用いて導出され、評価器ネットワークが対数尤度比log p(x)/q(x)を学習していることが示される。
  • 生成器のサポートが低次元であると、すべてのf-発散が定義不能または勾配がゼロに飽和し、学習不能に陥る。
  • 生成器にノイズを注入することで、出力空間全体に全サポートが確保され、無限大の発散が排除され、有効なf-発散計算が可能になる。
  • 生成器に逆KL発散、評価器にジェンセン・シャノン発散を用いたハイブリッドf-GAN学習スキームは、安定性を向上させつつ、逆KL発散を近似的に最小化できる。
  • 評価器が異なるf関数で学習されていても、f-発散の勾配は評価器ネットワークの勾配と一致するため、更新ルールの変更に対しても頑健であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。