Skip to main content
QUICK REVIEW

[論文レビュー] How Well Do WGANs Estimate the Wasserstein Metric?

Anton Mallasto, Guido Montúfar|arXiv (Cornell University)|Oct 9, 2019
Generative Adversarial Networks and Image Synthesis参考文献 26被引用数 17
ひとこと要約

この論文は、双対定式化、特にc変換および(c,ε)-変換を用いて、さまざまなWGANバージョンが1-ウォッシャーティン距離をどの程度正確に推定するかを評価している。これらは明示的なリプシッツ制約を回避する。これらの手法は勾配ペナルティや重みクリッピングに比べて、はるかに正確なウォッシャーティン距離の推定を提供するが、それらはぼんやりとした、より現実的でない生成画像を生じる。これは、実際の応用において、度合いの正確さと生成品質の間に乖離があることを示している。

ABSTRACT

Generative modelling is often cast as minimizing a similarity measure between a data distribution and a model distribution. Recently, a popular choice for the similarity measure has been the Wasserstein metric, which can be expressed in the Kantorovich duality formulation as the optimum difference of the expected values of a potential function under the real data distribution and the model hypothesis. In practice, the potential is approximated with a neural network and is called the discriminator. Duality constraints on the function class of the discriminator are enforced approximately, and the expectations are estimated from samples. This gives at least three sources of errors: the approximated discriminator and constraints, the estimation of the expectation value, and the optimization required to find the optimal potential. In this work, we study how well the methods, that are used in generative adversarial networks to approximate the Wasserstein metric, perform. We consider, in particular, the $c$-transform formulation, which eliminates the need to enforce the constraints explicitly. We demonstrate that the $c$-transform allows for a more accurate estimation of the true Wasserstein metric from samples, but surprisingly, does not perform the best in the generative setting.

研究の動機と目的

  • データ分布とモデル分布の間の1-ウォッシャーティン距離を推定する、さまざまなWGAN手法の正確さを評価すること。
  • より正確なウォッシャーティン距離推定が、実際の生成画像品質を向上させるかどうかを調査すること。
  • 勾配ペナルティおよび重みクリッピングと比較して、c変換、(c,ε)-変換、勾配ペナルティ、重みクリッピングの距離推定性能を、さまざまな訓練および評価条件下で比較すること。
  • ミニバッチサイズおよび訓練方式が距離推定の安定性と生成モデルの性能に与える影響を分析すること。

提案手法

  • c変換定式化を用いて、ディスクライマーに明示的なリプシッツ制約を課すことなく、ウォッシャーティン距離を推定する。
  • (c,ε)-変換はc変換にエントロピー正則化を適用し、サンプル複雑性と数値安定性を向上させる。
  • 本研究では、勾配ペナルティ、重みクリッピング、c変換、(c,ε)-変換の4つのWGAN訓練方式を比較し、ミニバッチおよび全データセット評価を用いる。
  • 距離推定の正確さは、POTライブラリを用いて計算された真値のウォッシャーティン距離とディスクライマー出力を比較することで測定する。
  • 生成モデルの訓練は、CelebAデータセットを用い、DCGANアーキテクチャを採用し、生成器の反復回数50,000回にわたり距離指標を追跡する。
  • CIFAR-10およびCelebAのサブセットを用い、異なるバッチサイズ(N=64, 512)で実験を行い、一般化性能および安定性を評価する。

実験結果

リサーチクエスチョン

  • RQ1さまざまなWGANバージョンは、データ分布とモデル分布の間の真の1-ウォッシャーティン距離をどの程度正確に推定するか?
  • RQ2ウォッシャーティン距離の推定が向上しても、実際の生成画像品質が向上するのか?
  • RQ3c変換および(c,ε)-変換は、勾配ペナルティおよび重みクリッピングと比較して、距離推定の正確さと訓練の安定性においてどのように異なるか?
  • RQ4訓練バッチサイズおよび評価バッチサイズが、ウォッシャーティン距離推定の信頼性に与える影響は何か?
  • RQ5距離推定が劣っているにもかかわらず、なぜ勾配ペナルティ法が優れた生成結果を生み出すのか?

主な発見

  • c変換および(c,ε)-変換は、勾配ペナルティおよび重みクリッピングに比べて、真のウォッシャーティン距離を著しく正確に推定する。
  • 距離推定の正確さに優れるにもかかわらず、c変換および(c,ε)-変換は勾配ペナルティ法に比べてぼんやりとした、より現実的でない画像を生成する。
  • 勾配ペナルティ法はウォッシャーティン距離の推定が正確でないが、より高品質で多様性に富み、シャープな画像を生成する。
  • 重みクリッピングは収束が意味のある結果に至らず、距離推定の安定性はあるが、画像品質は劣る。
  • (c,ε)-変換は、さまざまな訓練および評価バッチサイズ下でも安定性が向上しており、良好なサンプル複雑性を示している。
  • c変換法で観察されるぼんやりとした現象は、エントロピー正則化によるものではなく、c変換定式化そのものに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。