Skip to main content
QUICK REVIEW

[論文レビュー] Mode Collapse and Regularity of Optimal Transportation Maps

Na Lei, Yang Guo|arXiv (Cornell University)|Feb 8, 2019
Hydrology and Drought Analysis参考文献 25被引用数 22
ひとこと要約

この論文は、データ分布のサポートが非凸である場合に最適輸送写像の不連続性が生じることに起因するGANのモード崩壊を、Monge-Ampère方程式の正則性理論を用いて解明する。代わりに離散Brenier理論を用いて連続的なBrenierポテンシャルを学習することで、モード崩壊を回避した完全なモードカバレッジを達成し、CelebAで5倍の高速化とAE-OTフレームワーク内での安定性向上を実証した。

ABSTRACT

This work builds the connection between the regularity theory of optimal transportation map, Monge-Ampère equation and GANs, which gives a theoretic understanding of the major drawbacks of GANs: convergence difficulty and mode collapse. According to the regularity theory of Monge-Ampère equation, if the support of the target measure is disconnected or just non-convex, the optimal transportation mapping is discontinuous. General DNNs can only approximate continuous mappings. This intrinsic conflict leads to the convergence difficulty and mode collapse in GANs. We test our hypothesis that the supports of real data distribution are in general non-convex, therefore the discontinuity is unavoidable using an Autoencoder combined with discrete optimal transportation map (AE-OT framework) on the CelebA data set. The testing result is positive. Furthermore, we propose to approximate the continuous Brenier potential directly based on discrete Brenier theory to tackle mode collapse. Comparing with existing method, this method is more accurate and effective.

研究の動機と目的

  • 最適輸送理論を用いて、GANの収束困難さとモード崩壊の根本的要因を解明すること。
  • 実データ分布のサポートが非凸であるという仮説を検証し、その結果として最適輸送写像が不連続になることの妥当性を検証すること。
  • 不連続な輸送写像の代わりに連続的なBrenierポテンシャルを近似することで、モード崩壊を克服する新しい手法を提案すること。
  • CelebAデータセットを用いたAE-OTモデルを用いて理論的枠組みを検証すること。
  • 従来のGAN手法と比較して、訓練安定性とモードカバレッジの両方を向上させること。

提案手法

  • GAN、最適輸送写像、およびMonge-Ampère方程式の間の関係を形式化し、ターゲット測度のサポートが非凸である場合に不連続な写像が生じることを示した。
  • 深層ニューラルネットワークで表現可能な凸的かつ連続的な関数であるBrenierポテンシャルを、離散Brenier理論を用いて学習することを提案した。
  • 実データを潜在空間にマップするオートエンコーダを用い、潜在空間内で一様ノイズから符号化されたデータ分布への最適輸送写像を計算した。
  • 凸最適化に基づく離散OTアルゴリズムを用いて写像を計算し、安定性と収束性を保証した。
  • 写像とデコーダ写像の合成によりサンプルを生成し、特異点集合を介して不連続性を明らかにするモーフィングシーケンスを生成した。
  • 25モードの合成データセットとCelebAを用いて、PacGANと比較してモードカバレッジとサンプルの現実性を評価した。

実験結果

リサーチクエスチョン

  • RQ1なぜGANは実際の訓練でモード崩壊と収束問題を経験するのか?
  • RQ2最適輸送写像の不連続性が、これらのGANの失敗の根本的要因であると考えられるか?
  • RQ3深層ニューラルネットワークが連続的なBrenierポテンシャルを効果的に学習できるか?
  • RQ4潜在空間における実データ分布のサポートは一般に非凸的であり、不連続性を避けがたいものであるか?
  • RQ5輸送写像の代わりにBrenierポテンシャルを学習することで、より良いモードカバレッジとサンプル品質が達成できるか?

主な発見

  • AE-OTフレームワークは、CelebAの潜在空間に特異点集合を効果的に検出でき、片方の目が青で片方が茶色の顔を持つモーフィングシーケンスを生成することで不連続性を裏付けた。
  • 実データのサポートが一般に非凸的であるという仮説は、実証的に検証され、不連続な輸送写像が避けがたいことの説明となった。
  • 提案手法は、合成マルチモード実験で25モードすべてを完全にカバーし、PacGANがモード間で不自然なサンプルを生成するのに対し、優れた性能を示した。
  • AE-OTフレームワークは最適輸送ステップの凸性のおかげで、訓練速度を5倍に向上させ、収束安定性を向上させた。
  • 不連続な輸送写像の代わりに連続的なBrenierポテンシャルを学習することで、GANの訓練がより正確かつ安定することが示された。
  • 理論的分析により、DNNは不連続な写像に収束できないことが確認され、モード崩壊と訓練不安定性の根本的要因が解明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。