Skip to main content
QUICK REVIEW

[論文レビュー] Combating Mode Collapse in GANs via Manifold Entropy Estimation

Haozhe Liu, Bing Li|arXiv (Cornell University)|Aug 25, 2022
Anomaly Detection Techniques and Applications被引用数 4
ひとこと要約

本稿では、生成されたサンプルのエントロピーを埋め込み空間内で最大化することで、モード崩壊を是正する新しいGAN訓練パイプライン、MaEM-GANを提案する。識別器を構造的埋め込み空間を学習するものに一般化し、その上で多様体正則化(DLLEおよびDIsoMap)とリプレイバッファに基づく非パラメトリックエントロピー推定器を導入することで、生成品質を損なわずにサンプルの多様性を向上させ、ベンチマークデータセット上で最先端のGANおよびエネルギー関数モデルを上回る性能を達成する。

ABSTRACT

Generative Adversarial Networks (GANs) have shown compelling results in various tasks and applications in recent years. However, mode collapse remains a critical problem in GANs. In this paper, we propose a novel training pipeline to address the mode collapse issue of GANs. Different from existing methods, we propose to generalize the discriminator as feature embedding and maximize the entropy of distributions in the embedding space learned by the discriminator. Specifically, two regularization terms, i.e., Deep Local Linear Embedding (DLLE) and Deep Isometric feature Mapping (DIsoMap), are designed to encourage the discriminator to learn the structural information embedded in the data, such that the embedding space learned by the discriminator can be well-formed. Based on the well-learned embedding space supported by the discriminator, a non-parametric entropy estimator is designed to efficiently maximize the entropy of embedding vectors, playing as an approximation of maximizing the entropy of the generated distribution. By improving the discriminator and maximizing the distance of the most similar samples in the embedding space, our pipeline effectively reduces the mode collapse without sacrificing the quality of generated samples. Extensive experimental results show the effectiveness of our method, which outperforms the GAN baseline, MaF-GAN on CelebA (9.13 vs. 12.43 in FID) and surpasses the recent state-of-the-art energy-based model on the ANIME-FACE dataset (2.80 vs. 2.26 in Inception score). The code is available at https://github.com/HaozheLiu-ST/MEE

研究の動機と目的

  • 高品質な出力が得られてもサンプルの多様性が制限されるというGANにおける長年の問題、すなわちモード崩壊を解消すること。
  • 識別器の役割を二値分類器から、データ多様体構造を保持する特徴埋め込み器へ再定義することで、GANの訓練安定性と多様性を向上させること。
  • 識別器が学習する埋め込み空間内のエントロピーを最適化することにより、生成分布のエントロピーを間接的に最大化すること。
  • パーティション関数の計算が困難な高次元データにスケーリング可能な、リプレイバッファを活用した非パラメトリックエントロピー推定手法を構築すること。
  • 良好に構造化された埋め込み空間におけるエントロピー最大化が、標準GANおよび最近のエネルギー関数モデルを上回る多様性と再現性を達成できることを実証すること。

提案手法

  • 識別器をスカラー出力から深層特徴埋め込みを出力するものに一般化し、実画像および生成画像をm次元空間にマッピングする特徴埋め込み器に変換する。
  • 埋め込み空間における局所的および大域的多様体構造を保持するため、Deep Local Linear Embedding (DLLE) および Deep Isometric feature Mapping (DIsoMap) を正則化項として導入する。
  • リプレイバッファに基づく非パラメトリックエントロピー推定器(RB-MaEM)を設計し、埋め込み分布のエントロピーを効率的に近似・最大化する。
  • 訓練目的関数として、埋め込みベクトルのエントロピーを最大化することを定式化し、生成データ分布のエントロピー最大化の代理として機能させる。
  • 敵対的損失を維持しつつ、埋め込み空間を通じて多様性を促進するように、エントロピー最大化目的をGAN訓練ループに統合する。
  • 構造的変更を最小限に抑え、標準GANアーキテクチャ(例:StyleGAN-V2、BigGAN)に適用することで、深く複雑なモデルへも汎用性を示す。

実験結果

リサーチクエスチョン

  • RQ1学習された埋め込み空間における生成分布のエントロピーを最大化することで、GANにおけるモード崩壊を効果的に低減できるか?
  • RQ2識別器をどのように再設計すれば、データの内在的多様体構造を保持し、信頼性の高いエントロピー推定を可能にするか?
  • RQ3リプレイバッファに基づく非パラメトリックエントロピー推定器は、高次元埋め込み空間において効率的かつ正確にエントロピーを推定できるか?
  • RQ4埋め込み空間におけるエントロピー最大化は、標準GANと比較して画像品質を劣化させることなく、サンプルの多様性を向上させられるか?
  • RQ5このアプローチは、ベンチマークデータセット上で、多様性と再現性の両指標において、最先端のエネルギー関数モデルを上回ることができるか?

主な発見

  • CelebAデータセットにおいて、MaEM-GANはFID 9.13を達成し、MaF-GANベースライン(12.43)を顕著に上回り、優れた多様性と品質を示した。
  • ANIMEFACEデータセットでは、MaEM-GANがInception Score 2.80を達成し、最近の最先端エネルギー関数モデル(EBM-BB)の2.26を上回った。
  • RB-MaEMを導入した際、I-Varianceスコアは3.41から4.88に上昇し、サンプル多様性の向上が明確に裏付けられた。
  • 深層アーキテクチャ(例:StyleGAN-V2、BigGAN)に適用した際、本手法は一貫して訓練安定性と性能向上を示した。
  • アブレーションスタディにより、DLLEおよびDIsoMapの両方が、効果的なエントロピー最大化を可能にする良好に構造化された埋め込み空間を形成するために不可欠であることが確認された。
  • 埋め込み次元ごとの上位サンプルの可視化から、識別器が色やスタイルといった多様な属性から本物の度合いを評価していることが明らかになり、本手法が多様なデータ変動を捉える能力を持つことが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。