[論文レビュー] Alleviating Mode Collapse in GAN via Diversity Penalty Module
本稿では、潜在変数同士の類似性とそれらに対応する生成画像特徴の類似性の整合性を保つことで、GANにおけるモード崩壊を軽減する、プラグイン可能な多様性ペナルティモジュール(PDPM)を提案する。正規化されたグラム行列を用いて特徴類似度を測定し、類似度の不一致をペナルティ化することで、画像生成、データ拡張、ドメイン変換といった多様なタスクにおいて、多様性、画像品質、一般化性能が向上し、計算コストの増加を最小限に抑えつつ最先端の性能を達成する。
The vanilla GAN (Goodfellow et al. 2014) suffers from mode collapse deeply, which usually manifests as that the images generated by generators tend to have a high similarity amongst them, even though their corresponding latent vectors have been very different. In this paper, we introduce a pluggable diversity penalty module (DPM) to alleviate mode collapse of GANs. It reduces the similarity of image pairs in feature space, i.e., if two latent vectors are different, then we enforce the generator to generate two images with different features. The normalized Gram matrix is used to measure the similarity. We compare the proposed method with Unrolled GAN (Metz et al. 2016), BourGAN (Xiao, Zhong, and Zheng 2018), PacGAN (Lin et al. 2018), VEEGAN (Srivastava et al. 2017) and ALI (Dumoulin et al. 2016) on 2D synthetic dataset, and results show that the diversity penalty module can help GAN capture much more modes of the data distribution. Further, in classification tasks, we apply this method as image data augmentation on MNIST, Fashion- MNIST and CIFAR-10, and the classification testing accuracy is improved by 0.24%, 1.34% and 0.52% compared with WGAN GP (Gulrajani et al. 2017), respectively. In domain translation, diversity penalty module can help StarGAN (Choi et al. 2018) generate more accurate attention masks and accelarate the convergence process. Finally, we quantitatively evaluate the proposed method with IS and FID on CelebA, CIFAR-10, MNIST and Fashion-MNIST, and the results suggest GAN with diversity penalty module gets much higher IS and lower FID compared with some SOTA GAN architectures.
研究の動機と目的
- 潜在変数が多様であるのにもかかわらず生成されるサンプルが非常に似通ってしまうという、GANにおけるモード崩壊の根本的問題に対処すること。
- GANアーキテクチャを変更せずに、汎用的かつアーキテクチャに依存しないモジュールを構築し、訓練の安定性と多様性を向上させること。
- ピクセル空間ではなく特徴空間において、潜在変数の類似性と生成画像特徴の類似性の整合性を強制すること。
- データ拡張やドメイン変換といった下流タスクにおいて、改善されたサンプル品質と多様性を実現するため、GANの有効な応用を可能にすること。
提案手法
- PDPMは、潜在変数の正規化されたグラム行列を用いて、類似度分布の基準を確立する。
- 偽物画像のためのディスクリミネレータから特徴マップを抽出し、それらの正規化されたグラム行列を計算することで、特徴レベルの類似度を測定する。
- 2つの潜在変数が類似していない場合、それに対応する偽物画像の特徴も類似してはならないという制約を課し、その違反に対して多様性ペナルティを適用する。
- バランス係数λを用いて生成器の学習中にペナルティを適用するが、これ以上のパラメータは追加しない。
- フレームワークはプラグインモジュールとして設計されており、DCGAN、WGAN-GP、StarGANなど、さまざまなGANアーキテクチャと互換性を持つ。
- 特徴空間で動作するため、ピクセル空間よりもロバストであり、他の手法で見られるノイズの多いピクセル生成といった問題を回避する。
実験結果
リサーチクエスチョン
- RQ1GANにおけるモード崩壊を軽減するための汎用モジュールを、元のアーキテクチャを変更せずに設計可能か?
- RQ2潜在変数の類似性と生成画像特徴の類似性の整合性を強制することで、モードカバレッジとサンプルの多様性が向上するか?
- RQ3特徴空間に基づくペナルティ機構は、従来の損失関数の改良やアーキテクチャ変更に比べ、画像品質と多様性の面で優れているか?
- RQ4本手法は、データ拡張やドメイン変換といった下流タスクにおいて、どの程度有効か?
- RQ5PDPMモジュールは、さまざまなGANアーキテクチャとデータセットにおいても性能を維持できるか?
主な発見
- DCGANを用いたCelebAではFIDスコア21.76、WGAN-GPを用いた場合は24.18を達成し、ヴァニラGANや他の最先端手法を顕著に上回った。
- 2次元の合成データセットでは、ヴァニラGANに比べてPDPMを搭載したGANが4つの追加モードを捉えることができ、優れたモードカバレッジを示した。
- 画像データ拡張のタスクでは、MNISTでWGAN-GP比0.24%、Fashion-MNISTで1.33%、CIFAR-10で0.55%の精度向上を達成した。
- 潜在空間における線形補間の結果、MS正則化群とは異なり、PDPMによって生成された遷移は滑らかでノイズのないピクセルを示した。
- ドメイン変換のタスクでは、ヴァニラStarGANに比べ、より速い収束と、顔貌属性転送においてより正確な注目マスクを実現した。
- PDPMモジュールは、画像生成、データ拡張、ドメイン変換といった多様なタスクで高い性能を発揮し、優れた汎用性と低コストな計算負荷を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。