Skip to main content
QUICK REVIEW

[論文レビュー] SAN: Inducing Metrizability of GAN with Discriminative Normalized Linear Layer

Yuhta Takida, Masaaki Imaizumi|arXiv (Cornell University)|Jan 30, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、方向最適性、分離可能性、単射性を通じて識別器が適切な距離測度として機能することを保証することで、メトリシティを強制するシンプルだが効果的なGAN変種、Slicing Adversarial Networks (SAN) を提案する。最終線形層と最適化目的関数のみを変更することで、訓練安定性と性能が向上し、StyleGAN-XLを用いた条件付き生成においてImageNet 256×256で最先端のFIDスコアを達成した。

ABSTRACT

Generative adversarial networks (GANs) learn a target probability distribution by optimizing a generator and a discriminator with minimax objectives. This paper addresses the question of whether such optimization actually provides the generator with gradients that make its distribution close to the target distribution. We derive metrizable conditions, sufficient conditions for the discriminator to serve as the distance between the distributions by connecting the GAN formulation with the concept of sliced optimal transport. Furthermore, by leveraging these theoretical results, we propose a novel GAN training scheme, called slicing adversarial network (SAN). With only simple modifications, a broad class of existing GANs can be converted to SANs. Experiments on synthetic and image datasets support our theoretical results and the SAN's effectiveness as compared to usual GANs. Furthermore, we also apply SAN to StyleGAN-XL, which leads to state-of-the-art FID score amongst GANs for class conditional generation on ImageNet 256$ imes$256. Our implementation is available on https://ytakida.github.io/san.

研究の動機と目的

  • 標準GAN最適化が分布の不一致を低減する意味のある勾配を提供するかどうかを調査すること。
  • 識別器が有効な距離測度となるために必要な十分条件(方向最適性、分離可能性、単射性)を同定すること。
  • 既存のGANをアーキテクチャの大幅な見直しを伴わずにメトリック化可能なモデルに変換できる、シンプルでプラグイン可能な手法を開発すること。
  • 合成データおよび実世界のデータセットを用いた実験により、SANが訓練安定性と生成品質を向上させることを実証的に検証すること。
  • StyleGAN-XLを用いて、ImageNet 256×256におけるクラス条件付き生成タスクで最先端のFID性能を達成すること。

提案手法

  • 関数的平均発散(FM∗)を導入し、スライスされた最適輸送と結びつけることで、メトリシティの条件を形式化する。
  • 3つのメトリシティ条件を提案:方向最適性(最適な勾配方向)、分離可能性(区別可能な分布)、単射性(特徴量から出力への一意の写像)。
  • 最終線形層の変更と最大化目的関数の調整により、方向最適性を強制するようにSANを設計する。
  • DCGAN、BigGAN、StyleGAN-XLなど既存のGANに、最小限の構造的変更でSANを適用する。
  • 実際の応用において単射性と訓練安定性を向上させるために、スペクトル正規化と勾配ペナルティを用いる。
  • FIDとISの指標を用いて、合成データ(ガウス混合モデル)および実データ(CIFAR-10、CelebA、ImageNet)上でSANを訓練・評価する。

実験結果

リサーチクエスチョン

  • RQ1GANにおける識別器が、生成データと実データ分布間の適切な距離測度として機能するのはどのような条件下か?
  • RQ2ミニマックス最適化がなされているにもかかわらず、なぜ標準GANが意味のある勾配信号を提供しないのか?
  • RQ3生成器や識別器の主要部を変更せずに、識別器における方向最適性を強制することは可能か?
  • RQ4メトリシティ条件を強制することで、訓練安定性と生成品質はどのように向上するのか?
  • RQ5SANは、ImageNet 256×256のような大規模な条件付き画像生成タスクで最先端の性能を達成できるか?

主な発見

  • SANは、クラス条件付き生成においてImageNet 256×256で4.78という最先端のFIDスコアを達成した。
  • ガウス混合モデルを用いた実験では、モード崩壊を防ぐために分離可能性を満たすのはSANのみであり、標準GAN(Wasserstein GANを含む)は満たさないことが判明した。
  • ReLUベースの識別器を用いたSANはモード崩壊を示したが、Leaky ReLUや勾配ペナルティを適用することでこれを緩和でき、単射性の重要性が裏付けられた。
  • MNISTおよびCIFAR-10では、Hinge損失、飽和損失、非飽和損失のいずれの設定に対しても、SANはFIDとISを一貫して向上させた。
  • 提案されたSANフレームワークは、既存のGANに最小限の変更(最終線形層と目的関数の変更のみ)で適用可能である。
  • 実験結果から、Wasserstein GANが分離可能性を満たさないことが確認され、これがモードカバレッジにおける回転アーチファクトの原因であると説明できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。