Skip to main content
QUICK REVIEW

[論文レビュー] Training Generative Adversarial Networks Via Turing Test

Jianlin Su|arXiv (Cornell University)|Oct 25, 2018
Generative Adversarial Networks and Image Synthesis参考文献 14被引用数 11
ひとこと要約

本稿では、敵対的プロセスをトレーニングのチューリングテストとして解釈する T-GANs と呼ばれる生成対抗ネットワークの新規トレーニングフレームワークを提案する。このフレームワークは、$\tilde{p}(x_r)q(x_f)$ と $\tilde{p}(x_f)q(x_r)$ の間の距離を最小化することで、実サンプルの信号を生成器トレーニング中に組み込む。これにより、ハイパーパramータのチューニングなしに、256×256の高解像度画像においても高速収束と安定したトレーニングを達成する。

ABSTRACT

In this article, we introduce a new mode for training Generative Adversarial Networks (GANs). Rather than minimizing the distance of evidence distribution $ ilde{p}(x)$ and the generative distribution $q(x)$, we minimize the distance of $ ilde{p}(x_r)q(x_f)$ and $ ilde{p}(x_f)q(x_r)$. This adversarial pattern can be interpreted as a Turing test in GANs. It allows us to use information of real samples during training generator and accelerates the whole training procedure. We even find that just proportionally increasing the size of discriminator and generator, it succeeds on 256x256 resolution without adjusting hyperparameters carefully.

研究の動機と目的

  • 256×256 画像などの高解像度データセットにおける、標準 GAN の不安定さと遅い収束を解決すること。
  • 標準 GAN では生成器が、実データの記憶に基づくディスクラミネータのフィードバックしか受け取らないが、これに直接的な実サンプル信号を組み込むことの制限を克服すること。
  • SGAN や WGAN などの既存の GAN フレームワークに統合可能な汎用的なトレーニングパラダイムを開発すること。
  • 生成器の更新時に実サンプル情報を取り入れることで、トレーニングの安定性と収束速度が向上することを実証すること。

提案手法

  • 実サンプル $x_r$ と偽サンプル $x_f$ の間の結合分布 $\tilde{p}(x_r)q(x_f)$ と $\tilde{p}(x_f)q(x_r)$ の距離を最小化する新しい敵対的目的を提案する。
  • 実画像と偽画像の両方を入力とし、エンコーダ $E(\bullet)$ とマルチレイヤーパーセプトロン $D(\bullet)$ を用いて、符号化特徴の差に基づいてスカラー出力を計算するディスクラミネータ $T(x_r, x_f)$ を設計する。
  • 新しい目的を標準 GAN(T-SGANs)およびワッサーシュタイン GAN(T-WGANs)に統合し、既存のアーキテクチャとの互換性を確保する。
  • GAN で一般的な手法に従い、ディスクラミネータ $T(x_r, x_f)$ にスペクトル正規化を適用してトレーニングを安定化させる。
  • 生成器をディスクラミネータの更新毎に2回更新する、修正されたトレーニングスケジュールを採用し、トレーニング効率を向上させる。
  • すべての解像度で同一のハイパーパramータ(初期学習率 lr=0.0002、betas=0.5)を用いて、Adam 最適化手法でモデルをトレーニングする。

実験結果

リサーチクエスチョン

  • RQ1生成器トレーニング中に直接的な実サンプル信号を組み込むことで、GAN の収束速度と安定性が向上するか?
  • RQ2提示されたチューリングテストにインspiredされた目的関数は、高解像度画像生成において、標準 GAN よりもトレーニングの安定性と FID スコアで優れているか?
  • RQ3T-GANs は、広範なハイパーパramータチューニングなしに、高品質な 256×256 画像生成を達成できるか?
  • RQ4収束速度と FID の観点から、WGAN-GP や RSGAN ような最先端 GAN と比較して、T-GANs の性能はどの程度か?
  • RQ5提案手法は、SGAN や WGAN などの異なる GAN フレームワークに一般化可能か?

主な発見

  • T-SGANs と T-WGANs は約 10,000 イテレーションで収束し、標準 GAN(例:DCGAN、WGAN-GP)が約 20,000 イテレーションで達成する性能にほぼ同等に到達する。これは収束速度がほぼ2倍であることを示している。
  • 64×64 解像度の CIFAR-10 において、T-GANs は DCGAN、DCGAN-SN、WGAN-SN、WGAN-GP、RSGANs よりも高速に収束するが、性能差は顕著ではなく、トレーニングがはるかに速い。
  • 128×128 解像度では、多くの標準 GAN が安定してトレーニングできないか、極めて特化したハイパーパramータを必要とするが、T-GANs は一貫した性能と高速な収束を維持する。
  • 256×256 解像度では、T-GANs は高品質な画像を効果的に生成できるが、他のすべての標準 GAN は同じ条件下で有効にトレーニングできない。
  • 128×128 解像度の CIFAR-10 において、T-GANs は FID スコア 46.92 を達成し、SGAN-SN(65.78)、WGAN-SN(66.63)、RSGAN-SN(98.87)を上回り、優れたサンプル品質を示している。
  • T-GANs は 64×64、128×128、256×256 というすべての解像度で一貫した性能を発揮し、解像度にかかわらずたった 12,000 イテレーションで良好な結果を得られる。これはスケールに強く、ロバストであることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。