Skip to main content
QUICK REVIEW

[論文レビュー] Associative Adversarial Networks

Tarik Arici, Aslı Çelikyılmaz|arXiv (Cornell University)|Nov 18, 2016
Generative Adversarial Networks and Image Synthesis参考文献 12被引用数 9
ひとこと要約

本稿では、GAN の生成器と識別器の間に制限ボルツマンマシン(RBM)を確率的連想記憶として挿入する、関連的敵対ネットワーク(AANs)を提案する。識別器の中間特徴の確率的分布を学習することで、RBM は構造的でモード豊富な入力を生成し、生成器のマッピングタスクを簡素化する。その結果、標準的な GAN よりも訓練の安定性が向上し、サンプルの多様性が向上する。

ABSTRACT

We propose a higher-level associative memory for learning adversarial networks. Generative adversarial network (GAN) framework has a discriminator and a generator network. The generator (G) maps white noise (z) to data samples while the discriminator (D) maps data samples to a single scalar. To do so, G learns how to map from high-level representation space to data space, and D learns to do the opposite. We argue that higher-level representation spaces need not necessarily follow a uniform probability distribution. In this work, we use Restricted Boltzmann Machines (RBMs) as a higher-level associative memory and learn the probability distribution for the high-level features generated by D. The associative memory samples its underlying probability distribution and G learns how to map these samples to data space. The proposed associative adversarial networks (AANs) are generative models in the higher-levels of the learning, and use adversarial non-stochastic models D and G for learning the mapping between data and higher-level representation spaces. Experiments show the potential of the proposed networks.

研究の動機と目的

  • 標準 GAN における不安定さとモード崩壊を是正すること。これは、生成器が一様なノイズから複雑なデータ分布へのマッピングを学習しにくいために生じる。
  • 生成器の学習負荷を軽減すること。一様なノイズ入力を、高レベル表現空間からの構造的でモードに配慮したサンプルに置き換えることで実現する。
  • 中間識別器特徴の確率的構造をモデル化する連想記憶を活用することで、訓練のダイナミクスを改善すること。
  • 実証的に、学習された高レベル表現からのサンプリングが、より多様で現実的である生成サンプルをもたらすことを検証すること。

提案手法

  • 識別器が抽出した中間特徴上で、RBM を連想記憶として訓練し、これらの高レベル表現の背後にある確率的分布を学習する。
  • RBM に対してギブスサンプリングを適用し、生成器のための構造的で一様でない入力を生成し、標準的な一様ノイズ z の代わりに使用する。
  • 生成器は、RBM の可視層から得られるサンプルに条件付けられる。これらのサンプルは、識別器の特徴空間上の学習済み分布から抽出される。
  • 識別器は、実データと生成サンプルを区別するように訓練され、生成器は RBM からのサンプルを用いて識別器を欺くように訓練される。
  • 共同訓練プロセスは、識別器、RBM、生成器の順に更新を繰り返す。この際、RBM は意味のある特徴構成の確率的事前分布として機能する。
  • モデルは、保持済み尤度と生成画像の視覚的品質を用いて、CelebA データセットで評価され、RBM の表現能力と一般化性能が検証される。

実験結果

リサーチクエスチョン

  • RQ1RBM のような連想記憶モデルが、中間識別器特徴の構造的事前分布を学習することで、GAN の訓練安定性と多様性を向上させられるか?
  • RQ2一様ノイズを RBM からのサンプルに置き換えることで、生成器の学習負荷が軽減され、モード崩壊が緩和されるか?
  • RQ3中間特徴空間の次元数が、RBM のギブスサンプラーの混合速度とモードカバレッジに与える影響は何か?
  • RQ4RBM が学習した分布は、標準 GAN と比較して、生成画像の質と多様性をどの程度向上させるか?

主な発見

  • 100次元の中間特徴空間を用いた場合、RBM のギブスサンプラーの混合が速くなり、顔画像の生成において性別や人種といったモード間の迅速な遷移が可能になった。
  • 1000次元の中間特徴空間では、RBM がモード間を遷移するのにギブスステップを最大10回も必要とし、混合が遅く、分布の探索が不十分であることが示された。
  • RBM からのサンプルを入力として用いた生成器は、収束行動が改善され、実データと生成データの識別器スコア比が、標準 GAN よりも安定して推移した。
  • 保持済み尤度の評価から、RBM が識別器の中間特徴の上で意味のある非退化確率分布を学習していることが確認された。
  • 視覚的サンプルから、RBM からのサンプル入力が、特に次元数の低い特徴空間において、より多様で現実的な顔画像を生成していることが示された。
  • 連想記憶は、生成器の学習タスクを効果的に軽減し、崩壊のリスクを低減させ、より安定した敵対的訓練を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。