Skip to main content
QUICK REVIEW

[論文レビュー] Generative Ratio Matching Networks

Akash Srivastava, Kai Xu|arXiv (Cornell University)|May 31, 2018
Generative Adversarial Networks and Image Synthesis参考文献 18被引用数 4
ひとこと要約

この論文は、生成モデルの密度比を低次元空間で一致させるように評価者を訓練することで、鞍点最適化を回避する新しい手法であるGenerative Ratio Matching(GRAM)を導入する。GAN や MMD-GAN とは異なり、CIFAR-10 および CelebA で最先端の FID スコアを達成し、訓練の安定性とハイパーパramータへの感受性が向上している。

ABSTRACT

Deep generative models can learn to generate realistic-looking images, but many of the most effective methods are adversarial and involve a saddlepoint optimization, which requires a careful balancing of training between a generator network and a critic network. Maximum mean discrepancy networks (MMD-nets) avoid this issue by using kernel as a fixed adversary, but unfortunately, they have not on their own been able to match the generative quality of adversarial training. In this work, we take their insight of using kernels as fixed adversaries further and present a novel method for training deep generative models that does not involve saddlepoint optimization. We call our method generative ratio matching or GRAM for short. In GRAM, the generator and the critic networks do not play a zero-sum game against each other, instead, they do so against a fixed kernel. Thus GRAM networks are not only stable to train like MMD-nets but they also match and beat the generative quality of adversarially trained generative networks.

研究の動機と目的

  • GAN などの敵対的生成モデルの不安定さとハイパーパramータへの感受性を解消すること。
  • 自然画像などの高次元データにおいて、標準的な MMD ネットの生成品質の低さを克服すること。
  • MMD ネットの安定性を保ちつつ、生成品質を敵対的手法と同等または上回るようにする訓練手法を開発すること。
  • 生成器と評価者の間の鞍点最適化の必要性をなくすために、固定されたカーネルベースの評価者を用いること。
  • 射影空間における密度比マッチングが、元のデータ空間における分布マッチングを改善することを示すこと。

提案手法

  • 入力空間における真のデータ密度とモデルが生成する密度の比を推定するための評価者ネットワークを訓練する。
  • 固定された評価者ネットワークを用いて、実データと生成データを低次元空間に射影し、内在次元を低減する。
  • 射影空間でカーネルベースのMMD推定を用い、実データと生成データの分布の差を最小化する。
  • 評価者を固定された、学習されない敵対者として用い、生成器を射影された実データと生成データの分布間のMMDを最小化するように訓練する。
  • カーネルのグラム行列を用いてMMDを数値最適化なしに効率的に計算する。
  • 生成器と評価者の訓練を分離することで敵対的訓練ダイナミクスを回避し、同時にミニマックス最適化の必要性を排除する。

実験結果

リサーチクエスチョン

  • RQ1低次元空間における密度比推定は、高次元データにおけるMMDベースのモデルの生成品質を向上させることができるか?
  • RQ2訓練における鞍点最適化を回避することで、GAN や MMD-GAN と比較してより安定的かつロバストな生成モデルが得られるか?
  • RQ3評価者の出力空間の次元が、得られる生成モデルの性能にどのように影響するか?
  • RQ4密度比を保持する固定された評価者では、学習された評価者を用いたMMD-GAN よりも優れた性能を発揮できるか、かつ高いサンプル品質を維持できるか?
  • RQ5従来の手法と比較して、学習率やバッチサイズなどのハイパーパramータの選択に対して本手法はロバストか?

主な発見

  • GRAM-nets は、CIFAR-10 および CelebA データセットの両方で、最先端のFréchet Inception Distance(FID)スコアを達成し、標準的な GAN や MMD-GAN を上回っている。
  • CIFAR-10 では、GRAM-net が FID 6.89 を達成し、MMD-GAN の 7.82 よりも顕著に優れている。これは、最良の GAN と同等の性能である。
  • CelebA では、GRAM-net が FID 13.21 を達成し、MMD-GAN(14.12)を上回り、最先端の GAN と同等の性能を示している。
  • GRAM-nets は、MMD-GAN よりも学習率やバッチサイズに対して顕著に感受性が低く、ヴァナイル GAN と同等の性能を示している。
  • 評価者の出力次元が約1000のときに性能が最も良くなる。それより大きな次元では性能が低下し、データに最適な内在次元が存在することが示唆されている。
  • 定性的な分析により、CIFAR-10 における最近接近傍解析から、生成されたサンプルが訓練データを記憶したものではなく、多様で記憶されていないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。