[論文レビュー] Generative Adversarial Network using Perturbed-Convolutions.
本稿では、畳み込み演算の前に入力テンソルをランダムに歪ませることで、GANの訓練を安定化させる新しい畳み込み層であるPerturbed-Convolution (PConv)を提案する。この手法により、ディスクラミネーターの過学習が軽減され、局所的なリプシッツ定数が小さくなる。CIFAR-10、CelebA-HQ、LSUN、tiny-ImageNetの各データセットでFIDスコアが8.17ポイント向上し、ベースラインのGANと比較して50.42に改善された。
Despite growing insights into the GAN training, it still suffers from instability during the training procedure. To alleviate this problem, this paper presents a novel convolutional layer, called perturbed-convolution (PConv), which focuses on achieving two goals simultaneously: penalize the discriminator for training GAN stably and prevent the overfitting problem in the discriminator. PConv generates perturbed features by randomly disturbing an input tensor before performing the convolution operation. This approach is simple but surprisingly effective. First, to reliably classify real and generated samples using the disturbed input tensor, the intermediate layers in the discriminator should learn features having a small local Lipschitz value. Second, due to the perturbed features in PConv, the discriminator is difficult to memorize the real images; this makes the discriminator avoid the overfitting problem. To show the generalization ability of the proposed method, we conducted extensive experiments with various loss functions and datasets including CIFAR-10, CelebA-HQ, LSUN, and tiny-ImageNet. Quantitative evaluations demonstrate that WCL significantly improves the performance of GAN and conditional GAN in terms of Frechet inception distance (FID). For instance, the proposed method improves FID scores on the tiny-ImageNet dataset from 58.59 to 50.42.
研究の動機と目的
- GANの訓練における不安定性とディスクラミネーターの過学習問題に取り組むこと。
- 多様なデータセットおよび損失関数において、GANの一般化性能とロバスト性を向上させること。
- アーキテクチャの複雑さを加えずに、訓練の安定性を向上させるシンプルで効果的な畳み込み層を設計すること。
- 入力レベルの摂動を導入することで、ディスクラミネーターが実画像を記憶する傾向を軽減すること。
- 最小限の変更で、複数のベンチマークデータセットで最先端のFID性能を達成すること。
提案手法
- Perturbed-Convolution (PConv) は、標準的な畳み込み演算の前に入力テンソルにランダムな摂動を加える。
- 摂動は各フォワードパスごとに独立して適用され、ディスクラミネーターが微小な入力変動に対して不変な特徴を学習するようにする。
- これにより、ディスクラミネーターの中間層が小さな局所的リプシッツ定数を持つ表現を学習するよう促され、安定性が向上する。
- ランダムな摂動は正則化として機能し、実画像の記憶を低減させ、過学習を緩和する。
- 本手法は、WGAN や条件付き GAN を含む、さまざまな GAN アーキテクチャおよび損失関数と互換性がある。
- PConv はプラグアンドプレイであり、生成器に変更を加える必要がなく、ディスクラミネーターに対しても最小限の変更で済む。
実験結果
リサーチクエスチョン
- RQ1畳み込みの過程でランダムな入力摂動を導入することで、GANの訓練安定性が向上するか?
- RQ2PConv は、実画像の記憶を防ぐことでディスクラミネーターの過学習を低減するか?
- RQ3PConv は、CIFAR-10、CelebA-HQ、LSUN、tiny-ImageNet といった多様なデータセットにおける一般化性能を向上させるか?
- RQ4PConv は、標準的な GAN と比較して、FID スコアをどの程度向上させるか?
- RQ5PConv は、さまざまな損失関数および条件付き GAN の設定下で、どの程度の性能を示すか?
主な発見
- PConv は、モード崩壊や損失の発散を低減することで、GAN の訓練安定性を顕著に向上させる。
- PConv は tiny-ImageNet における FID スコアを 58.59 から 50.42 に低下させ、顕著な性能向上を示した。
- PConv は、WGAN や条件付き GAN などのさまざまな損失関数を用いた場合でも、CIFAR-10、CelebA-HQ、LSUN すべてのデータセットで FID スコアを改善した。
- 入力レベルの摂動により、PConv で訓練されたディスクラミネーターは、実画像の記憶が顕著に減少した。
- FID スコアの向上は、非条件付きおよび条件付き GAN の両設定で一貫して観察された。
- PConv は、最小限のアーキテクチャ的変更と追加のハイパーパramータなしで、最先端の FID 性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。