Skip to main content
QUICK REVIEW

[論文レビュー] Improving GANs with A Dynamic Discriminator

Ceyuan Yang, Yujun Shen|arXiv (Cornell University)|Sep 20, 2022
Generative Adversarial Networks and Image Synthesis被引用数 12
ひとこと要約

本稿では、生成対抗ネットワーク(GAN)の学習中に、本物のサンプルと生成されたサンプルを区別する難易度の変化に応じて、識別器の容量を動的に調整するDynamicDという手法を提案する。十分なデータがある場合には容量を増加させ、データが不足する場合には減少させることで、追加の計算コストや損失関数を必要とせずに、画像生成品質を向上させ、多様なデータセットおよびタスク(3Dに意識的な生成を含む)で最先端のFIDスコアを達成する。

ABSTRACT

Discriminator plays a vital role in training generative adversarial networks (GANs) via distinguishing real and synthesized samples. While the real data distribution remains the same, the synthesis distribution keeps varying because of the evolving generator, and thus effects a corresponding change to the bi-classification task for the discriminator. We argue that a discriminator with an on-the-fly adjustment on its capacity can better accommodate such a time-varying task. A comprehensive empirical study confirms that the proposed training strategy, termed as DynamicD, improves the synthesis performance without incurring any additional computation cost or training objectives. Two capacity adjusting schemes are developed for training GANs under different data regimes: i) given a sufficient amount of training data, the discriminator benefits from a progressively increased learning capacity, and ii) when the training data is limited, gradually decreasing the layer width mitigates the over-fitting issue of the discriminator. Experiments on both 2D and 3D-aware image synthesis tasks conducted on a range of datasets substantiate the generalizability of our DynamicD as well as its substantial improvement over the baselines. Furthermore, DynamicD is synergistic to other discriminator-improving approaches (including data augmentation, regularizers, and pre-training), and brings continuous performance gain when combined for learning GANs.

研究の動機と目的

  • GAN学習における時間的に変化する二値分類タスクに取り組むこと。生成器の出力分布が時間経過とともに変化する一方で、本物データの分布は固定されたままである。
  • 固定容量の識別器が、データ量の変動に伴う動的なタスクに十分に対応できるかを検証すること。
  • 識別器の容量をリアルタイムで適応させるシンプルで効率的な訓練戦略を構築し、GANの性能を向上させること。
  • 提案手法の汎用性と多様なデータセットおよびアーキテクチャ(2Dおよび3Dに意識的な画像生成を含む)における互換性を評価すること。
  • 既存の識別器向上技術(例:データ拡張、正則化、事前学習)とどのように相乗効果を上げられるかを示すこと。

提案手法

  • DynamicDは、データの状態に応じて学習中に識別器の層幅を動的に調整する。十分なデータがある場合は容量を増加させ、データが不足する場合は減少させる。
  • 識別器の全結合層または畳み込み層の幅を線形スケジュールで調整することで、学習中にリアルタイムで容量を適応可能にする。
  • 大量データの状況では、識別器を小さく開始し、生成分布の複雑さが増すに従って段階的に幅を広げていく。
  • 少量データの状況では、識別器を広く開始し、学習が進むに従って段階的に縮小することで、過学習を防ぐ。
  • 本手法は追加の訓練目的や計算コストを必要とせず、学習中のアーキテクチャの適応に依存する。
  • 本手法は、既存のGAN訓練技術(例:データ拡張(ADA)、正則化(zCR)、事前学習(FreezeD))と互換性があり、それらと組み合わせることでさらなる性能向上が可能である。

実験結果

リサーチクエスチョン

  • RQ1生成器の出力分布が時間経過とともに変化するGAN学習における時間的に変化する二値分類タスクに対し、固定容量の識別器は適応できないのだろうか?
  • RQ2計算コストを増加させず、新たな損失関数を導入せずとも、識別器の容量を動的に調整することでGANの生成性能を向上させられるか?
  • RQ3データの状態に応じた最適な容量調整戦略が存在するのか(例:大量データでは増加、少量データでは減少)?
  • RQ4DynamicDは、データ拡張、正則化、事前学習といった既存の識別器向上技術と効果的に組み合わせられるか?
  • RQ5DynamicDは、2D画像生成から3Dに意識的な画像生成に至る多様なタスクに一般化可能か?

主な発見

  • FFHQ(2K枚)で、DynamicDはADAのFID 82.17を62.30に低下させ、少量データ環境下でも一貫した改善を示した。
  • FFHQ(140K枚)で、DynamicDはADAのFID 15.62を14.56に低下させ、豊富なデータ下でも有効であることを示した。
  • FFHQおよびCarlaで3Dに意識的な画像生成を実行した結果、DynamicDはFIDをFFHQ-2Kで73.50から23.29に、Carla-10Kで53.87から47.42に低下させ、マルチビューの一貫性が著しく向上した。
  • MetFacesで事前学習を組み合わせた場合、DynamicDは微調整ベースラインのFID 22.93を20.52に低下させ、互換性と追加の利点を示した。
  • ADAと組み合わせた場合、FFHQ-2KではFIDを53.8%、FFHQ-140Kでは8.5%改善し、既存手法との相乗効果を確認した。
  • 本手法は、2Dおよび3Dに意識的な画像生成を含む多様なデータセットおよびタスクで最先端の性能を達成しており、追加の訓練コストなしに実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。