Skip to main content
QUICK REVIEW

[論文レビュー] Continuous Conditional Generative Adversarial Networks for Image Generation: Novel Losses and Label Input Mechanisms

Xin Ding, Yongwei Wang|arXiv (Cornell University)|Nov 15, 2020
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、年齢やステアリング角などの連続的回帰ラベルに条件付けられた高品質な画像を生成するための新しい生成モデル、連続的条件付きGAN(CcGAN)を紹介する。本稿では、連続的条件に対応するためのGAN損失の再定式化と、新たなラベル入力メカニズム(NLIおよびILI)を提案する。CC-49、Cell-200、UTKFaceなどのベンチマークにおいて、標準的なcGANよりも優れた画像品質と多様性を達成し、訓練の安定性と性能が向上している。

ABSTRACT

This work proposes the continuous conditional generative adversarial network (CcGAN), the first generative model for image generation conditional on continuous, scalar conditions (termed regression labels). Existing conditional GANs (cGANs) are mainly designed for categorical conditions (eg, class labels); conditioning on regression labels is mathematically distinct and raises two fundamental problems:(P1) Since there may be very few (even zero) real images for some regression labels, minimizing existing empirical versions of cGAN losses (aka empirical cGAN losses) often fails in practice;(P2) Since regression labels are scalar and infinitely many, conventional label input methods are not applicable. The proposed CcGAN solves the above problems, respectively, by (S1) reformulating existing empirical cGAN losses to be appropriate for the continuous scenario; and (S2) proposing a naive label input (NLI) method and an improved label input (ILI) method to incorporate regression labels into the generator and the discriminator. The reformulation in (S1) leads to two novel empirical discriminator losses, termed the hard vicinal discriminator loss (HVDL) and the soft vicinal discriminator loss (SVDL) respectively, and a novel empirical generator loss. The error bounds of a discriminator trained with HVDL and SVDL are derived under mild assumptions in this work. Two new benchmark datasets (RC-49 and Cell-200) and a novel evaluation metric (Sliding Frechet Inception Distance) are also proposed for this continuous scenario. Our experiments on the Circular 2-D Gaussians, RC-49, UTKFace, Cell-200, and Steering Angle datasets show that CcGAN is able to generate diverse, high-quality samples from the image distribution conditional on a given regression label. Moreover, in these experiments, CcGAN substantially outperforms cGAN both visually and quantitatively.

研究の動機と目的

  • 連続的スカラー回帰ラベルに条件付けられた画像生成に効果的なGANの不足を解消すること。
  • 問題(P1)の解決:特定の回帰ラベルに対して実画像が疎またはゼロである場合に、実用的なcGAN損失が失敗すること。
  • 問題(P2)の解決:無限大の連続的スカラー値ラベルに従来のラベル入力手法が適用できないこと。
  • 連続的条件付け下で安定的かつ高品質な画像生成を可能にする新しい訓練フレームワークの提案。

提案手法

  • 連続的条件付けに適した実用的cGAN損失の再定式化を行い、2つの新しいディスクラミネータ損失(ハード・ビシナルディスクラミネータ損失:HVDL、ソフト・ビシナルディスクラミネータ損失:SVDL)を導入する。
  • 連続的条件付け生成に特化した新しい実用的ジェネレータ損失を提案する。
  • ジェネレータおよびディスクラミネータネットワークに回帰ラベルを埋め込むための新しい手法として、ネイティブ・ラベル入力(NLI)および改善型ラベル入力(ILI)を導入する。
  • やや緩い仮定の下で、HVDLおよびSVDLで訓練されたディスクラミネータの理論的誤差バウンドを導出する。
  • 2つの新しいベンチマークデータセットを設計:RC-49(回帰条件付き)およびCell-200(連続的ラベルを用いた細胞画像生成)。
  • 連続的条件付け画像生成のための新しい評価指標、スライディング・フレシェ・インセプション・ディスタンス(SFID)を提案する。

実験結果

リサーチクエスチョン

  • RQ1カテゴリカルラベルではなく連続的回帰ラベルに条件付けられた画像生成を効果的に行えるGANフレームワークを設計できるか?
  • RQ2連続的で、疎またはゼロショットの回帰ラベルに条件付けられた場合に、実用的cGAN損失をどのように再定式化すれば、安定的かつ効果的であるか?
  • RQ3ジェネレータおよびディスクラミネータアーキテクチャに連続的スカラー値ラベルを統合するための効果的なラベル入力メカニズムは何か?
  • RQ4連続的条件付け下で、提案されたCcGANは標準的なcGANと比較して、画像品質および多様性の点でどの程度優れているか?
  • RQ5スライディング・フレシェ・インセプション・ディスタンス(SFID)のような新しい評価指標は、連続的条件付け画像生成の品質をよりよく捉えられるか?

主な発見

  • CcGANは、RC-49、Cell-200、UTKFace、ステアリング角度データセットを含む複数のデータセットで、連続的回帰ラベルに条件付けられた多様で高品質な画像を生成する。
  • 提案されたHVDLおよびSVDLディスクラミネータ損失は、やや緩い仮定の下で理論的誤差バウンドを達成し、連続的設定下での安定した訓練を保証する。
  • 改善型ラベル入力(ILI)手法は、ネイティブ・ラベル入力(NLI)手法と比較して、ジェネレータおよびディスクラミネータの性能を顕著に向上させる。
  • CcGANは、すべての評価ベンチマークで、視覚的および定量的に標準cGANを上回り、優れたサンプル品質と多様性を示している。
  • 新しい評価指標であるスライディング・フレシェ・インセプション・ディスタンス(SFID)は、連続的条件付け画像生成の性能差を効果的に捉えており、人的評価と強い相関を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。