Skip to main content
QUICK REVIEW

[論文レビュー] Improved ArtGAN for Conditional Synthesis of Natural Image and Artwork

Wei Tan, Chee Seng Chan|arXiv (Cornell University)|Aug 31, 2017
Generative Adversarial Networks and Image Synthesis参考文献 7被引用数 4
ひとこと要約

本稿では、生成器にラベル勾配を逆伝播させ、識別器にカテゴリカルオートエンコーダーを統合することで特徴量学習を向上させる条件付きGAN、ArtGANを提案する。このモデルはCIFAR-10で最先端のInceptionスコアを達成し、多様なスタイル、ジャンル、アーティストの高品質で現実的ないかが、抽象的・非具象的表現を含む芸術的画像を生成する。

ABSTRACT

This paper proposes a series of new approaches to improve Generative Adversarial Network (GAN) for conditional image synthesis and we name the proposed model as ArtGAN. One of the key innovation of ArtGAN is that, the gradient of the loss function w.r.t. the label (randomly assigned to each generated image) is back-propagated from the categorical discriminator to the generator. With the feedback from the label information, the generator is able to learn more efficiently and generate image with better quality. Inspired by recent works, an autoencoder is incorporated into the categorical discriminator for additional complementary information. Last but not least, we introduce a novel strategy to improve the image quality. In the experiments, we evaluate ArtGAN on CIFAR-10 and STL-10 via ablation studies. The empirical results showed that our proposed model outperforms the state-of-the-art results on CIFAR-10 in terms of Inception score. Qualitatively, we demonstrate that ArtGAN is able to generate plausible-looking images on Oxford-102 and CUB-200, as well as able to draw realistic artworks based on style, artist, and genre. The source code and models are available at: https://github.com/cs-chan/ArtGAN

研究の動機と目的

  • 訓練中にラベル情報をより効果的に活用することで、GANにおける条件付き画像合成を向上させること。
  • ノイズやラベルを入力として、高精細な自然画像および複雑な芸術的画像(抽象的・非具象的スタイルを含む)を生成すること。
  • 従来のGANでは容易に捉えきれない抽象的・スタイル志向の表現を学習する課題に対処すること。
  • 複数のGANを訓練せずに、計算コストを抑えた画像品質向上手法を開発すること。
  • 潜在空間における滑らかな補間が可能であることで、学習データの記憶にとどまらない一般化能力を示すこと。

提案手法

  • 生成器はノイズベクトルとランダムに割り当てられたラベルを入力とし、ラベルを損失関数の計算に使用する。
  • ラベル勾配をカテゴリカル識別器から生成器に逆伝播させ、クラス固有の特徴量の学習をより効率的に行う。
  • カテゴリカルオートエンコーダーに基づく識別器で共有エンコーダーを用い、同時にクラス予測、 adversarial 訓練、画像再構築を実行する。
  • 画像品質向上のための新規戦略として、生成画像を2倍解像度にアップサンプリングし、その後平均プーリングを適用することで、ピクセル品質向上を模倣するボーリング機構を実現する。
  • アーキテクチャ名であるArtGAN-AEMは、オートエンコーダーと識別器を共有重みで統合し、計算コストを低減する。
  • 潜在空間の補間を実施し、学習データの記憶にとどまらない一般化能力を評価する。

実験結果

リサーチクエスチョン

  • RQ1ラベル勾配を逆伝播させることで、条件付きGANにおける生成器がクラス固有の視覚的特徴を学習する能力が向上するか?
  • RQ2識別器にオートエンコーダーを統合することで、条件付き画像合成における特徴表現と画像品質が向上するか?
  • RQ3提案された解像度アップスケーリングと平均プーリングボーリング戦略は、複数のGANを訓練せずに画像品質を効果的に向上させるか?
  • RQ4モデルは、抽象的・非具象的表現を含む、多様なスタイル、ジャンル、アーティストの現実的で多様な芸術的画像を生成できるか?
  • RQ5潜在空間の滑らかな補間が示すように、モデルは学習データの記憶にとどまらず一般化できるか?

主な発見

  • ArtGAN-AEMはCIFAR-10で最先端のInceptionスコアを達成し、従来手法を上回る性能を示した。
  • モデルはOxford-102およびCUB-200データセットでも高品質で現実的な画像を生成し、明確なオブジェクト構造とリアルなディテールを再現した。
  • ArtGANは、バロック様式の暗いトーン、ロココ様式の明るさ、浮世絵のイエローシェイドといった、明確な芸術的スタイルを学習・再現した。
  • ビンセント・ヴァン・ゴッホ、ユージェーヌ・ブディン、イヴァン・シシュキンといったアーティストの合成絵画は、それぞれ表現的な筆致、海のテーマ、森の風景といった特徴的なスタイルを反映した。
  • 潜在空間の補間結果は、生成画像間で滑らかで現実的な遷移を示し、モデルが学習データを記憶しているわけではないことを確認した。
  • Wikiartデータセットからのスタイル・ジャンル・アーティストに基づく、現実的で多様な芸術的画像を生成でき、複雑な非具象的表現を効果的に学習できる能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。