Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Chinese Landscape Painting Creation Using Generative Adversarial Networks

Alice Xue|arXiv (Cornell University)|Nov 11, 2020
Generative Adversarial Networks and Image Synthesis参考文献 32被引用数 13
ひとこと要約

本論文は、条件付き入力なしに潜在ノイズから高品質でオリジナルの中国風風景画を生成する、初めてのエンドツーエンドの生成的対抗ネットワークであるSketch-And-Paint GAN(SAPGAN)を紹介する。2段階のプロセスを用いる——まずSketchGANでエッジマップを生成し、次にPaintGANでそれらを完全な絵画に変換する。視覚的チューリングテストにおいて、人間による誤認率が55%に達し、ベースラインのGANよりも顕著に優れている。

ABSTRACT

Current GAN-based art generation methods produce unoriginal artwork due to their dependence on conditional input. Here, we propose Sketch-And-Paint GAN (SAPGAN), the first model which generates Chinese landscape paintings from end to end, without conditional input. SAPGAN is composed of two GANs: SketchGAN for generation of edge maps, and PaintGAN for subsequent edge-to-painting translation. Our model is trained on a new dataset of traditional Chinese landscape paintings never before used for generative research. A 242-person Visual Turing Test study reveals that SAPGAN paintings are mistaken as human artwork with 55% frequency, significantly outperforming paintings from baseline GANs. Our work lays a groundwork for truly machine-original art generation.

研究の動機と目的

  • エンドツーエンドで条件付き入力(スケッチや写真など)を必要としない、オリジナルの中国風風景画を生成するGANモデルの不足を解消すること。
  • 生成的研究を目的とした、文化的に正確で高精細な伝統的中国風風景画のデータセットを構築すること。
  • 人間の芸術的プロセス(まずスケッチをし、その後に塗りつぶす)を模倣するフレームワークを開発すること。
  • 大規模な視覚的チューリングテストを通じて、生成された絵画の現実性と独自性を評価すること。
  • 機械で生成された芸術が大規模に人間が描いたものと誤認されることを示し、オリジナルAI芸術生成の境界を前進させること。

提案手法

  • SAPGANは2段階のGANフレームワークである:SketchGANがランダムな潜在ベクトルからエッジマップを生成し、PaintGANが条件付きエッジから絵画への変換を実行する。
  • SketchGANは、新規に構築した2,192枚の高解像度伝統的中国風風景画から抽出したエッジマップを用いて学習される。
  • PaintGANはペアドエッジマップとそれに対応する絵画を用いて、画像間変換を学習し、最終的な絵画を512×512解像度で出力する。
  • モデルは標準的なGAN損失を用いて訓練される:判別器による本物/偽物の識別を最適化し、生成器は判別器をだませるように学習する。
  • このフレームワークにより、人間が提供するスケッチや画像に依存せずに、潜在空間からのエンドツーエンド生成が可能になる。
  • 潜在空間内の補間と最近傍解析を用いて、記憶の単なる再現を避ける多様性と一般化性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1GANは、スケッチや写真などの条件付き入力なしに、高品質でオリジナルの中国風風景画を生成できるか?
  • RQ2人間による評価において、機械で生成された中国風風景画がどれほど人間が描いたものと誤認されるか?
  • RQ3提案された2段階のSketch-And-Paint GANフレームワークは、ベースラインのGANよりも一貫性があり、より現実的な絵画を生成できるか?
  • RQ4モデルは訓練データの過学習や記憶を避け、未学習のコンテンツに対しても一般化できるか?
  • RQ5モデルの潜在空間は、異なる絵画間で意味的で構造的に整合性のある補間を生成できるか?

主な発見

  • 242名の参加者による視覚的チューリングテストにおいて、SAPGANが生成した絵画は55%のケースで人間が描いたものと誤認され、ベースラインモデルを顕著に上回った。
  • 中国語話者参加者はさらに高い誤認率を示し、SAPGANの出力が70%の確率で人間の芸術と誤認された。これは文化的な熟達が、偽物としての信ぴょう性を低下させないことを示している。
  • SAPGANの誤認率は55%であったのに対し、ベースラインモデルは11%であった。p値は0.0001未満であり、統計的に有意であることが確認された。
  • 最近傍解析により、SAPGANの出力が訓練データから著しく離れていることが示され、相対的に小さなデータセットであるにもかかわらず、過学習への耐性があることが裏付けられた。
  • 潜在空間内の補間(latent walk)により、補間ステップ全体で一貫性があり、構造的に整合性のある風景構造が得られた。これは潜在空間と生成プロセスの質の高さを裏付けた。
  • 定性的な評価では、SAPGANの絵画は、美しさ、構図、明瞭さ、創造性の面でベースラインより著しく優れており(すべてp値 < 0.0001)、評価が高く出た。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。