Skip to main content
QUICK REVIEW

[論文レビュー] WarpGAN: Automatic Caricature Generation

Yichun Shi, Debayan Deb|arXiv (Cornell University)|Nov 25, 2018
Generative Adversarial Networks and Image Synthesis参考文献 33被引用数 5
ひとこと要約

WarpGANは、敵対的訓練を通じて、同時に画像の歪みとテクスチャスタイル転送を学習することで、顔写真から自動的にキャラクター絵を生成するGANベースのフレームワークを提案する。形状変形のためのスパarsな制御点を予測し、アイデンティティ保持型敵対的損失によりアイデンティティを維持する。これは、知覚的品質とアイデンティティ保持性において、最先端の手法を上回る性能を発揮する。

ABSTRACT

We propose, WarpGAN, a fully automatic network that can generate caricatures given an input face photo. Besides transferring rich texture styles, WarpGAN learns to automatically predict a set of control points that can warp the photo into a caricature, while preserving identity. We introduce an identity-preserving adversarial loss that aids the discriminator to distinguish between different subjects. Moreover, WarpGAN allows customization of the generated caricatures by controlling the exaggeration extent and the visual styles. Experimental results on a public domain dataset, WebCaricature, show that WarpGAN is capable of generating a diverse set of caricatures while preserving the identities. Five caricature experts suggest that caricatures generated by WarpGAN are visually similar to hand-drawn ones and only prominent facial features are exaggerated.

研究の動機と目的

  • 顔の特徴を誇張しつつアイデンティティを保持する、完全に自動化されたキャラクター絵生成システムの開発。
  • 顔のランドマークに依存せずに、幾何的変形とテクスチャスタイル転送の二重の課題に取り組む。
  • 生成されたキャラクター絵における誇張の度合いと視覚的スタイルのカスタマイズを可能にする。
  • 従来のGANベースのスタイル転送手法と比較して、生成されたキャラクター絵におけるアイデンティティ保持性を向上させる。
  • 専門家による評価と顔認識ベンチマークを用いて、生成されたキャラクター絵の知覚的品質と現実性を評価する。

提案手法

  • WarpGANは、形状変形とテクスチャスタイル転送を別々のモジュールに分離する条件付きGANフレームワークを採用する。
  • 生成器は、画像空間における非線形な幾何的歪みを可能にするために、入力顔画像を歪めるためのスパarsな制御点の集合を予測する。
  • 非線形フィルタリング機構により、キャラクター絵ドメインからのテクスチャスタイルが歪められた画像に転送され、しわのような微細なディテールが保持される。
  • 識別器は、アイデンティティ保持型敵対的損失を用い、各(アイデンティティ、スタイル)ペアを別々のクラスとして扱うことで、アイデンティティの保持を向上させる。
  • モデルは、リアルで多様なキャラクター絵の出力を促進する統合敵対的損失を用いて、エンドツーエンドで訓練される。
  • フレームワークは顔のキーポイントのアノテーションを必要とせず、敵対的目的関数とアイデンティティに配慮した損失からの暗黙の教師信号に依存する。
Figure 1: Example photos and caricatures of two subjects in our dataset. Column (a) shows each identity’s real face photo, while two generated caricatures of the same subjects by WarpGAN are shown in column (b) and (c). Caricatures drawn by artists are shown in the column (d) and (e).
Figure 1: Example photos and caricatures of two subjects in our dataset. Column (a) shows each identity’s real face photo, while two generated caricatures of the same subjects by WarpGAN are shown in column (b) and (c). Caricatures drawn by artists are shown in the column (d) and (e).

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、顔のランドマークや手動制御を必要とせずに、顔写真からキャラクター絵を自動生成できるか?
  • RQ2統合学習フレームワークは、幾何的歪みとテクスチャスタイル転送を同時に実行しながら、アイデンティティをどの程度効果的に保持できるか?
  • RQ3生成されたキャラクター絵は、視覚的品質と特徴の誇張において、手描きのキャラクター絵とどの程度類似しているか?
  • RQ4アイデンティティ保持型敵対的損失は、標準的なGANと比較して、生成されたキャラクター絵の認識精度を向上させるか?
  • RQ5ユーザーは、生成されたキャラクター絵の誇張度合いと芸術的スタイルを、意味的かつ制御可能にカスタマイズできるか?

主な発見

  • 専門家による評価では、WarpGANが生成したキャラクター絵は99%の確率で手描きのキャラクター絵に最も類似しており、CycleGANとMUNITはそれぞれ0.5%であった。
  • 知覚的評価において、WarpGANは満点10点中平均5.61の視覚的品質スコアと4.87の誇張スコアを達成し、CycleGAN(2.43および2.27)とMUNIT(1.82および1.83)を顕著に上回った。
  • 生成されたキャラクター絵における顔認識の正確性は、手描きのキャラクター絵よりも高かった。これは、強力なアイデンティティ保持性を示している。
  • アブレーションスタディの結果、歪みモジュールまたはテクスチャ転送モジュールのいずれかを削除すると、結果が崩壊または低品質になることが確認され、統合学習の必要性が裏付けられた。
  • アイデンティティ保持型敵対的損失により、識別器内の誤認識が減少し、訓練の安定性と出力の多様性が向上した。
  • 同じ入力写真に対し、モデルは多様なキャラクター絵を効果的に生成でき、誇張の度合いと視覚的スタイルにおける制御性を示した。
(a) Global Parameters [ 14 ] [ 15 ] [ 16 ]
(a) Global Parameters [ 14 ] [ 15 ] [ 16 ]

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。