Skip to main content
QUICK REVIEW

[論文レビュー] CariGAN: Caricature Generation through Weakly Paired Adversarial Learning

Wenbin Li, Wei Xiong|arXiv (Cornell University)|Nov 1, 2018
Generative Adversarial Networks and Image Synthesis参考文献 48被引用数 18
ひとこと要約

CariGANは、顔のランドマークと画像融合メカニズムを用いて現実的で誇張された顔貌を保ちつつ、顔の同一性を維持する弱いペア化された条件付きGANを提案する。また、多様性損失によりモード崩壊を軽減する。WebCaricatureデータセットを用いた実験では、知覚的品質、同一性保持、誇張の観点で最先端のモデルを上回り、ユーザー研究の平均スコアは全指標で5.66/10を記録した。

ABSTRACT

Caricature generation is an interesting yet challenging task. The primary goal is to generate plausible caricatures with reasonable exaggerations given face images. Conventional caricature generation approaches mainly use low-level geometric transformations such as image warping to generate exaggerated images, which lack richness and diversity in terms of content and style. The recent progress in generative adversarial networks (GANs) makes it possible to learn an image-to-image transformation from data, so that richer contents and styles can be generated. However, directly applying the GAN-based models to this task leads to unsatisfactory results because there is a large variance in the caricature distribution. Moreover, some models require strictly paired training data which largely limits their usage scenarios. In this paper, we propose CariGAN overcome these problems. Instead of training on paired data, CariGAN learns transformations only from weakly paired images. Specifically, to enforce reasonable exaggeration and facial deformation, facial landmarks are adopted as an additional condition to constrain the generated image. Furthermore, an attention mechanism is introduced to encourage our model to focus on the key facial parts so that more vivid details in these regions can be generated. Finally, a Diversity Loss is proposed to encourage the model to produce diverse results to help alleviate the `mode collapse' problem of the conventional GAN-based models. Extensive experiments on a new large-scale `WebCaricature' dataset show that the proposed CariGAN can generate more plausible caricatures with larger diversity compared with the state-of-the-art models.

研究の動機と目的

  • 単一の顔画像から、多様で現実的で誇張されたパロディ画像を生成する課題に対処すること。
  • パラメータごとのペア化GANの限界を克服すること。これは、パロディ画像生成において、このようなデータを入手することが現実的でないためである。
  • 厳密な画像対応に依存せずに、同一性保持と顔面の誇張を向上させること。
  • 異なるランダムノイズベクトルを条件として出力の多様性を促進することで、GANにおけるモード崩壊を軽減すること。
  • パロディ画像合成において、現実性、同一性、誇張、多様性のバランスを取るモデルを開発すること。

提案手法

  • CariGANは、入力顔画像と正解パロディ画像が同一の人物を共有するが、ピクセル単位やポーズ単位の対応がない弱いペア化トレーニング設定を採用する。
  • 顔のランドマークを条件入力として用い、生成されたパロディ画像における顔面の変形と誇張を現実的にガイドする。
  • 画像融合メカニズムを導入し、生成器が顔の重要な領域に注目できるようにすることで、局所的なディテールの豊かさと視覚的インパクトを向上させる。
  • トレーニング中に多様性損失を適用し、異なるランダムノイズベクトルを条件として出力の多様性を促進する。
  • モデルはU-Netベースの生成器とピクセルベースの判別器を用い、条件付きGAN損失と敵対的目的に基づき、エンドツーエンドで訓練する。
  • 敵対的損失、同一性損失、知覚的損失を組み合わせることで、現実性、同一性の忠実度、構造的一致性のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1厳密なペア化トレーニングデータを必要としないGANベースのモデルは、高品質なパロディ画像を生成できるか?
  • RQ2顔のランドマークは、パロディ画像生成において、現実的で一貫性のある誇張を効果的にガイドできるか?
  • RQ3画像融合メカニズムは、顔の重要な領域に注目することで、生成されたパロディ画像の視覚的品質を向上させられるか?
  • RQ4多様性損失は、パロディ画像生成におけるモード崩壊を効果的に軽減し、出力の多様性を向上させられるか?
  • RQ5提案されたCariGANモデルは、知覚的品質、同一性保持、誇張の観点で最先端の手法と比較してどうなるか?

主な発見

  • CariGANはユーザー研究において平均5.66(満点10点)の最高知覚的スコアを達成し、Pix2Pix(1.90)、BicycleGAN(5.30)、PG2(3.60)を大きく上回った。
  • 生成されたパロディ画像の現実性スコアは5.45であり、カートゥーンスタイルに整合した視覚的に現実的で一貫性のある出力を示している。
  • 同一性保持スコアは5.34であり、多様な出力においても入力顔の同一性を強く保持していることが示された。
  • 誇張スコア6.18は、CariGANが目の大きさ、鼻、口といった顔の特徴を現実的で芸術的な方法で明確に誇張できていることを示している。
  • BicycleGANと比較して、CariGANはぼやけたアーティファクトが一般的なL1損失ベースのモデルとは異なり、よりシャープな出力を生成している。
  • 画像融合メカニズムと多様性損失は、定性的および定量的評価を通じて、局所的ディテール品質と出力の多様性の向上に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。