Skip to main content
QUICK REVIEW

[論文レビュー] Weakly-supervised Caricature Face Parsing through Domain Adaptation

Wenqing Chu, Wei-Chih Hung|arXiv (Cornell University)|May 13, 2019
Face recognition and analysis参考文献 27被引用数 6
ひとこと要約

本稿では、別々の形状およびテクスチャの適応を用いて、実写写真からコマ式風の画像を合成することで、弱教師付きドメイン適応フレームワークを提案する。形状の誇張には空間変換器を、テクスチャの整合性にはフィードフォワードスタイル変換ネットワークを用いる。この手法により、実写写真のパーサルデータセットから実際のコマ式顔面への効果的な転送が可能となり、合成コマ式データで73.38 mIoU、実際のWebCaricatureデータで64.23 mIoUの最先端性能を達成した。

ABSTRACT

A caricature is an artistic form of a person's picture in which certain striking characteristics are abstracted or exaggerated in order to create a humor or sarcasm effect. For numerous caricature related applications such as attribute recognition and caricature editing, face parsing is an essential pre-processing step that provides a complete facial structure understanding. However, current state-of-the-art face parsing methods require large amounts of labeled data on the pixel-level and such process for caricature is tedious and labor-intensive. For real photos, there are numerous labeled datasets for face parsing. Thus, we formulate caricature face parsing as a domain adaptation problem, where real photos play the role of the source domain, adapting to the target caricatures. Specifically, we first leverage a spatial transformer based network to enable shape domain shifts. A feed-forward style transfer network is then utilized to capture texture-level domain gaps. With these two steps, we synthesize face caricatures from real photos, and thus we can use parsing ground truths of the original photos to learn the parsing model. Experimental results on the synthetic and real caricatures demonstrate the effectiveness of the proposed domain adaptation algorithm. Code is available at: https://github.com/ZJULearning/CariFaceParsing .

研究の動機と目的

  • 顔面パーサルのための大規模かつピクセルレベルのアノテーションが付与されたコマ式データセットの不足に対処する。
  • 実写写真とコマ式顔面の間のドメインシフトに起因する顔面部品セグメンテーションの課題を克服する。
  • 既存の実写写真パーサルデータセットをソースドメインとして活用することで、弱教師付き学習を可能にする。
  • ターゲットドメインに手動アノテーションを必要とせずに、実際のコマ式顔面におけるパーサル性能を向上させる。

提案手法

  • コマ式顔のランドマークからの弱教師信号を用いて、空間変換器ネットワークを活用し、コマ式顔における形状ドメインシフトをモデル化・適応する。
  • フィードフォワードスタイル変換ネットワークを適用し、実写写真とコマ式顔間のテクスチャ的差異を捉え、それらを転送する。
  • 2段階の適応プロセスを用いて、実写顔写真から合成コマ式風の画像を生成することで、画像レベルのドメイン適応を実現する。
  • ソースドメインの実写写真データセットからの真値パーサルアノテーションを活用し、合成コマ式画像上でセマンティックセグメンテーションネットワークを訓練する。
  • Wasserstein GANと勾配ペナルティを用いて、形状適応ネットワークの訓練を安定化する。
  • パーサルネットワークの訓練には、ポリティクス学習率ポリシーとADAM最適化手法を採用する。

実験結果

リサーチクエスチョン

  • RQ1形状およびテクスチャの差が著しいにもかかわらず、ドメイン適応が実写写真からコマ式顔への顔面パーサル知識の転送を効果的に行えるか?
  • RQ2エンドツーエンドの画像変換と比較して、形状とテクスチャの適応を別々にモデル化することで、パーサル性能がどのように向上するか?
  • RQ3ランドマークからの弱教師信号が、コマ式顔生成における形状適応をどの程度向上させるか?
  • RQ4既存のドメイン適応ベースラインと比較して、本手法は実世界のコマ式顔に対してより良い一般化性能を示すか?

主な発見

  • 提案手法は、合成されたHELEN-Cariデータセットで73.38%のmIoUを達成し、適応なしで学習したモデル(49.36%)やCycleGANベースの適応のみを用いたモデル(57.68%)を著しく上回った。
  • 実際のWebCaricatureデータセットでは64.23%のmIoUを達成し、限られた手動アノテーションで学習したAdaptSegNet(58.48%)やCari-Cross(56.29%)をすべて上回った。
  • アブレーションスタディの結果、形状適応とテクスチャ適応の両方が顕著に寄与しており、形状適応のみで65.19%、テクスチャ適応のみで62.78%のmIoUを達成した。
  • 図3の定性的な結果から、本手法はCycleGAN や AdaptSegNet が大きな形状変化で苦戦する眉や口のパーサルをより正確に再現していることが示された。
  • HELEN-Cari(合成データ)で学習したモデルは、実際のコマ式顔に対しても良好に一般化しており、ドメイン適応パイプラインの有効性を裏付けた。
  • 本フレームワークは、2段階のアプローチにより、幾何的(形状)および外観的(テクスチャ)な不一致を効果的に低減し、ドメインシフトを軽減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。