Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Domain Style Mixing for Face Cartoonization

Seungkwon Kim, Chaeheon Gwak|arXiv (Cornell University)|May 25, 2022
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、レイヤー入れ替えされたStyleGAN2のStyleSpaceにおいて、自然な顔画像ドメインとアニメ絵画ドメインの潜在コードを組み合わせることで、1つの生成器を用いて高品質な顔アニメ化を実現する新規手法、Cross-Domain Style Mixingを提案する。色のずれを解消し、微細なアニメ特徴を保持する一方で、最小限の学習データで、単純なキャラクターIDの切り替えにより、複数のアニメキャラクターに一括してスタイル変換を可能にする。

ABSTRACT

Cartoon domain has recently gained increasing popularity. Previous studies have attempted quality portrait stylization into the cartoon domain; however, this poses a great challenge since they have not properly addressed the critical constraints, such as requiring a large number of training images or the lack of support for abstract cartoon faces. Recently, a layer swapping method has been used for stylization requiring only a limited number of training images; however, its use cases are still narrow as it inherits the remaining issues. In this paper, we propose a novel method called Cross-domain Style mixing, which combines two latent codes from two different domains. Our method effectively stylizes faces into multiple cartoon characters at various face abstraction levels using only a single generator without even using a large number of training images.

研究の動機と目的

  • 特に抽象的なアニメスタイルへの一般化が不十分で、色のアーティファクトが生じる既存のI2Iおよびレイヤー入れ替え手法の限界を解消する。
  • 高度に抽象化されたアニメ顔を処理する際、従来のレイヤー入れ替えアプローチで生じる細部の欠落や色のずれを克服する。
  • 1つの生成器が、各キャラクターあたり少数の学習画像のみで、さまざまな抽象度の複数のアニメキャラクターに顔をスタイル変換できるようにする。
  • 追加のトレーニングテクニックやアーキテクチャの変更を除き、微調整のみで安定的で効率的かつ実装可能なフレームワークを開発する。
  • 写真からアニメへの変換や動画からアニメへの変換といった実用的応用に拡張し、時間的に一貫したスタイルを維持できるようにする。

提案手法

  • 事前学習済みエンコーダ(例:ReStyle)を用いて、ソースドメインの$\mathcal{W+}$空間に自然な顔画像を再構築する。
  • プロジェクションプロトコルを適用して、アニメ画像の潜在コードを$\mathcal{W+}$空間に取得し、ソースドメインと互換性を持たせる。
  • ソースドメインとターゲットドメインの潜在コードを用いて、$\mathcal{S}$空間(StyleSpace)でスタイルミキシングを実行し、キャラクター固有のスタイルを転送する。
  • tRGBリプレース技術を導入し、出力の色分布をターゲットアニメドメインに一致させるために、$s_{tRGB}$スタイルパラメータのみを操作することで、色のアーティファクトを排除する。
  • tRGBリプレースとスタイルミキシングを組み合わせることで、微細なアニメ特徴と正しい色分布の両方を保持する。
  • 得られたフレームワークを、写真からアニメへの変換や動画からアニメへの変換といった下流アプリケーションのコアモジュールとして活用し、フレーム間の一貫性を確保する。

実験結果

リサーチクエスチョン

  • RQ1ターゲットアニメスタイルが非常に抽象的で、実顔と著しく異なる場合に、顔アニメ化の品質と安定性をどのように向上できるか?
  • RQ2レイヤー入れ替えGANベースのスタイル変換で色のずれが生じる原因は何か?そして、それを体系的に是正する方法は?
  • RQ3追加のトレーニングやアーキテクチャの変更なしに、異なるドメインからの潜在コードを組み合わせるクロスドメインスタイルミキシングをスタイル変換に効果的に適用できるか?
  • RQ41つの生成器が、最小限のデータと再トレーニングなしに、複数のアニメキャラクターにわたるスタイル変換をどの程度行えるか?
  • RQ5提案手法を動画からアニメへの変換に拡張可能か?また、時間的に一貫したスタイルを維持できるか?

主な発見

  • tRGBリプレース手法は、$s_{tRGB}$スタイルパラメータに特化して操作することで、スタイル変換出力の色のアーティファクトを効果的に除去し、顔の構造に影響を与えない。
  • StyleSpaceにおけるスタイルミキシングは、独特の口元の形状やまつげの特徴といった、キャラクター固有の重要な特徴を効果的に転送する。
  • $\mathcal{W+}$空間は$\mathcal{W}$空間よりも微細なアニメディテールの保持に優れており、逆投影に適していることが裏付けられた。
  • 完全なモデルは、劣化のない高品質なスタイル変換を達成し、従来のレイヤー入れ替え手法と比較して視覚的忠実度と一貫性の両面で優れている。
  • 本手法により、1台の生成器が単にキャラクターIDを切り替えるだけで、複数のキャラクターのアニメ化顔を生成できる「ワン・フォー・オール」スタイル変換が可能になる。
  • 潜在コードミキシングによる明示的で安定したスタイルインジェクションのおかげで、フレームワークは、時間的に一貫したキャラクターのスタイルを維持する、頑健な動画からアニメへの変換をサポートする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。