Skip to main content
QUICK REVIEW

[論文レビュー] Generate and Edit Your Own Character in a Canonical View

Jeong-gi Kwak, Yuanming Li|arXiv (Cornell University)|May 6, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、StyleGANの潜在空間操作を用いて、3次元監視なしで一様な前面ビューのスタイライズドポートレートを生成・編集する統合的フレームワークを提案する。NeRFベースのGANから得られる擬似教師データペアを用いて訓練された新しい潜在マッパーにより、視覚的品質、アイデンティティ保持、推論速度の面で段階的アプローチを上回る、同時にスタイライズドと前面化を達成する。FIDは65.21、実行時間は0.26秒を達成した。

ABSTRACT

Recently, synthesizing personalized characters from a single user-given portrait has received remarkable attention as a drastic popularization of social media and the metaverse. The input image is not always in frontal view, thus it is important to acquire or predict canonical view for 3D modeling or other applications. Although the progress of generative models enables the stylization of a portrait, obtaining the stylized image in canonical view is still a challenging task. There have been several studies on face frontalization but their performance significantly decreases when input is not in the real image domain, e.g., cartoon or painting. Stylizing after frontalization also results in degenerated output. In this paper, we propose a novel and unified framework which generates stylized portraits in canonical view. With a proposed latent mapper, we analyze and discover frontalization mapping in a latent space of StyleGAN to stylize and frontalize at once. In addition, our model can be trained with unlabelled 2D image sets, without any 3D supervision. The effectiveness of our method is demonstrated by experimental results.

研究の動機と目的

  • 任意の角度からの入力画像から、3次元監視なしに一様な前面ビューのスタイライズドポートレートを生成する課題に対処すること。
  • 段階的な処理(前面化→スタイライズ)を適用する際のアイデンティティと視覚的品質の劣化を克服すること。
  • StyleGANの意味的マニフォールドを保持する潜在空間マッピングを発見すること。
  • 3DMMやポーズ推定器に依存せず、ラベルなし2次元画像セットのみを用いてエンドツーエンドのスタイライズドと前面化を可能にすること。
  • 将来的な編集に役立つ既存のStyleGANベースの潜在空間編集技術との互換性を維持すること。

提案手法

  • ランダムビューと前面ビューの画像ペアを生成するNeRFベースのGANを、ラベルなし2次元画像セットから完全に訓練し、潜在マッピングのための監視を提供する。
  • 任意のビューの潜在コードから、一様な前面ビュー潜在コードへの正確なマッピングを学習する新しい潜在マッパーを導入する。
  • 忠実度と現実性を保証するため、L1損失、知覚的損失、アイデンティティ保持損失を組み合わせたマルチ損失目的関数を用いてマッパーを訓練する。
  • スタイライズドは、GAN補間により達成され、編集された潜在コードがStyleGAN生成器の初期層にのみ影響を与えるように設計され、アイデンティティと品質を保持する。
  • フレームワークは完全に潜在空間内で動作し、InterFaceGANのような既存の潜在空間編集技術の直接適用が可能である。
  • フレームワークはラベルなし2次元画像セット上でエンドツーエンドに訓練され、アノテートされたランドマーク、3次元メッシュ、事前学習済み3次元モデルの必要性がなくなる。

実験結果

リサーチクエスチョン

  • RQ13次元監視やラベルなしで、一様な前面ビューのスタイライズドポートレートを統合的フレームワークで生成できるか?
  • RQ23次元幾何学的構造やポーズ推定に依存せず、StyleGANの潜在空間で正確な前面化を達成できるか?
  • RQ31ステップでスタイライズドと前面化を同時に行うことで、段階的パイプライン(例:前面化→スタイライズド)に比べて視覚的品質とアイデンティティ保持性が向上するか?
  • RQ4多様なスタイライズドドメインにおいて、アイデンティティと意味的整合性をどの程度維持できるか?
  • RQ5既存の潜在空間編集技術を用いて、一様なビューでの属性編集(例:年齢、性別、笑顔)をスムーズに統合できるか?

主な発見

  • 提案手法は、Fréchet Inception Distance (FID) が65.21に達し、段階的アプローチ(95.25および86.64)を著しく上回る視覚的品質を達成した。
  • 1出力あたり0.26秒という最速の推論速度を達成し、段階的手法(1.84秒および4.63秒)を上回り、リアルタイム応用が可能になった。
  • アイデンティティ保持性が段階的パイプラインを上回り、ArcFaceメトリックで15.5%高いスコア(82.26)を達成し、次善の手法(77.10)を上回った。
  • 定性的な結果では、コマーシャルや絵画のようなスタイライズド入力に対しても、目立つアーティファクトや歪みがなく、優れた写実的でアイデンティティの一貫性を示した。
  • InterFaceGANを用いて、一様なビューで年齢、性別、笑顔などの意味的属性を効果的に編集でき、既存の潜在空間編集ツールとの互換性を実証した。
  • アブレーションスタディにより、潜在マッパーの設計が極めて重要であることが確認され、その除去によりアイデンティティと視覚的品質が著しく劣化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。