[論文レビュー] 3D Cartoon Face Generation with Controllable Expressions from a Single GAN Image
本稿では、3Dの監視なしに、1枚の2D GAN生成人間顔画像から3Dコッソウ顔アバターを生成する、GANベースの新規フレームワークを提案する。スタイルGANの分離された潜在空間の操作と最適化された潜在コードオフセットを活用することで、顔の表情、ポーズ、照明の制御が可能となり、顔の同一性を保持した高精細な3D再構成とスタイライズドな外観転送を実現する。
In this paper, we investigate an open research task of generating 3D cartoon face shapes from single 2D GAN generated human faces and without 3D supervision, where we can also manipulate the facial expressions of the 3D shapes. To this end, we discover the semantic meanings of StyleGAN latent space, such that we are able to produce face images of various expressions, poses, and lighting conditions by controlling the latent codes. Specifically, we first finetune the pretrained StyleGAN face model on the cartoon datasets. By feeding the same latent codes to face and cartoon generation models, we aim to realize the translation from 2D human face images to cartoon styled avatars. We then discover semantic directions of the GAN latent space, in an attempt to change the facial expressions while preserving the original identity. As we do not have any 3D annotations for cartoon faces, we manipulate the latent codes to generate images with different poses and lighting conditions, such that we can reconstruct the 3D cartoon face shapes. We validate the efficacy of our method on three cartoon datasets qualitatively and quantitatively.
研究の動機と目的
- 3Dのアノテーションやマルチビュー画像を一切必要とせず、1枚の2D GAN生成人間顔画像から3Dコッソウ顔の生成を可能にすること。
- 生成された3Dアバターにおける顔の表情を制御可能にしつつ、元の同一性と外観を保持すること。
- 2D人間顔、スタイライズドなコッソウ画像、再構成された3D形状の間の意味的整合性を、共有潜在空間表現によって橋渡しすること。
- StyleGANのW空間における最適化された潜在コードオフセットを用いて、表情・ポーズ・照明の操作を可能にする手法を開発すること。
- さまざまな視点や照明条件下で、操作された潜在コードから生成された疑似サンプルを用いて、高品質な3D再構成を実証すること。
提案手法
- 人間顔とコッソウアバターの間で共有される潜在空間を学習するため、コッソウデータセット上で事前学習済みのStyleGANモデルを微調整する。
- GANインバージョンを用いて、実際の画像またはGAN生成画像の2D人間顔をStyleGANの潜在空間Wに投影し、同一性を保持したスタイライズドな外観を実現する。
- 閉形式因子分解(SeFa)を適用して、顔の表情操作のための初期潜在コードオフセットを同定する。
- 顔の同一性損失と低レベル特徴損失を用いて初期オフセットを最適化し、同一性と形状の保持を確保しつつ、表情の変化のみを実現する。
- 潜在コードを操作して、さまざまなポーズや照明を有する疑似サンプルを生成し、3D再構成のための監視信号として利用する。
- 法線マップとマルチビュー一貫性を活用して、操作された2D画像からニューラルレンダリングにより3D形状を再構成する。
実験結果
リサーチクエスチョン
- RQ13Dの監視やアノテーションなしに、1枚の2D GAN生成人間顔画像から3Dコッソウ顔形状を再構成できるか?
- RQ2元の同一性と外観を保持しつつ、生成された3Dアバターにおける顔の表情をどのように制御できるか?
- RQ3StyleGANにおける分離された潜在空間操作は、後続の3D再構成に向け、2Dスタイライズド画像における表情・ポーズ・照明の制御にどの程度有効か?
- RQ4最適化された潜在コードオフセットは、同一性や髪の色といった他の意味的属性から表情の変化を効果的に分離できるか?
- RQ5再構成された3D形状は視点や照明条件に対してどの程度一般化できるか?また、表面法線推定の正確性はどの程度か?
主な発見
- 本手法は、3Dの監視なしに、1枚の2D GAN生成入力画像から高精細な3Dコッソウ顔形状を成功裏に生成した。
- 最適化された潜在コードオフセットにより、同一性と形状を保持しつつ表情の操作が可能となり、ベースラインのSeFaと比較して不要な意味的変化が削減された。
- 定量的比較において、しわ、皮膚色、髪の質感といった微細なディテールが再構成されたメッシュで保持されていることが示された。
- リライティングおよびマルチビューレンダリングの結果から、正確な表面法線マップが得られ、照明変更によっても元の顔の特徴が保持された。
- 共有潜在空間表現により、2D人間顔、スタイライズドなコッソウ画像、3D形状の間で一貫性のあるアライメントが達成された。
- 限界として、大きな視点回転では不自然な歪みが生じやすく、表情編集時に髪の色に残存する変化が見られたことから、完全な分離には課題が残っている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。