Skip to main content
QUICK REVIEW

[論文レビュー] PAniC-3D: Stylized Single-view 3D Reconstruction from Portraits of Anime Characters

Shuhong Chen, Kevin Zhang|arXiv (Cornell University)|Mar 25, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

PAniC-3D は、ラインベースのポートレートイラストからアニメキャラクターのスタイライズドな1ビュー3D再構成を実現する新規システムを提案する。ラインフィルティングモデルを用いてイラストから3Dへのドメインギャップを埋め、高精細な幾何構造とテクスチャを実現するボリュメトリックなラディアンスフィールドを採用している。新規の AnimeRecon ベンチマークにおいて最先端の性能を達成し、知覚的・幾何的忠実度の両面でベースラインを大きく上回っている。

ABSTRACT

We propose PAniC-3D, a system to reconstruct stylized 3D character heads directly from illustrated (p)ortraits of (ani)me (c)haracters. Our anime-style domain poses unique challenges to single-view reconstruction; compared to natural images of human heads, character portrait illustrations have hair and accessories with more complex and diverse geometry, and are shaded with non-photorealistic contour lines. In addition, there is a lack of both 3D model and portrait illustration data suitable to train and evaluate this ambiguous stylized reconstruction task. Facing these challenges, our proposed PAniC-3D architecture crosses the illustration-to-3D domain gap with a line-filling model, and represents sophisticated geometries with a volumetric radiance field. We train our system with two large new datasets (11.2k Vroid 3D models, 1k Vtuber portrait illustrations), and evaluate on a novel AnimeRecon benchmark of illustration-to-3D pairs. PAniC-3D significantly outperforms baseline methods, and provides data to establish the task of stylized reconstruction from portrait illustrations.

研究の動機と目的

  • スタイライズドなイラストから、曖昧でフォトリアルなシェーディングを欠いた1枚のラインアートポートレートから、アニメキャラクターの3Dヘッドを再構成する課題に対処すること。
  • スタイライズドなイラストと3Dレンダリングの間のドメインギャップを埋めること、特に非フォトリアルな輪郭線と髪やアクセサリーの複雑な幾何構造に起因するものである。
  • ペア化されたイラスト-3Dデータが不足していることから、アニメドメインにおけるスタイライズドな1ビュー3D再構成のための新規ベンチマークとデータセットを確立すること。
  • 2Dイラストからマルチビューの監視なしに、高品質でテクスチャ付きの3Dラディアンスフィールドを直接生成する、ロバストでエンドツーエンドのシステムを開発すること。
  • アーティストが考案したポートレートから、手作業の3Dモデリングに依存しない自動的かつ高精細な3Dアバター作成を可能にすること。

提案手法

  • 本システムは、EG3D を改変した条件付き生成フレームワークを採用し、マルチビュー3Dレンダリングからの2.5次元監視によって再構成を実現する。
  • ラインベースのイラストを綺麗なレンダリング風の画像に変換する、新規のラインフィルティングモデルを訓練する。この際、輪郭線を除去しながら顔のアイデンティティと構造を保持する。
  • トライプレーン表現を採用し、トライプレーン軸に沿ったマルチレイヤー特徴の統合と特徴プーリングを実装することで、幾何的詳細と特徴の曖昧さの解消を向上させる。
  • 固定された側面・背面ビューの監視信号を適用し、遮蔽領域におけるアーティファクトを低減し、幾何的一致性を向上させる。
  • ピxlsレベルと意味論的レベルの両方の忠実度を最適化するために、L1、LPIPS、およびCLIPベースの損失を組み合わせて使用する。
  • 本システムは、1,000枚の前面・ニュートラルな表情のポートレートイラストからなるVtuberデータセット、および11,200体のマルチビューレンダリング付き3DキャラクターモデルからなるVroidデータセットで学習される。
Figure 1 : Overview of contributions. Our (A) PAniC-3D system is able to reconstruct a 3D radiance field directly from a line-based portrait illustration. We gather a new (B) Vtuber illustration dataset and (C) Vroid 3D models dataset in order to cross the illustration-render domain gap and supervis
Figure 1 : Overview of contributions. Our (A) PAniC-3D system is able to reconstruct a 3D radiance field directly from a line-based portrait illustration. We gather a new (B) Vtuber illustration dataset and (C) Vroid 3D models dataset in order to cross the illustration-render domain gap and supervis

実験結果

リサーチクエスチョン

  • RQ11枚のラインアートポートレートから、高精細でスタイライズドな3Dラディアンスフィールドを再構成できるか?
  • RQ2スタイライズドなイラストと3Dレンダリングの間のドメインギャップを、再構成品質の向上に寄与する形で効果的に埋め合わせられるか?
  • RQ3スタイライズドな3D再構成において、複雑な幾何構造とアイデンティティを保持するために最も有効なアーキテクチャ的要素は何か?
  • RQ4ライン除去モデルの導入が、イラストからの下流の3D再構成にどの程度寄与するか?
  • RQ5提案手法は、既存の暗黙的再構成法および画像対画像翻訳ベースラインと比較して、定量的・定性的にどの程度優れているか?

主な発見

  • PAniC-3D は AnimeRecon ベンチマークで LPIPS スコア 18.26 を達成し、Telea (23.91) や CycleGAN (21.39) といったベースライン手法を著しく上回った。
  • 本システムは CLIP スコア 94.97 を達成し、意味論的およびアイデンティティの保持が優れていることを示し、UGATIT (85.48) や CycleGAN (93.81) を上回った。
  • 固定された側面・背面ビューの監視信号の追加により、幾何構造とテクスチャの忠実度が向上し、肩部の余分な輪郭やバンド状アーティファクトが減少した。
  • アブレーションスタディの結果、特徴プーリングとマルチレイヤーのトライプレーン特徴が、幾何的詳細の向上と特徴の曖昧さの解消に寄与することが確認された。
  • ラインフィルティングモデルは、非フォトリアルな輪郭線を効果的に除去しながら顔の構造を保持でき、顕著なインpaintingや市販のGANよりもアイデンティティ保持性に優れた性能を示した。
  • 強力な性能を発揮しているものの、遮蔽領域や耳の接合部では、実際の3Dアセットに比べて再構成品質が劣っていることが判明し、オブジェクト中心またはパーツに意識的な生成手法の改善の余地があることが示唆された。
Figure 2 : (a) No-line diffuse render, (b) real-lined illustration, (c) Blender Freestyle [ 14 ] , (d) RTSC suggestive contours [ 9 ] . Toon shaders over-draw (c, cheeks) or miss lines (d, bowtie); it is non-trivial to model the artistic line placement in real drawings (b). Thus, we train our Illust
Figure 2 : (a) No-line diffuse render, (b) real-lined illustration, (c) Blender Freestyle [ 14 ] , (d) RTSC suggestive contours [ 9 ] . Toon shaders over-draw (c, cheeks) or miss lines (d, bowtie); it is non-trivial to model the artistic line placement in real drawings (b). Thus, we train our Illust

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。