Skip to main content
QUICK REVIEW

[論文レビュー] Digital Twin: Acquiring High-Fidelity 3D Avatar from a Single Image

Ruizhe Wang, Chih-Fan Chen|arXiv (Cornell University)|Dec 7, 2019
Face recognition and analysis参考文献 45被引用数 7
ひとこと要約

本論文では、1枚の画像から高精細な3Dアバターと高解像度UVテクスチャマップを生成する半教師ありディープラーニング手法を提案する。事前に訓練されたディープフェイシャルアイデンティティ特徴量を用いて、合成されたリアルな顔画像のデータセット上で形状回帰ネットワークを訓練することで、実世界のセルフィーにおいて優れた一般化性能と精度を達成し、顔の細部が明確で現実的なかたちのモバイル対応3Dモデルを生成する。

ABSTRACT

We present an approach to generate high fidelity 3D face avatar with a high-resolution UV texture map from a single image. To estimate the face geometry, we use a deep neural network to directly predict vertex coordinates of the 3D face model from the given image. The 3D face geometry is further refined by a non-rigid deformation process to more accurately capture facial landmarks before texture projection. A key novelty of our approach is to train the shape regression network on facial images synthetically generated using a high-quality rendering engine. Moreover, our shape estimator fully leverages the discriminative power of deep facial identity features learned from millions of facial images. We have conducted extensive experiments to demonstrate the superiority of our optimized 2D-to-3D rendering approach, especially its excellent generalization property on real-world selfie images. Our proposed system of rendering 3D avatars from 2D images has a wide range of applications from virtual/augmented reality (VR/AR) and telepsychiatry to human-computer interaction and social networks.

研究の動機と目的

  • 2D画像1枚から高精細な3Dアバターの自動作成を実現し、手動の3Dスキャンやアーティスト作業への依存を低減すること。
  • 2Dから3Dへの再構成における固有の曖昧性を解消するため、頑健な形状推定に向け、合成されたリアルな顔画像を活用すること。
  • ディープアイデンティティ特徴量と非剛体変形、高解像度UVマッピングを組み合わせることで、テクスチャの現実性と幾何的正確性を向上させること。
  • 低ポリゴンメッシュと高解像度テクスチャ投影を用いることで、モバイルデバイス上でリアルタイムかつ効率的なレンダリングを可能にすること。

提案手法

  • 数百万枚の画像から抽出されたディープフェイシャルアイデンティティ特徴量を用いて、1枚の画像から3D顔モデルの頂点座標を直接回帰するディープニューラルネットワークを訓練する。
  • 形状推定器は、482体のニュートラルな3D顔スキャンから高精細レンダリングエンジンを用いて生成された大規模な合成リアル顔画像データセット上で訓練される。
  • カメラパrameter、ヘッドポーズ、顔の表情、および各頂点ごとの補正フィールドを同時に最適化することで、非剛体変形を適用し、頂点座標を精緻化することでランドマークの正確性を向上させる。
  • 精緻化された3Dメッシュに高解像度UVテクスチャマップを投影し、肌の質感や微細な幾何形状などの顔の細部を保持する。
  • 事前学習済みのアイデンティティ特徴量を活用することで、形状の一般化性能を向上させ、制約のないセルフィー画像からの正確な再構成を可能にする。
  • 最終的な3Dアバターモデルは、低ポリゴンのベースメッシュに高解像度UVテクスチャを組み合わせており、モバイルプラットフォームでの効率的なリアルタイムレンダリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1合成されたリアルな画像で訓練されたディープラーニングモデルは、実世界のセルフィー画像への一般化が効果的に行えるか?
  • RQ2事前学習済みのディープフェイシャルアイデンティティ特徴量を活用することで、1枚画像からの3Dアバター生成における形状推定の正確性と一般化性能はどのように向上するか?
  • RQ3頂点座標の非剛体な精緻化は、ランドマークの正確性とテクスチャ投影品質をどの程度向上させるか?
  • RQ4低ポリゴン数を維持しながら高解像度テクスチャを有する高精細3Dアバターを実現できるか、モバイルレンダリング効率を確保できるか?

主な発見

  • 本手法は、PRNet、RingNet、3DMM-CNNなどの最先端手法と比較して、ベンチマークデータセットにおいて高い形状類似度と優れたテクスチャ解像度を達成した。
  • モデルは実世界のセルフィーへの一般化が非常に優れており、照明、ポーズ、顔の表情の変化に対しても強い耐性を示した。
  • 合成されたリアルな訓練データの使用が顕著に性能向上に寄与し、単純または現実性に欠ける合成データで訓練された手法を上回った。
  • 低ポリゴンのベースジオメトリと高解像度UVテクスチャマッピングのおかげで、最終的な3Dアバターモデルはモバイルデバイス上でリアルタイムレンダリングが可能である。
  • 再構成されたモデルにアニメーションブレンドシェイプを転送することで、高品質な音声駆動リップシンクが実現可能であり、プロダクション運用の準備が整っていることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。