[論文レビュー] High-Fidelity 3D Digital Human Head Creation from RGB-D Selfies
本論文では、30秒未塔で、消費者向けのRGB-Dセルフィービデオから高精細で写真のようにリアルな3Dデジタル人間の頭部を完全自動で作成するシステムを提示する。このシステムは、微分可能レンダラーを用いた3Dモーファブルモデル(3DMM)と、パラメトリックフィッティングと畳み込みニューラルネットワーク(CNN)を組み合わせたハイブリッドな反射率合成法を統合し、皮膚の孔、しわ、髪の毛などの詳細な顔面幾何と高解像度のアルベド・ノーマルマップを実現する。
We present a fully automatic system that can produce high-fidelity, photo-realistic 3D digital human heads with a consumer RGB-D selfie camera. The system only needs the user to take a short selfie RGB-D video while rotating his/her head, and can produce a high quality head reconstruction in less than 30 seconds. Our main contribution is a new facial geometry modeling and reflectance synthesis procedure that significantly improves the state-of-the-art. Specifically, given the input video a two-stage frame selection procedure is first employed to select a few high-quality frames for reconstruction. Then a differentiable renderer based 3D Morphable Model (3DMM) fitting algorithm is applied to recover facial geometries from multiview RGB-D data, which takes advantages of a powerful 3DMM basis constructed with extensive data generation and perturbation. Our 3DMM has much larger expressive capacities than conventional 3DMM, allowing us to recover more accurate facial geometry using merely linear basis. For reflectance synthesis, we present a hybrid approach that combines parametric fitting and CNNs to synthesize high-resolution albedo/normal maps with realistic hair/pore/wrinkle details. Results show that our system can produce faithful 3D digital human faces with extremely realistic details. The main code and the newly constructed 3DMM basis is publicly available.
研究の動機と目的
- 消費者用のRGB-Dカメラのみを用いて、高精細でリアルタイムな3Dデジタル人間の頭部作成を可能にすること。
- 最小限のユーザー入力で、マルチビューRGB-Dデータからの正確な顔面幾何再構築の課題に対処すること。
- 皮膚の孔、しわ、まつげの毛など、細部が際立つような高解像度でリアルなアルベドおよびノーマルマップの合成。
- 最小限のユーザーインタラクションで、レンダリング可能でアニメーション用に準備された3Dアバターを生成する完全自動パイプラインの開発。
提案手法
- 短いセルフィービデオから高品質なRGB-Dフレームを選択する二段階のフレーム選択手順を採用し、再構築に用いる。
- 微分可能レンダラーを用いた3DMMフィッティングアルゴリズムにより、広範なデータ生成と摂動を経て新たに構築された、極めて表現力の高い3DMMを用いて顔面幾何を回復する。
- 生成された3DMMは、GANではなくPCAベースのテクスチャベースを採用することで、テクスチャ空間の縮小と幾何制約の強化を実現する。
- ハイブリッドな反射率合成パイプラインは、まずアルベドおよびノーマルマップに対して、マルチスケールピラミッドベースを用いた領域別パラメトリックフィッティングを実行する。
- その後、CNNベースのリファインメントネットワークが初期マップを向上させ、2048×2048の高解像度結果を生成し、リアルな細部を再現する。
- システムは自動的に頭部モデルを完成させ、髪のモデルと一致させ、網膜・歯の位置を推定し、リギング用の表情ブレンドシェイプを生成する。
実験結果
リサーチクエスチョン
- RQ1完全自動のシステムが、30秒未塔で消費者向けのRGB-Dセルフィーから高精細な3D人間の頭部を生成できるか?
- RQ2マルチビューRGB-Dデータは、単一画像またはマルチビューRGB法に比べて、顔面幾何再構築をどのように向上させ得るか?
- RQ3表現力が向上した微分可能3DMMを用いることで、線形基底成分のみを用いても正確な顔面幾何を回復できるか?
- RQ4パラメトリックとディープラーニングのハイブリッドアプローチにより、皮膚の孔やしわといったリアルな顔面細部を有する高解像度のアルベドおよびノーマルマップを合成できるか?
- RQ5本システムは、トレーニングで使用された民族(例:東アジア系でない)の被験者、またはヒゲ、そばかす、そばかすの有無にかかわらず、どれほど一般化できるか?
主な発見
- 本システムは、1つのRGB-Dセルフィービデオから、30秒未塔で、リアルな幾何と写真のようにリアルなテクスチャを持つ高品質な3Dデジタル人間の頭部を生成する。
- 本稿で提示された3DMMは、広範なデータ生成と摂動を経て構築されており、線形基底成分のみを用いても正確な顔面幾何の回復を可能にする。
- 2048×2048の高解像度のアルベドおよびノーマルマップが成功裏に合成され、まつげの毛、唇のしわ、皮膚の孔といった明確な細部が確認できる。
- 反射率合成パイプラインは、パラメトリックフィッティングとCNNリファインメントを組み合わせることで、従来手法に比べて顕著に詳細の忠実度を向上させ、リアルな結果を達成した。
- 照明条件やポーズの変化に対しても結果は一貫しており、皮膚の色の変動は照明とアルベドの本質的な曖昧性に起因するため、制限があるが、それ以上の問題はない。
- 本システムは、完全な頭部モデル、一致した髪、表情ブレンドシェイプを備えたリギング可能な3Dアバターを生成し、リアルタイムのアニメーションやリップシンクアプリケーションを可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。