[論文レビュー] FaceScape: a Large-scale High Quality 3D Face Dataset and Detailed Riggable 3D Face Prediction
本稿では、938名の被験者から20の表情を含む、18,760体の高精細なテクスチャ付き3D顔を含む大規模な3D顔データセットFaceScapeを紹介する。本研究では、双線形パラメトリックモデルを用いて動的顔面細部を学習することで、1枚の画像から詳細かつリグ可能な3D顔モデルを予測する深層学習パイプラインを提案し、最先端の再構成精度を達成するとともに、微細な幾何的詳細を備えた自然な表情アニメーションを可能にした。
In this paper, we present a large-scale detailed 3D face dataset, FaceScape, and propose a novel algorithm that is able to predict elaborate riggable 3D face models from a single image input. FaceScape dataset provides 18,760 textured 3D faces, captured from 938 subjects and each with 20 specific expressions. The 3D models contain the pore-level facial geometry that is also processed to be topologically uniformed. These fine 3D facial models can be represented as a 3D morphable model for rough shapes and displacement maps for detailed geometry. Taking advantage of the large-scale and high-accuracy dataset, a novel algorithm is further proposed to learn the expression-specific dynamic details using a deep neural network. The learned relationship serves as the foundation of our 3D face prediction system from a single image input. Different than the previous methods, our predicted 3D models are riggable with highly detailed geometry under different expressions. The unprecedented dataset and code will be released to public for research purpose.
研究の動機と目的
- 微細な幾何的詳細とトポロジカルな一貫性を備えた大規模で高品質な3D顔データセットの不足を解消すること。
- 従来の手法が1枚の画像からしわのような微細な動的顔面細部を予測する能力に制限を受けてきた問題を克服すること。
- 複数の表情にわたる高忠実度の幾何的形状を備えたリグ可能な3D顔モデルを生成する深層学習ベースのシステムを開発すること。
- 大規模データセットから表現固有の動的細部を学習することで、正確な3D顔再構成とアニメーションを実現すること。
提案手法
- 制御された照明下で68台の高密度カメラアレイを用いて、18,760体の高解像度3D顔スキャンを取得し、毛穴レベルの幾何的詳細を達成した。
- 生のスキャンをトポロジカルに一様なベースメッシュとディスplaceメントマップに変換し、粗い形状と微細な詳細を分離した。
- 処理済みデータを用いてアイデンティティ空間と表現空間の両方に双線形パラメトリックモデルを構築し、頑健な形状表現を実現した。
- 1枚の画像からディスプレースメントマップと動的細部を予測するための深層ニューラルネットワークを提案し、表現固有の変形マップに条件付けた。
- ベースモデルフィッティング、ディスプレースメントマップ予測、動的細部合成の3段階パイプラインを設計し、完全なリグ可能な3D顔生成を実現した。
- 一貫性と制御性を確保するため、50個のアイデンティティ、52個の表現、100個のアルベドパラメータを備えたパラメトリックモデルを用いた。
実験結果
リサーチクエスチョン
- RQ1高密度なマルチビューカメラシステムを用いて、毛穴レベルの幾何的詳細を備えた大規模な3D顔データセットを構築可能か?
- RQ2深層学習を用いて、1枚の画像からしわのような動的顔面細部を効果的に予測できるか?
- RQ3高品質なデータに基づく双線形パラメトリックモデルが、3D顔再構成の忠実度をどの程度向上できるか?
- RQ4予測された3D顔モデルは、微細な幾何的詳細を備えた自然な表情を生成するためにリグ可能か?
- RQ5動的細部学習と変形マップの条件付けが、合成された顔面幾何のリアリズムと正確さに及ぼす影響は何か?
主な発見
- 提案手法は、全表情にわたり平均点対平面再構成誤差1.39 mmを達成し、従来手法(DFDN: 2.19 mm、Extreme3D: 2.06 mm、3DDFA: 2.17 mm)を上回る性能を示した。
- 動的細部を含むモデルは、入力顔形状の再構成において、元の表情で平均誤差1.22 mmを達成し、高い再現精度を示した。
- アブレーションスタディの結果、動的細部学習と変形マップの条件付けの両方が、表現固有のしわを生成するために不可欠であることが確認され、両者の欠如は微細な幾何的詳細の喪失を引き起こした。
- 視覚的比較では、予測されたモデルが、従来手法では回復不可能な写真的で表現依存のしわを含んでいることが示された。
- 18,760体の高忠実度3D顔を含むFaceScapeデータセットは、これまでにない詳細さと包括性を備えた3D顔データとして、優れたモデル学習を可能にした。
- 公開されたデータセットとコードは、3D顔モデリング、アニメーション、1枚画像からの再構成分野の研究を加速すると期待される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。