[論文レビュー] 3D Face Reconstruction from Light Field Images: A Model-free Approach
本稿では、水平および垂直エピポラル平面画像(EPI)から3次元顔の曲線を回帰する、密結合畳み込みニューラルネットワーク(FaceLFnet)を用いた、1枚の光場画像からのモデルフリーな3次元顔再構成手法を提案する。3次元顔スキャンから写真同等の光場データを合成することで、80人の被験者を対象に14,000枚の訓練画像のみで、最先端手法よりも20%以上の再構成誤差低減を達成した。
Reconstructing 3D facial geometry from a single RGB image has recently instigated wide research interest. However, it is still an ill-posed problem and most methods rely on prior models hence undermining the accuracy of the recovered 3D faces. In this paper, we exploit the Epipolar Plane Images (EPI) obtained from light field cameras and learn CNN models that recover horizontal and vertical 3D facial curves from the respective horizontal and vertical EPIs. Our 3D face reconstruction network (FaceLFnet) comprises a densely connected architecture to learn accurate 3D facial curves from low resolution EPIs. To train the proposed FaceLFnets from scratch, we synthesize photo-realistic light field images from 3D facial scans. The curve by curve 3D face estimation approach allows the networks to learn from only 14K images of 80 identities, which still comprises over 11 Million EPIs/curves. The estimated facial curves are merged into a single pointcloud to which a surface is fitted to get the final 3D face. Our method is model-free, requires only a few training samples to learn FaceLFnet and can reconstruct 3D faces with high accuracy from single light field images under varying poses, expressions and lighting conditions. Comparison on the BU-3DFE and BU-4DFE datasets show that our method reduces reconstruction errors by over 20% compared to recent state of the art.
研究の動機と目的
- 深度の不確実性およびスケール/ベースリリーフの不確実性に起因する、単一のRGB画像からの3次元顔再構成という不適切に定義された問題に対処する。
- 事前定義された3次元モーファブルモデルに依存し、訓練データの分布に制約を受けるモデルベース手法の限界を克服する。
- 顔のランドマークや明示的な形状モデルを用いずに、異なるポーズ、表情、照明条件下でも正確な3次元顔再構成を可能にする。
- 深層学習モデルの学習に用いるため、真の3次元顔スキャンを伴う大規模かつ写真同等の合成光場データセットを開発する。
- EPIからの曲線ごとの回帰が、エンドツーエンド手法に比べてはるかに少ない訓練被験者数で高精度な3次元再構成を可能にすることを示す。
提案手法
- BU-3DFEおよびBU-4DFEデータセットの3次元顔スキャンから、ポーズ、照明、表情を変化させることで、写真同等の光場画像を合成する。
- 合成された光場画像から水平および垂直エピポラル平面画像(EPI)を抽出し、深度に関連する光線の変化を捉える。
- それぞれのEPIから3次元顔の曲線を回帰する2つの独立した密結合畳み込みニューラルネットワーク(FaceLFnet)を訓練し、特徴の再利用と勾配の流れを活用する。
- カメラパラメータを用いて、水平および垂直EPIからの予測された深度マップを統合し、1つの3次元点群を生成する。
- 統合された点群に表面をフィッティングして、最終的な3次元顔メッシュを生成する。
- DenseNetアーキテクチャを活用して、低解像度のEPIにおける微細な深度勾配を捉え、推定精度を向上させる。
実験結果
リサーチクエスチョン
- RQ13次元モーファブルモデルや明示的な形状事前知識に依存せずに、光場画像からの3次元顔再構成が可能か?
- RQ2EPIからの曲線ごとの回帰アプローチは、エンドツーエンド3次元顔推定に比べて、どれほど再構成精度を向上させられるか?
- RQ3実際の3次元顔スキャンから得た合成光場データセットは、実際の訓練データが少ない状況でも、高精度な3次元再構成を可能にするか?
- RQ4本手法は、顔のポーズ、表情、照明条件の変化に対してどれほど頑健か?
- RQ514,000枚の訓練画像(80名分)でのみ、モデルフリーなアプローチが最先端の性能を達成できるか?
主な発見
- BU-3DFEデータセットにおいて、平均再構成誤差を2.78 mmに低減し、先行研究(例:Kemelmacherらは3.89 mm)を上回った。
- 最近の最先端手法と比較して20%以上の誤差低減を達成し、中央値誤差は1.73 mm、90%最大誤差は5.30 mmであった。
- 顔のポーズが30度変化しても誤差はたった0.31 mm増加にとどまり、ポーズ変動に対して強い頑健性を示した。
- 極端な表情の状態では、中立時(2.49 mm)から驚きの表情(2.98 mm)にRMSEが上昇し、最も高い誤差は悲しみの表情で観察された。
- BU-4DFEデータセットでは、NMEが3.72を達成し、3DDFA(5.14)、EOS(5.33)、VRN-Guided(4.71)を上回った。
- モデルフリーでEPIに基づく学習アプローチであるため、民族的背景や照明条件の変化に対しても良好な一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。