[论文解读] 3D Face Reconstruction from Light Field Images: A Model-free Approach
该论文提出一种无需模型的3D人脸重建方法,通过使用全连接卷积神经网络(FaceLFnet)从单个光场图像中回归出3D人脸曲线,该网络从水平和垂直方向的共轭平面图像(EPIs)中提取特征。通过从3D人脸扫描中合成逼真的光场数据,该方法即使仅使用80位个体的14,000张训练图像,也实现了比当前最先进方法降低20%以上的重建误差。
Reconstructing 3D facial geometry from a single RGB image has recently instigated wide research interest. However, it is still an ill-posed problem and most methods rely on prior models hence undermining the accuracy of the recovered 3D faces. In this paper, we exploit the Epipolar Plane Images (EPI) obtained from light field cameras and learn CNN models that recover horizontal and vertical 3D facial curves from the respective horizontal and vertical EPIs. Our 3D face reconstruction network (FaceLFnet) comprises a densely connected architecture to learn accurate 3D facial curves from low resolution EPIs. To train the proposed FaceLFnets from scratch, we synthesize photo-realistic light field images from 3D facial scans. The curve by curve 3D face estimation approach allows the networks to learn from only 14K images of 80 identities, which still comprises over 11 Million EPIs/curves. The estimated facial curves are merged into a single pointcloud to which a surface is fitted to get the final 3D face. Our method is model-free, requires only a few training samples to learn FaceLFnet and can reconstruct 3D faces with high accuracy from single light field images under varying poses, expressions and lighting conditions. Comparison on the BU-3DFE and BU-4DFE datasets show that our method reduces reconstruction errors by over 20% compared to recent state of the art.
研究动机与目标
- 解决从单张RGB图像进行3D人脸重建的病态问题,该问题受深度模糊性及尺度/基底-相对模糊性的困扰。
- 克服依赖先验3D形态可变形模型的模型化方法的局限性,后者受制于训练数据分布。
- 在不使用人脸关键点或显式形状模型的前提下,实现对不同姿态、表情和光照条件下的高精度3D人脸重建。
- 构建大规模、逼真的合成光场数据集,其真实3D人脸扫描为标注,用于训练深度学习模型。
- 证明基于EPI的逐曲线回归方法可实现高精度3D重建,且所需训练身份数量显著少于端到端方法。
提出的方法
- 从BU-3DFE和BU-4DFE数据集中的3D人脸扫描中合成逼真的光场图像,通过改变姿态、光照和表情以增强真实感。
- 从合成的光场图像中提取水平和垂直方向的共轭平面图像(EPIs),以捕捉与深度相关的光线变化。
- 训练两个独立的全连接卷积神经网络(FaceLFnet),分别从对应的EPI中回归3D人脸曲线,利用特征复用和梯度流动。
- 利用相机参数将来自水平和垂直EPI的预测深度图融合为单一3D点云。
- 对融合后的点云拟合曲面,生成最终的3D人脸网格。
- 利用DenseNet架构捕捉低分辨率EPI中的细微深度梯度,提升估计精度。
实验结果
研究问题
- RQ1是否可以不依赖3D形态可变形模型或显式形状先验,实现从光场图像进行3D人脸重建?
- RQ2与端到端3D人脸估计相比,基于EPI的逐曲线回归方法在多大程度上能提升重建精度?
- RQ3从真实3D人脸扫描中衍生的合成光场数据集,在仅使用少量真实训练数据的情况下,对实现高精度3D重建的有效性如何?
- RQ4所提出方法对人脸姿态、表情和光照条件变化的鲁棒性如何?
- RQ5仅使用80位个体的14,000张训练图像,无模型方法是否能实现最先进性能?
主要发现
- 在BU-3DFE数据集上,该方法将平均重建误差降低至2.78 mm,优于先前最先进方法(如Kemelmacher等人方法为3.89 mm)。
- 与近期最先进方法相比,该方法实现20%以上的误差降低,中位数误差为1.73 mm,90%最大误差为5.30 mm。
- 当人脸姿态变化30度时,重建误差仅增加0.31 mm,表明对姿态变化具有强鲁棒性。
- 在极端面部表情下,RMSE从中性表情时的2.49 mm增加至惊讶表情时的2.98 mm,其中悲伤表情下误差最高。
- 在BU-4DFE数据集上,该方法实现NME为3.72,优于3DDFA(5.14)、EOS(5.33)和VRN-Guided(4.71)。
- 由于采用无模型、基于EPI的学习方法,该方法在不同种族和光照条件下均表现出良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。