Skip to main content
QUICK REVIEW

[论文解读] Weakly-Supervised Multi-Face 3D Reconstruction

Jialiang Zhang, Lixiang Lin|arXiv (Cornell University)|Jan 6, 2021
Face recognition and analysis参考文献 41被引用 12
一句话总结

本文提出了一种弱监督、单次推理的端到端多人脸3D重建框架,可在一次前向传播中预测多张人脸的3D面部参数,通过共享全局相机模型恢复相对的3D头部位置与朝向。该方法减少了计算冗余,实现了高效、可部署的推理,且无需检测或裁剪等预处理步骤。

ABSTRACT

3D face reconstruction plays a very important role in many real-world multimedia applications, including digital entertainment, social media, affection analysis, and person identification. The de-facto pipeline for estimating the parametric face model from an image requires to firstly detect the facial regions with landmarks, and then crop each face to feed the deep learning-based regressor. Comparing to the conventional methods performing forward inference for each detected instance independently, we suggest an effective end-to-end framework for multi-face 3D reconstruction, which is able to predict the model parameters of multiple instances simultaneously using single network inference. Our proposed approach not only greatly reduces the computational redundancy in feature extraction but also makes the deployment procedure much easier using the single network model. More importantly, we employ the same global camera model for the reconstructed faces in each image, which makes it possible to recover the relative head positions and orientations in the 3D scene. We have conducted extensive experiments to evaluate our proposed approach on the sparse and dense face alignment tasks. The experimental results indicate that our proposed approach is very promising on face alignment tasks without fully-supervision and pre-processing like detection and crop. Our implementation is publicly available at \url{https://github.com/kalyo-zjl/WM3DR}.

研究动机与目标

  • 解决传统多人脸3D重建流水线因对每个检测到的人脸分别进行推理而带来的计算效率低下与部署复杂的问题。
  • 通过单次网络前向传播实现多张人脸3D面部模型参数(形状、纹理、光照、姿态)的端到端预测。
  • 通过在图像中所有人脸间强制使用统一的全局相机模型,实现相对3D场景结构的恢复,从而恢复相对的3D头部位置与朝向。
  • 在无需完全监督或如人脸检测与裁剪等预处理步骤的情况下,实现高质量的人脸对齐与重建。

提出的方法

  • 提出一种单次、端到端的深度学习框架,通过一次前向传播联合回归多张人脸的3D面部参数(形状、反照率、光照、姿态)。
  • 采用混合损失函数,结合稀疏2D关键点监督与可微图像生成,以实现弱监督训练。
  • 在图像中所有人脸之间引入共享的全局相机模型,确保焦距与相机中心一致,从而实现相对3D场景结构的恢复。
  • 采用分阶段训练策略,对整个框架进行端到端优化,提升鲁棒性与收敛性。
  • 利用单一深度神经网络(ResNet-50主干)联合完成定位与3D参数预测,消除冗余的特征提取过程。
  • 应用可微渲染,通过原始图像像素监督3D人脸重建,实现在无3D真实值的情况下实现弱监督。

实验结果

研究问题

  • RQ1单个深度神经网络是否能有效实现对多张人脸的3D面部参数的同步预测,而无需检测与裁剪等预处理?
  • RQ2共享的全局相机模型在多张人脸场景中如何提升相对3D头部位置与朝向的恢复效果?
  • RQ3仅依赖2D关键点与图像像素的弱监督学习,在多大程度上可实现高保真度的3D人脸重建?
  • RQ4所提出的单次推理框架在计算效率与重建质量方面是否优于传统的两阶段流水线?

主要发现

  • 所提方法在稀疏与密集人脸对齐任务上均达到最先进性能,且无需完全监督的3D真实值或预处理步骤。
  • 该框架将512×512图像中多张人脸的推理时间降低至12 ms,且推理时间与人脸数量无关,保持恒定,而传统流水线的推理时间随人脸数量线性增长。
  • 全局相机模型的引入使得相对3D头部位置与朝向的恢复更加准确,而传统方法中独立处理每张人脸则会丢失此类信息。
  • 定性结果表明,与MoFA、Tran及Genova等人相比,本方法在重建人脸的相似度、纹理保真度与色彩一致性方面均有显著提升。
  • 特征图分析表明,该方法对预处理变化具有鲁棒性,中心人脸的重建质量保持一致。
  • 在AFLW2000-3D与多人脸基准测试中,该方法实现了高保真度的重建,证明了其在真实场景中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。