Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Monocular 3D Face Reconstruction by Occlusion-Aware Multi-view Geometry Consistency

Jiaxiang Shang, Tianwei Shen|arXiv (Cornell University)|Jul 24, 2020
Face recognition and analysis参考文献 67被引用 11
一句话总结

该论文提出MGCNet,一种自监督单目3D人脸重建方法,通过强制多视角几何一致性来解决姿态和深度的歧义问题。通过引入一种考虑遮挡的视角合成框架以及三种新型损失函数——像素损失、深度损失和对极几何损失,MGCNet在具有挑战性的条件下(如大姿态变化、表情变化和光照变化)的基准数据集上实现了最先进性能。

ABSTRACT

Recent learning-based approaches, in which models are trained by single-view images have shown promising results for monocular 3D face reconstruction, but they suffer from the ill-posed face pose and depth ambiguity issue. In contrast to previous works that only enforce 2D feature constraints, we propose a self-supervised training architecture by leveraging the multi-view geometry consistency, which provides reliable constraints on face pose and depth estimation. We first propose an occlusion-aware view synthesis method to apply multi-view geometry consistency to self-supervised learning. Then we design three novel loss functions for multi-view consistency, including the pixel consistency loss, the depth consistency loss, and the facial landmark-based epipolar loss. Our method is accurate and robust, especially under large variations of expressions, poses, and illumination conditions. Comprehensive experiments on the face alignment and 3D face reconstruction benchmarks have demonstrated superiority over state-of-the-art methods. Our code and model are released in https://github.com/jiaxiangshang/MGCNet.

研究动机与目标

  • 解决从单张图像进行3D人脸重建的病态问题,特别是人脸姿态和深度估计中的歧义问题。
  • 克服现有自监督方法仅依赖2D关键点和像素级损失的局限性,这些方法无法有效约束3D几何结构。
  • 利用公开的多视角数据(如视频)来在无3D监督的情况下强制实现跨视角的几何一致性。
  • 构建一个在表情、姿态和光照条件大幅变化下仍具有良好泛化能力的鲁棒框架。
  • 仅通过多视角几何约束实现自监督监督下的精确3D人脸重建。

提出的方法

  • 提出一种考虑遮挡的视角合成方法,利用估计的深度和姿态从多个源视角生成目标视角图像。
  • 设计共可见图以识别跨视角间的可靠像素对应关系,减少自遮挡带来的误差。
  • 设计像素一致性损失,以在真实图像与合成图像之间强制实现光度一致性。
  • 制定深度一致性损失,利用多视角三角测量的几何约束来正则化深度估计。
  • 提出基于人脸关键点的对极几何损失,通过从3DMM投影得到的2D关键点来强制实施对极几何约束。
  • 通过优化三种新型损失函数,仅使用RGB图像端到端训练模型,无需3D真实值监督。

实验结果

研究问题

  • RQ1能否在自监督3D人脸重建中有效利用多视角几何一致性,以减少姿态和深度的歧义?
  • RQ2考虑遮挡的视角合成如何提升3D人脸重建中多视角一致性的可靠性?
  • RQ3与仅依赖2D监督相比,所提出的像素、深度和对极几何一致性损失在多大程度上提升了重建精度?
  • RQ4该方法在面部表情、姿态和光照发生极端变化时表现如何?
  • RQ5该模型能否在无显式3D监督的情况下泛化到真实场景和非约束数据集?

主要发现

  • MGCNet在300W-LP和AFLW20003D基准数据集上实现了最先进性能,其3D人脸重建质量优于以往的自监督与有监督方法。
  • 在BU-3DFE数据集上,MGCNet在各种面部表情下均能生成准确的重建结果,表现出对身份和表情变化的强鲁棒性。
  • 定性结果表明,MGCNet预测的2D人脸关键点常比真实值更准确,表明其对齐性能得到显著提升。
  • 该方法能很好地泛化到真实场景数据,在单张图像输入下生成逼真且几何准确的3D人脸重建结果。
  • 消融实验验证了三种新损失函数(像素、深度、对极几何)对最终性能均有显著贡献,其中对极几何损失在稳定姿态估计方面尤为有效。
  • 在MICC Florence数据集上,MGCNet表现优异,尤其在大姿态场景下超越了RingNet和Deng et al.等方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。