Skip to main content
QUICK REVIEW

[论文解读] InverseFaceNet: Deep Monocular Inverse Face Rendering

Hyeongwoo Kim, Michael Zollhöfer|arXiv (Cornell University)|Mar 31, 2017
Face recognition and analysis参考文献 46被引用 11
一句话总结

InverseFaceNet 是一种深度学习框架,通过联合估计面部姿态、形状、表情、反射率和光照,实现实时、单图像逆向人脸渲染。它采用新颖的模型空间损失函数和自监督自举机制,提升对真实世界图像的泛化能力,实现比基于优化的方法快达200倍的高质量重建。

ABSTRACT

We introduce InverseFaceNet, a deep convolutional inverse rendering framework for faces that jointly estimates facial pose, shape, expression, reflectance and illumination from a single input image. By estimating all parameters from just a single image, advanced editing possibilities on a single face image, such as appearance editing and relighting, become feasible in real time. Most previous learning-based face reconstruction approaches do not jointly recover all dimensions, or are severely limited in terms of visual quality. In contrast, we propose to recover high-quality facial pose, shape, expression, reflectance and illumination using a deep neural network that is trained using a large, synthetically created training corpus. Our approach builds on a novel loss function that measures model-space similarity directly in parameter space and significantly improves reconstruction accuracy. We further propose a self-supervised bootstrapping process in the network training loop, which iteratively updates the synthetic training corpus to better reflect the distribution of real-world imagery. We demonstrate that this strategy outperforms completely synthetically trained networks. Finally, we show high-quality reconstructions and compare our approach to several state-of-the-art approaches.

研究动机与目标

  • 开发一种实时、单次拍摄的逆向人脸渲染方法,从单张图像中估计完整的面部参数。
  • 通过提升泛化能力,解决合成训练数据与真实世界人脸图像之间的域差距问题。
  • 在一次前向传播中联合回归姿态、形状、表情、反射率和光照参数。
  • 通过引入自监督自举机制,克服纯合成数据训练的局限性,以适应训练分布。

提出的方法

  • 提出一种新颖的模型空间损失函数,直接在修改后的参数空间中度量距离,以提高重建精度。
  • 引入一种自监督自举过程,利用网络在真实图像上的预测结果生成新的合成训练数据。
  • 在大规模合成渲染人脸图像语料库上训练深度卷积神经网络,其已知真实参数。
  • 使用真实图像中估计参数的扰动版本扩展合成训练集,以更好地反映真实世界中的参数分布。
  • 在每次自举步骤中采用均值自适应高斯重采样策略,以覆盖域外样本,尤其是在分布边界处。
  • 以端到端方式联合回归所有人脸模型参数——姿态、形状、表情、反射率和光照。

实验结果

研究问题

  • RQ1深度神经网络能否从单张图像中高保真地联合估计所有关键人脸参数(姿态、形状、表情、反射率、光照)?
  • RQ2如何有效减少合成训练数据与真实世界人脸图像之间的域差距?
  • RQ3自监督自举能否在无真实标签的情况下,提升人脸重建网络在野外图像中的泛化能力?
  • RQ4直接在参数空间中操作的模型空间损失函数,是否比标准像素级损失函数带来更好的重建精度?
  • RQ5与最先进的基于优化的逆向渲染方法相比,该方法在速度和质量上表现如何?

主要发现

  • 在 300-VW Volker 序列上,InverseFaceNet 的几何误差为 2.10 mm(标准差 0.42 mm),优于 Tewari 等人 [11](2.94 mm),并接近 Garrido 等人 [3](1.96 mm)。
  • 该方法每张图像仅需 9.4 ms,比基于优化的方法(如 Garrido 等人 [3],每张图像需 2 分钟)快多个数量级。
  • 与仅在合成数据上训练的网络相比,自监督自举显著提升了真实世界图像的重建质量。
  • 定性结果表明,InverseFaceNet 生成的重建结果比当前最先进方法更具感知真实性,具有更优的几何拟合、准确的反射率和正确的光照。
  • 该方法成功恢复了颜色反射率和光照——这些维度在以往基于学习的方法中常被忽略——同时保持了实时推理能力。
  • 模型空间损失函数通过直接在人脸模型参数空间中优化,而非在像素空间中优化,从而提升了参数精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。