Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Depth Estimation, 3D Face Rotation and Replacement

Joel Ruben Antony Moniz, Christopher Beckham|arXiv (Cornell University)|Mar 25, 2018
Face recognition and analysis参考文献 25被引用 21
一句话总结

该论文提出DepthNets,一种无监督深度学习方法,通过预测关键点深度并利用其计算3D仿射变换,实现从单张2D图像估计3D面部结构,从而完成面部旋转与替换。该方法无需真实3D数据即可实现姿态归一化与身份替换,通过可微分深度监督和对抗性外观优化,实现逼真的3D面部形变。

ABSTRACT

We present an unsupervised approach for learning to estimate three dimensional (3D) facial structure from a single image while also predicting 3D viewpoint transformations that match a desired pose and facial geometry. We achieve this by inferring the depth of facial keypoints of an input image in an unsupervised manner, without using any form of ground-truth depth information. We show how it is possible to use these depths as intermediate computations within a new backpropable loss to predict the parameters of a 3D affine transformation matrix that maps inferred 3D keypoints of an input face to the corresponding 2D keypoints on a desired target facial geometry or pose. Our resulting approach, called DepthNets, can therefore be used to infer plausible 3D transformations from one face pose to another, allowing faces to be frontalized, transformed into 3D models or even warped to another pose and facial geometry. Lastly, we identify certain shortcomings with our formulation, and explore adversarial image translation techniques as a post-processing step to re-synthesize complete head shots for faces re-targeted to different poses or identities.

研究动机与目标

  • 从单张2D图像中实现3D面部旋转与替换,且无需真实3D深度或面部几何数据。
  • 通过将深度与3D仿射变换参数关联的可微分损失,无监督地学习面部关键点的深度预测。
  • 通过估计将源面部关键点映射到目标几何结构的3D仿射变换,实现姿态归一化与面部替换。
  • 通过对抗性图像到图像翻译方法修复背景与外观不一致,提升形变后面部的视觉真实感。

提出的方法

  • DepthNets使用神经网络从单张图像中预测N个面部关键点的深度,且不依赖深度值的监督信号。
  • 通过深度增强的2D源关键点的伪逆与2D目标关键点,以闭式解计算3D仿射变换矩阵,支持该变换的反向传播。
  • 通过可微分损失进行模型训练,强制约束预测深度与生成的3D仿射变换之间的一致性,实现端到端优化。
  • 采用类似Siamese的架构,对源图像与目标图像共享权重;全连接变体则仅使用关键点坐标。
  • 在形变后应用对抗性图像到图像翻译网络,以优化形变3D面部的外观,修正背景错位并提升真实感。
  • 使用带纹理的三角形网格,结合估计的3D仿射变换,将源面部投影到目标几何结构上。

实验结果

研究问题

  • RQ1能否在无任何3D监督的情况下,从单张2D图像中预测3D面部几何与姿态变换?
  • RQ2能否利用面部关键点的深度预测,计算出可微分的3D仿射变换,实现从源面部几何到目标几何的映射?
  • RQ3如何将无监督深度估计整合进支持端到端训练的可微分流水线,以实现面部旋转与替换?
  • RQ4当背景与纹理不匹配时,对抗性图像翻译能否提升形变面部的视觉真实感?

主要发现

  • 所提方法在无真实3D深度数据的无监督3D面部估计中,实现了最先进的关键点配准性能。
  • 可微分公式支持对3D仿射变换的伪逆计算进行反向传播,实现深度与变换参数的联合优化。
  • 该方法成功实现了面部正面化与跨身份的姿态迁移,即使在源与目标面部存在显著外观与几何差异时亦表现良好。
  • 对抗性后处理显著提升了视觉质量,通过合成逼真背景并修正形变面部的纹理不一致。
  • 模型在多样化身份与姿态(包括极端非正面视角)下具有良好的泛化能力,但当遮挡导致纹理提取失败时性能会下降。
  • 该方法避免依赖相机参数或源与目标图像间的像素对应关系,因此对光照与色彩变化具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。