[论文解读] Regressing Robust and Discriminative 3D Morphable Models with a very Deep Neural Network
本文提出一种非常深的卷积神经网络(CNN),直接从单张非约束人脸图像回归出鲁棒且具有判别性的三维可变形模型(3DMM)形状与纹理参数。通过生成大规模合成训练数据集,该方法在3D人脸重建任务中达到最先进精度,并在LFW、YTF和IJB-A基准上实现了具有竞争力的3D人脸识别性能——这是首次成功在非约束环境下将3D人脸形状作为可解释表征使用。
The 3D shapes of faces are well known to be discriminative. Yet despite this, they are rarely used for face recognition and always under controlled viewing conditions. We claim that this is a symptom of a serious but often overlooked problem with existing methods for single view 3D face reconstruction: when applied "in the wild", their 3D estimates are either unstable and change for different photos of the same subject or they are over-regularized and generic. In response, we describe a robust method for regressing discriminative 3D morphable face models (3DMM). We use a convolutional neural network (CNN) to regress 3DMM shape and texture parameters directly from an input photo. We overcome the shortage of training data required for this purpose by offering a method for generating huge numbers of labeled examples. The 3D estimates produced by our CNN surpass state of the art accuracy on the MICC data set. Coupled with a 3D-3D face matching pipeline, we show the first competitive face recognition results on the LFW, YTF and IJB-A benchmarks using 3D face shapes as representations, rather than the opaque deep feature vectors used by other modern systems.
研究动机与目标
- 解决在非约束、真实场景下鲁棒且具有判别性的3D人脸形状估计问题。
- 通过生成大规模包含对应3DMM参数的非约束人脸图像合成数据集,克服深度CNN训练数据标注稀缺的问题。
- 实现对姿态和光照变化具有稳定性的高精度3D人脸重建,避免过度正则化或不稳定性。
- 证明当准确估计时,3D人脸形状可作为非约束环境下人脸识别的强而可解释的表征。
- 使用3DMM参数而非模糊的深度特征实现具有竞争力的人脸识别性能,提升可解释性与鲁棒性。
提出的方法
- 训练一个非常深的残差CNN(101层),直接从单张输入人脸图像回归3DMM形状与纹理参数。
- 通过使用3DMM先验并改变光照、姿态和表情,合成多样化非约束人脸图像,构建大规模合成训练数据集。
- 采用弱监督训练策略,利用可微渲染层,通过3DMM重建损失监督CNN。
- 在CNN后添加池化层,聚合特征以提升对未见姿态和表情的泛化能力。
- 将估计的3DMM参数集成到3D-3D人脸匹配流程中,使用几何相似性作为匹配度量。
- 利用3DMM的统计先验正则化网络,防止对合成数据过拟合,提升在真实世界图像上的泛化能力。
实验结果
研究问题
- RQ1尽管真实标注数据有限,能否有效训练一个非常深的CNN,从单张非约束人脸图像回归出准确的3DMM参数?
- RQ2所提出的合成数据生成方法是否能产生真实且多样的训练样本,使其在真实世界非约束图像上具有良好泛化能力?
- RQ3所生成的3D人脸重建是否在姿态和光照变化下均具备鲁棒性,且具有足够判别力以支持具有竞争力的人脸识别?
- RQ4基于3D人脸形状的识别性能与使用深度特征嵌入的最先进系统相比,在LFW、YTF和IJB-A等标准基准上表现如何?
- RQ53DMM参数能否在非约束环境下作为可解释且鲁棒的人脸表征,优于通用或过度正则化的3D形状?
主要发现
- 该方法在MICC数据集上实现了最先进的3D人脸重建精度,表面误差达到毫米级,优于现有方法。
- 在LFW基准上,该方法在人脸验证任务中达到98.5%的准确率,优于其他基于3D重建的方法,并接近Facebook的多CNN系统性能。
- 在YTF基准上,该方法AUC达到97.8%,比3DDFA和基于3DMM的方法高出10多个百分点,仅比Facebook的CNN集成系统低1%。
- 在具有挑战性的IJB-A基准上,该方法在1:1验证和1:N识别任务中表现具有竞争力,显著优于3DDFA和基于3DMM的方法,尽管仍略逊于最新专用系统。
- 定性结果表明,该方法生成的3D形状视觉上合理,鼻部和口周区域误差较低,且同一被试在不同视角下保持一致性。
- 失败案例主要源于3DMM先验中未包含的面部毛发以及极端的离平面旋转,表明底层3DMM表示存在局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。