Skip to main content
QUICK REVIEW

[论文解读] 3D Facial Expression Reconstruction using Cascaded Regression

Fanzi Wu, Songnan Li|arXiv (Cornell University)|Dec 10, 2017
Face recognition and analysis参考文献 1被引用 6
一句话总结

该论文提出了一种级联回归框架,通过关键点位移(LD)特征和HOG特征,从单张图像实现鲁棒的3D面部表情重建,能够有效应对姿态、表情和光照变化。该方法通过联合回归3DMM参数并估计映射矩阵,实现迭代优化,从而在重建精度上优于现有最先进方法。

ABSTRACT

This paper proposes a novel model fitting algorithm for 3D facial expression reconstruction from a single image. Face expression reconstruction from a single image is a challenging task in computer vision. Most state-of-the-art methods fit the input image to a 3D Morphable Model (3DMM). These methods need to solve a stochastic problem and cannot deal with expression and pose variations. To solve this problem, we adopt a 3D face expression model and use a combined feature which is robust to scale, rotation and different lighting conditions. The proposed method applies a cascaded regression framework to estimate parameters for the 3DMM. 2D landmarks are detected and used to initialize the 3D shape and mapping matrices. In each iteration, residues between the current 3DMM parameters and the ground truth are estimated and then used to update the 3D shapes. The mapping matrices are also calculated based on the updated shapes and 2D landmarks. HOG features of the local patches and displacements between 3D landmark projections and 2D landmarks are exploited. Compared with existing methods, the proposed method is robust to expression and pose changes and can reconstruct higher fidelity 3D face shape.

研究动机与目标

  • 为解决从单张RGB图像进行3D面部表情重建的挑战,该问题因遮挡、光照和纹理变化而具有病态性。
  • 克服现有3DMM拟合方法依赖迭代优化且对表情和姿态变化敏感的局限性。
  • 通过引入一种新型高层特征——关键点位移(LD),开发一种对尺度、旋转和光照变化具有鲁棒性的基于学习的方法。
  • 提供一个标准化的3D面部数据集,包含3DMM参数和对应的3D网格,以实现对基于学习的3D重建方法的公平评估。
  • 仅使用Bosphorus数据集中的4,666张训练图像,实现对未见身份和表情的准确且鲁棒的3D面部重建。

提出的方法

  • 利用忠实的关键点检测算法检测2D面部关键点,以初始化3DMM参数和映射矩阵。
  • 提出一种联合特征,结合局部图像块的HOG特征与关键点位移(LD),该特征能鲁棒地编码光照和变换变化下的语义与几何信息。
  • 采用级联回归框架,估计当前3DMM参数与真实值之间的残差,并用于迭代优化形状和映射矩阵。
  • 直接从更新后的3D形状和2D关键点估计映射矩阵,而非通过回归,从而降低数据依赖性并提升泛化能力。
  • 在优化过程中使用正交投影,实现高效且一致的3D到2D映射。
  • 利用包含3DMM参数和3D网格的3D面部数据库(来自Bosphorus和FaceWarehouse)进行训练和评估,确保真实值的对应关系。

实验结果

研究问题

  • RQ1使用关键点位移和HOG特征的级联回归框架是否能提升在姿态和表情变化下的3D面部表情重建鲁棒性?
  • RQ2所提出的联合特征(HOG + LD)在处理光照和几何变化方面与传统特征相比表现如何?
  • RQ3在有限数据集(4,666张图像)上训练的模型,能在多大程度上泛化到未见数据集中的多样化身份和表情?
  • RQ4与回归映射矩阵相比,直接估计映射矩阵是否能提升性能并减少数据依赖?
  • RQ5所提出方法是否能仅使用少量训练数据,实现比现有最先进方法更高的重建保真度?

主要发现

  • 在主面部区域和整个面部区域,该方法的RMSE均低于Zhu等人及其他最先进方法,且在真实网格上的精度更高。
  • 该方法在不同身份和极端表情下均能重建出具有区分度的3D面部形状,尤其在复杂表情下能准确捕捉嘴部几何结构。
  • 在FRGC2数据集上的跨数据集评估结果表明,该方法对光照变化具有鲁棒性,并在不同个体和表情下保持一致的性能表现。
  • 该方法在仅使用Bosphorus数据集中的4,666张训练图像的情况下,优于在更大规模数据集(114K–122K张图像)上训练的深度学习基线方法(如[23]、[24])。
  • 关键点位移(LD)特征通过编码2D关键点与3D投影之间的语义和几何关系,提升了模型的鲁棒性。
  • 与回归映射矩阵相比,直接估计映射矩阵可减少过拟合,提升泛化能力,尤其在训练数据有限时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。