Skip to main content
QUICK REVIEW

[论文解读] ExpNet: Landmark-Free, Deep, 3D Facial Expressions

Feng-Ju Chang, Anh Tran|arXiv (Cornell University)|Feb 2, 2018
Face recognition and analysis参考文献 40被引用 8
一句话总结

ExpNet 提出了一种无关键点的深度学习方法,通过卷积神经网络(CNN)直接从图像强度回归29维3D面部表情系数,相比基于关键点的方法在准确性和鲁棒性方面表现更优,尤其在尺度变化和极端姿态下表现突出,且推理速度高出数个数量级。

ABSTRACT

We describe a deep learning based method for estimating 3D facial expression coefficients. Unlike previous work, our process does not relay on facial landmark detection methods as a proxy step. Recent methods have shown that a CNN can be trained to regress accurate and discriminative 3D morphable model (3DMM) representations, directly from image intensities. By foregoing facial landmark detection, these methods were able to estimate shapes for occluded faces appearing in unprecedented in-the-wild viewing conditions. We build on those methods by showing that facial expressions can also be estimated by a robust, deep, landmark-free approach. Our ExpNet CNN is applied directly to the intensities of a face image and regresses a 29D vector of 3D expression coefficients. We propose a unique method for collecting data to train this network, leveraging on the robustness of deep networks to training label noise. We further offer a novel means of evaluating the accuracy of estimated expression coefficients: by measuring how well they capture facial emotions on the CK+ and EmotiW-17 emotion recognition benchmarks. We show that our ExpNet produces expression coefficients which better discriminate between facial emotions than those obtained using state of the art, facial landmark detection techniques. Moreover, this advantage grows as image scales drop, demonstrating that our ExpNet is more robust to scale changes than landmark detection methods. Finally, at the same level of accuracy, our ExpNet is orders of magnitude faster than its alternatives.

研究动机与目标

  • 开发一种无需依赖面部关键点检测的深度学习方法,用于3D面部表情估计,以应对非约束条件下关键点检测易失效的问题。
  • 通过消除对关键点定位的依赖,提升对尺度变化、离平面旋转和遮挡的鲁棒性。
  • 不以重建误差作为表达质量的评估标准,而是基于在面部情绪识别基准上的下游性能进行评估。
  • 证明直接从图像强度回归3D表情系数,相比基于关键点的方法,能获得更具判别性和泛化能力的表征。
  • 通过避免多阶段处理流程,实现显著更快的推理速度,超越基于关键点的流水线。

提出的方法

  • ExpNet 是一种深度卷积神经网络,直接从原始人脸图像强度回归29维3D表情系数,无需任何中间的关键点检测步骤。
  • 网络在大规模、合成的3DMM生成人脸数据集上进行训练,该数据集包含多样的表情、姿态和光照条件,损失函数旨在最小化预测值与真实值之间的表达系数差异。
  • 为应对合成数据中的标签噪声,方法利用深度网络在噪声监督下的鲁棒性进行训练。
  • 基于3DMM的形状先验在所有样本间固定并共享,使网络可专注于表情估计任务。
  • 采用两阶段训练策略:首先在包含多样化表情的合成数据上进行预训练,然后在弱监督的真实世界数据上进行微调。
  • 评估采用在CK+和EmotiW-17上的情绪识别准确率,其中估计的表达系数作为线性SVM分类器的特征输入。

实验结果

研究问题

  • RQ1是否能够不依赖面部关键点检测,准确地从图像强度估计3D面部表情系数?
  • RQ2在极端尺度和姿态变化下,无关键点表达估计方法与基于关键点的方法在情绪识别准确率上的表现差异如何?
  • RQ3所提出方法在存在遮挡和极端头部姿态的野外、非约束人脸图像上的泛化能力如何?
  • RQ4无关键点方法的推理速度与多阶段基于关键点的流水线相比如何?
  • RQ5估计的表达系数是否能比基于关键点的方法更好地捕捉细微的情绪差异?

主要发现

  • 在CK+和EmotiW-17基准上,ExpNet在所有评估方法中取得了最高的情绪识别准确率,甚至优于最先进的基于关键点的方法CLNF。
  • 随着图像尺度减小,ExpNet与基于关键点方法之间的性能差距显著扩大,表明其在尺度变化下具有更强的鲁棒性。
  • ExpNet的推理速度至少快一个数量级,其推理时间与端到端深度网络(如3DDFA)相当,同时避免了多阶段流水线带来的计算开销。
  • 定性结果表明,ExpNet能更好地捕捉细微表情(如恐惧和愤怒),避免了3DDFA和CE-CLM中常见的过度夸张或尺度不一致问题。
  • 尽管具有诸多优势,ExpNet在极端表情(如惊讶)上仍存在局限,此时3DDFA生成的估计结果在视觉上更合理但准确性较低。
  • 该方法在真实世界、非约束图像上泛化良好,能成功估计具有极端姿态、遮挡和低分辨率的人脸表情。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。