Skip to main content
QUICK REVIEW

[论文解读] Facial Motion Prior Networks for Facial Expression Recognition

Yuedong Chen, Jianfeng Wang|arXiv (Cornell University)|Feb 23, 2019
Emotion and Mood Recognition参考文献 25被引用 9
一句话总结

本文提出了一种名为面部运动先验网络(FMPN)的新颖深度学习框架,用于面部表情识别。该框架利用基于领域知识的运动掩码生成器——具体而言,是利用中性脸与表情脸之间的平均差异——来突出显示面部肌肉运动区域。通过将先验知识有效整合到特征学习中,该方法在CK+、MMI和AffectNet数据集上实现了最先进性能。

ABSTRACT

Deep learning based facial expression recognition (FER) has received a lot of attention in the past few years. Most of the existing deep learning based FER methods do not consider domain knowledge well, which thereby fail to extract representative features. In this work, we propose a novel FER framework, named Facial Motion Prior Networks (FMPN). Particularly, we introduce an addition branch to generate a facial mask so as to focus on facial muscle moving regions. To guide the facial mask learning, we propose to incorporate prior domain knowledge by using the average differences between neutral faces and the corresponding expressive faces as the training guidance. Extensive experiments on three facial expression benchmark datasets demonstrate the effectiveness of the proposed method, compared with the state-of-the-art approaches.

研究动机与目标

  • 为解决现有深度学习方法在面部表情识别(FER)中难以有效整合领域知识的局限性。
  • 克服对辅助数据(如面部关键点、光流或动作单元标注)的依赖,这些数据通常不可用或难以获取。
  • 消除基于生成对抗网络(GAN)的去表情方法中对成对中性与表情人脸的不切实际要求。
  • 开发一种端到端可训练的FER框架,通过学习到的运动掩码聚焦于面部肌肉运动区域,从而增强特征的判别能力。
  • 证明面部运动先验在不同数据集之间,包括真实世界场景下的可迁移性。

提出的方法

  • 该框架由三个组件构成:面部运动掩码生成器(FMG)、先验融合网络(PFN)和分类网络(CN)。
  • FMG以灰度表情脸作为输入,生成突出显示面部肌肉运动区域的空间掩码。
  • 掩码生成过程受到从对应中性脸与表情脸之间平均差异中提取的伪真实掩码的引导。
  • PFN将原始输入图像与生成的运动掩码融合,以在特征学习过程中整合特定领域的知识。
  • CN(如VGG或ResNet)从融合表示中提取高层特征,用于最终的表情分类。
  • 整个模型通过两个损失函数进行端到端训练:一个用于掩码生成器($l_G$),另一个用于分类头($l_C$)。

实验结果

研究问题

  • RQ1将关于面部肌肉运动的领域知识整合进来,是否能提升面部表情识别中深层特征的判别能力?
  • RQ2使用中性脸与表情脸之间的平均差异作为运动掩码学习的监督信号,是否能带来优于无此类引导的端到端学习的性能提升?
  • RQ3所学习到的面部运动先验是否能在不同数据集之间实现迁移,包括在缺乏中性脸的真实世界场景中?
  • RQ4与最先进的基于图像和序列的FER方法相比,所提出方法在准确率和鲁棒性方面表现如何?
  • RQ5聚焦于面部肌肉运动区域在多大程度上能提升在CK+、MMI和AffectNet等基准数据集上的识别性能?

主要发现

  • 所提出的FMPN在CK+数据集上达到98.06%的准确率,优于所有先前的最先进方法,包括基于GAN和序列的方法。
  • 在MMI数据集上,FMPN达到82.74%的准确率,相较于基于图像的方法提升超过9.51%,相较于基于序列的方法提升7.62%。
  • 在大规模真实世界AffectNet数据集上,FMPN达到61.52%的准确率,证明了从受控数据集(如CK+)中学到的运动先验具有良好的可迁移性。
  • 消融实验表明,若移除引导损失($l_G$),CK+上的性能将从98.06%下降至91.82%,证明了先验引导的掩码学习的重要性。
  • 在CK+和MMI上的混淆矩阵显示出一致的模式:喜悦被最准确地识别,而愤怒与厌恶及悲伤的混淆程度最高。
  • 结果表明,面部运动先验具有良好的泛化能力,即使在具有挑战性的真实世界场景中也表现有效,暗示肌肉运动模式在不同数据集中具有共性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。