Skip to main content
QUICK REVIEW

[论文解读] A Fine-Grained Facial Expression Database for End-to-End Multi-Pose Facial Expression Recognition

Wenxuan Wang, Qiang Sun|arXiv (Cornell University)|Jul 25, 2019
Emotion and Mood Recognition参考文献 31被引用 11
一句话总结

本文提出了F²ED,一个包含200k+张图像的大规模面部表情数据库,涵盖54种细粒度情绪和4种姿态,同时提出了一种基于FaPE-GAN的数据增强框架,以提升端到端面部表情识别性能。该方法在四个新型学习任务——监督学习、表达不平衡、姿态不平衡和零样本主体ID——中均达到最先进性能,证明了GAN增强训练在复杂数据分布下显著提升了模型泛化能力。

ABSTRACT

The recent research of facial expression recognition has made a lot of progress due to the development of deep learning technologies, but some typical challenging problems such as the variety of rich facial expressions and poses are still not resolved. To solve these problems, we develop a new Facial Expression Recognition (FER) framework by involving the facial poses into our image synthesizing and classification process. There are two major novelties in this work. First, we create a new facial expression dataset of more than 200k images with 119 persons, 4 poses and 54 expressions. To our knowledge this is the first dataset to label faces with subtle emotion changes for expression recognition purpose. It is also the first dataset that is large enough to validate the FER task on unbalanced poses, expressions, and zero-shot subject IDs. Second, we propose a facial pose generative adversarial network (FaPE-GAN) to synthesize new facial expression images to augment the data set for training purpose, and then learn a LightCNN based Fa-Net model for expression classification. Finally, we advocate four novel learning tasks on this dataset. The experimental results well validate the effectiveness of the proposed approach.

研究动机与目标

  • 为解决缺乏大规模、高质量、具有细粒度情绪差异和多样化姿态的面部表情数据集的问题。
  • 研究表达分布不平衡、姿态分布不平衡以及零样本主体ID对面部表情识别性能的影响。
  • 开发一种鲁棒的端到端深度学习框架,能够在真实面部表情识别应用中应对复杂的数据分布偏移。
  • 验证基于GAN的数据增强在数据稀缺和不平衡条件下提升模型性能的有效性。

提出的方法

  • 构建了F²ED,一个包含119名受试者提供的200k+张图像的新数据集,标注了54种细粒度表情和4种面部姿态(正面、左半边、右半边、鸟瞰视角)。
  • 提出FaPE-GAN,一种面部姿态生成对抗网络,通过条件化姿态和表情标签生成多样化的面部表情图像。
  • 设计了一个基于LightCNN的分类网络(Fa-Net),在增强后的F²ED数据集上端到端训练,用于表情识别。
  • 实施了四种新型学习任务:标准监督学习(ER-SS)、表达不平衡(ER-UE)、姿态不平衡(ER-UP)和零样本主体ID(ER-ZID)。
  • 通过在FER2013和JAFFE数据集上微调预训练的Fa-Net,实现迁移学习,以评估模型的泛化能力。
  • 采用FaPE-GAN进行数据增强,以提升模型鲁棒性,特别是在低资源和数据不平衡学习场景下。

实验结果

研究问题

  • RQ1表达和姿态之间的数据不平衡如何影响面部表情识别模型的性能?
  • RQ2基于GAN的数据增强是否能有效提升在低资源和不平衡学习场景下的模型泛化能力?
  • RQ3在大规模细粒度数据集上训练的模型,能在多大程度上泛化到训练期间未见过的零样本主体ID?
  • RQ4将姿态作为解耦属性引入,如何提升在不同视角下表情识别的鲁棒性?

主要发现

  • Fa-Net模型在标准监督任务(ER-SS)上达到73.6%的准确率,证明了F²ED数据集的质量及其在训练中的适用性。
  • 基于FaPE-GAN的数据增强使ER-SS任务的准确率提升了0.9%,证实其在FER数据增强中的有效性。
  • 在表达不平衡任务(ER-UE)中,数据增强使准确率从30.8%提升至34.3%,提升3.5%,高于平衡设置下的增益。
  • 在姿态不平衡任务(ER-UP)中,数据增强使准确率从36.3%提升至39.9%,提升3.6%,表明其在姿态不平衡场景下依然有效。
  • 在最具挑战性的零样本ID任务(ER-ZID)中,模型准确率达到7.1%(随机猜测为1.9%),FaPE-GAN带来0.4%的提升,证明其在零样本泛化中的实用性。
  • 在FER2013和JAFFE数据集上微调预训练的Fa-Net取得了优异性能,证实了基于F²ED学习的表征具有良好的泛化性和可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。