Skip to main content
QUICK REVIEW

[论文解读] A Scalable Approach for Facial Action Unit Classifier Training UsingNoisy Data for Pre-Training

Alberto Fung, Daniel McDuff|arXiv (Cornell University)|Nov 14, 2019
Emotion and Mood Recognition参考文献 47被引用 7
一句话总结

该论文提出了一种可扩展的、开源的方法,通过在162,070张来自多样化受试者的自动标注、噪声较大的面部图像上预训练一个简单的卷积神经网络(CNN),随后在干净数据上微调,以训练面部动作单元(AU)分类器。该方法在DISFA数据集上实现了0.60的SOTA F1分数,优于更复杂的模型架构,证明了使用高多样性受试者的噪声预训练可提升泛化能力和性能。

ABSTRACT

Machine learning systems are being used to automate many types of laborious labeling tasks. Facial actioncoding is an example of such a labeling task that requires copious amounts of time and a beyond average level of human domain expertise. In recent years, the use of end-to-end deep neural networks has led to significant improvements in action unit recognition performance and many network architectures have been proposed. Do the more complex deep neural network(DNN) architectures perform sufficiently well to justify the additional complexity? We show that pre-training on a large diverse set of noisy data can result in even a simple CNN model improving over the current state-of-the-art DNN architectures.The average F1-score achieved with our proposed method on the DISFA dataset is 0.60, compared to a previous state-of-the-art of 0.57. Additionally, we show how the number of subjects and number of images used for pre-training impacts the model performance. The approach that we have outlined is open-source, highly scalable, and not dependent on the model architecture. We release the code and data: https://github.com/facialactionpretrain/facs.

研究动机与目标

  • 通过利用自动化、大规模数据进行预训练,解决人工FACS编码所需高昂成本和专业知识的问题。
  • 探究在标签存在不准确性的噪声自动标注数据上进行预训练,是否能提升AU分类器的性能。
  • 确定预训练数据集的规模和受试者多样性对最终AU识别性能的影响。
  • 发布一个大规模、开源的数据集,包含生物信息元数据,供学术和商业用途。
  • 证明当在大规模噪声数据上进行预训练时,简单的CNN架构可以超越更复杂的SOTA模型。

提出的方法

  • 使用OpenFace 2.0对MS-Celeb-1M数据集中162,070张自动标注的面部图像进行AU标注,对标准卷积神经网络(CNN)进行预训练。
  • 利用Google知识图谱中的生物信息数据,提取预训练集中每个受试者的性别和国籍。
  • 在干净的、人工标注的DISFA数据集上对预训练模型进行微调,以实现AU分类。
  • 系统性地改变预训练集中图像数量和唯一个体数量,以评估其对性能的影响。
  • 采用两阶段流程:先进行噪声预训练,再在高质量数据上进行监督微调。
  • 以开源许可发布预训练数据集、代码和训练好的模型,供重复使用。

实验结果

研究问题

  • RQ1与SOTA复杂模型架构相比,在大规模、多样化的噪声面部图像上进行预训练,是否能提升AU分类器的性能?
  • RQ2预训练集中唯一个体的数量如何影响最终AU识别的准确率?
  • RQ3即使标签存在噪声,增加预训练中的图像总数是否仍能提升性能?
  • RQ4当在大规模噪声数据上进行预训练时,简单CNN是否能超越更复杂的模型?
  • RQ5噪声预训练带来的性能提升是否源于对多样化面部外观的更好泛化能力?

主要发现

  • 所提出的方法在DISFA数据集上实现了0.60的F1分数,超过了此前SOTA的0.57。
  • 性能随着预训练集中图像数量和唯一个体数量的增加而单调提升。
  • 该模型优于用于生成噪声标签的原始OpenFace 2.0检测器,表明其具备有效的噪声泛化能力。
  • 在预训练中增加受试者多样性对性能的正向影响,强于增加同一受试者的图像数量。
  • 该方法与网络架构无关,可应用于任何CNN,展现出广泛的适用性。
  • 发布包含1,995名受试者、性别和国籍元数据的数据集,为未来在多样化和可解释性AU识别研究中提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。