Skip to main content
QUICK REVIEW

[论文解读] Transfer Learning for Action Unit Recognition

Yen Khye Lim, Zukang Liao|arXiv (Cornell University)|Jul 19, 2018
Face and Expression Recognition参考文献 9被引用 5
一句话总结

本文提出了一种基于迁移学习的集成框架,用于使用预训练的CNN(如VGG-Face和ResNet-152)进行面部动作单元(AU)识别。通过结合特征提取、微调、基于区域的输入以及分类器集成(特别是SVM和LSTM),该方法在DISFA数据集上实现了74.1%的SOTA F1分数,显著优于单一模型。

ABSTRACT

This paper presents a classifier ensemble for Facial Expression Recognition (FER) based on models derived from transfer learning. The main experimentation work is conducted for facial action unit detection using feature extraction and fine-tuning convolutional neural networks (CNNs). Several classifiers for extracted CNN codes such as Linear Discriminant Analysis (LDA), Support Vector Machines (SVMs) and Long Short-Term Memory (LSTM) are compared and evaluated. Multi-model ensembles are also used to further improve the performance. We have found that VGG-Face and ResNet are the relatively optimal pre-trained models for action unit recognition using feature extraction and the ensemble of VGG-Net variants and ResNet achieves the best result.

研究动机与目标

  • 通过使用预训练的深度CNN进行迁移学习,提升面部动作单元识别的准确性。
  • 评估不同CNN架构(如VGG-Face、ResNet)在DISFA数据集上进行AU检测的有效性。
  • 研究微调、基于区域的特征提取以及分类器集成对AU识别性能的影响。
  • 比较LDA、SVM和LSTM分类器在CNN嵌入特征上应用时的性能表现。
  • 确定最大化AU识别F1分数的最优模型与技术组合。

提出的方法

  • 利用预训练的CNN(如VGG-Face、ResNet-152)从DISFA数据集的面部图像中提取特征。
  • 通过在AU识别任务上微调VGG-Fast和ResNet-152的最后全连接层,应用迁移学习。
  • 通过在输入CNN之前对对应特定AU的面部区域进行分割,实现基于区域的方法。
  • 在提取的CNN特征上训练多种分类器(LDA、SVM和LSTM),以比较其在AU识别中的性能。
  • 通过在来自特征提取和微调网络的多个分类器之间采用多数投票法,构建集成模型。
  • 通过用性能更高的微调模型替换低性能模型(如AlexNet)来优化集成模型,从而提升整体性能。

实验结果

研究问题

  • RQ1哪种预训练CNN架构在使用特征提取时能为动作单元识别提供最佳性能?
  • RQ2与静态特征提取相比,微调预训练CNN如何提升AU识别的准确性?
  • RQ3使用特定AU的面部区域在多大程度上能增强识别性能?
  • RQ4当应用于CNN嵌入特征时,不同分类器(LDA、SVM、LSTM)在AU检测中的表现如何?
  • RQ5由特征提取和微调网络中的多样化模型组成的集成模型,是否能实现优于单一模型的性能?

主要发现

  • 在基于特征提取的AU识别中,VGG-Face和ResNet-152分别实现了最高的F1分数(分别为60.7%和58.7%),当使用SVM作为分类器时。
  • 对VGG-Fast进行微调可使SVM在fc6层特征上的F1分数从56.2%提升至62.9%,表明任务特定适应具有显著优势。
  • 与全局图像输入相比,基于区域的方法使F1分数提高了2.9%,其中微调后的VGG-Fast在AU特定区域上实现了68.5%的F1分数。
  • 仅基于特征提取的模型集成实现了68.8%的F1分数,优于任何单一模型。
  • 结合特征提取与微调模型的混合集成将F1分数提升至71.1%,显示出模型多样性的价值。
  • 最优集成模型通过整合在分割面部区域上训练的模型,实现了74.1%的SOTA F1分数,较最佳单个模型(微调后的VGG-Fast)提升了5.6%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。