Skip to main content
QUICK REVIEW

[论文解读] Spatial and Temporal Networks for Facial Expression Recognition in the Wild Videos

Shuyi Mao, Xinqi Fan|arXiv (Cornell University)|Jul 12, 2021
Emotion and Mood Recognition参考文献 16被引用 4
一句话总结

本论文提出一种集成模型,结合ResNet50、CNN-RNN与CNN-Transformer架构,通过空间与时间建模提升在真实场景下的人脸表情识别性能。利用VGGFace2进行预训练可增强对真实场景中变化的鲁棒性,该集成模型在ABAW 2021验证集上的F1-score为0.4133,准确率为0.6216,最终评分为0.4821。

ABSTRACT

The paper describes our proposed methodology for the seven basic expression classification track of Affective Behavior Analysis in-the-wild (ABAW) Competition 2021. In this task, facial expression recognition (FER) methods aim to classify the correct expression category from a diverse background, but there are several challenges. First, to adapt the model to in-the-wild scenarios, we use the knowledge from pre-trained large-scale face recognition data. Second, we propose an ensemble model with a convolution neural network (CNN), a CNN-recurrent neural network (CNN-RNN), and a CNN-Transformer (CNN-Transformer), to incorporate both spatial and temporal information. Our ensemble model achieved F1 as 0.4133, accuracy as 0.6216 and final metric as 0.4821 on the validation set.

研究动机与目标

  • 解决在背景多样、光照多变的真实视频环境中进行人脸表情识别的挑战。
  • 通过利用大规模人脸识别数据集(如VGGFace2)的预训练权重,提升模型泛化能力。
  • 有效捕捉单帧图像中的空间特征以及视频序列中帧间的时间动态。
  • 构建一个鲁棒的集成框架,结合多种架构,以提升在ABAW 2021人脸表情识别基准上的性能。

提出的方法

  • 使用在VGGFace2数据集上预训练的ResNet50模型权重初始化,以提升在非约束环境下的特征提取能力。
  • 构建CNN-RNN架构,其中ResNet50提取每帧的空间特征,两层GRU处理序列以建模时间依赖性。
  • 引入CNN-Transformer模块,用多头自注意力机制替代RNN,更高效地捕捉长程时间关系。
  • 在Transformer中应用正弦位置编码,以保留帧的顺序信息。
  • 通过加权平均方式融合三个模型(ResNet50、CNN-RNN、CNN-Transformer)的预测结果,形成最终的集成输出。
  • 在4张GPU的设置下,使用SGD优化器,采用多阶段学习率调度策略,在10个周期内进行训练;训练时使用9帧序列,采用多对多模式;推理时采用多对一模式。

实验结果

研究问题

  • RQ1在大规模人脸识别数据上进行预训练,如何提升在非约束环境下人脸表情识别的性能?
  • RQ2基于RNN与基于Transformer的时间建模方法,在捕捉人脸表情视频序列动态方面,其差异程度如何?
  • RQ3由多种架构(CNN、CNN-RNN、CNN-Transformer)组成的集成模型,是否能在ABAW 2021人脸表情识别基准上超越单一模型?
  • RQ4空间与时间建模组件的融合,如何影响最终的F1-score与综合评估指标?

主要发现

  • 集成模型在最终评估中取得0.4821的评分,显著优于基线VGG-Face模型(0.36)。
  • 在VGGFace2上预训练ResNet50使F1-score从0.3763提升至0.4124,准确率从0.5713提升至0.6216,证明大规模预训练的显著优势。
  • CNN-RNN与CNN-Transformer组件分别取得0.4126与0.4127的F1-score,表明其在时间建模方面表现优异。
  • 三个模型的完整集成实现了最高的F1-score(0.4133)、准确率(0.6216)与最终评分(0.4821),证实了模型集成的有效性。
  • 预训练的ResNet50在AU检测任务中也表现出色,最终评分为0.6734,表明所学特征具有良好的迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。