Skip to main content
QUICK REVIEW

[论文解读] Affect Expression Behaviour Analysis in the Wild using Spatio-Channel Attention and Complementary Context Information

Darshan Gera, S. Balasubramanian|arXiv (Cornell University)|Sep 29, 2020
Emotion and Mood Recognition参考文献 22被引用 7
一句话总结

本文提出了一种用于野外面部表情识别的双分支注意力框架,结合了空间-通道注意力(SCAN)以实现局部和全局特征注意力,以及利用高效通道注意力(ECA)的互补上下文信息(CCI)分支。该方法在Aff-Wild2验证集上取得了0.465的整体得分,优于ResNet-50基线模型,并在无需依赖关键点或音频的情况下,对遮挡和姿态变化表现出鲁棒性。

ABSTRACT

Facial expression recognition(FER) in the wild is crucial for building reliable human-computer interactive systems. However, current FER systems fail to perform well under various natural and un-controlled conditions. This report presents attention based framework used in our submission to expression recognition track of the Affective Behaviour Analysis in-the-wild (ABAW) 2020 competition. Spatial-channel attention net(SCAN) is used to extract local and global attentive features without seeking any information from landmark detectors. SCAN is complemented by a complementary context information(CCI) branch which uses efficient channel attention(ECA) to enhance the relevance of features. The performance of the model is validated on challenging Aff-Wild2 dataset for categorical expression classification.

研究动机与目标

  • 解决在姿态变化、遮挡和光照变化等非受控真实场景下的面部表情识别挑战。
  • 开发一种深度学习框架,通过不依赖面部关键点检测或音频模态来增强特征判别能力。
  • 提升在高度不平衡且复杂的Aff-Wild2数据集上进行分类表情识别的性能。
  • 通过整合空间-通道注意力与互补上下文学习,提升模型在野外环境下的鲁棒性与泛化能力。

提出的方法

  • 采用空间-通道注意力网络(SCAN),通过可学习的非线性变换在每个通道和空间位置计算注意力权重:$ W = \sigma(\text{BN}(\text{PReLU}(\text{Conv}(I)))) $,随后与输入特征图$ I $进行逐元素相乘,生成注意力输出$ O = I \odot W $。
  • 以双路径方式使用SCAN:分别处理来自特征图的25个非重叠局部块和完整特征图以获取全局上下文,每条路径通过全局平均池化和最大池化生成512维向量。
  • 实施互补上下文信息(CCI)分支,从预训练ResNet-50的中间层提取特征,并应用ECA实现通道注意力,以突出具有判别性的通道。
  • 将ECA处理后的特征图划分为4个非重叠块,对每个块应用全局平均池化,生成4个上下文向量,并将其拼接形成最终的CCI输出。
  • 使用224×224 RGB图像作为输入,端到端训练模型,其中SCAN和CCI分支的输入为ResNet-50 Conv_3x块的特征图。
  • 采用迁移学习策略,使用VGGFace2、AffectNet、ExpW和RAF-DB进行预训练,并通过过采样处理训练集中的类别不平衡问题。

实验结果

研究问题

  • RQ1结合空间-通道注意力与互补上下文学习的双分支注意力机制,是否能提升在非受控真实场景下的面部表情识别性能?
  • RQ2所提出的方法在保持Aff-Wild2数据集高精度的同时,对人脸关键点或音频线索的依赖程度在多大程度上降低?
  • RQ3与仅使用SCAN相比,CCI分支中引入ECA如何增强特征判别能力?
  • RQ4在大规模人脸识别数据集上进行预训练以及数据量的多少,对模型在Aff-Wild2上的泛化能力与性能有何影响?
  • RQ5在遮挡和极端姿态变化下,通过Grad-CAM可视化,模型对显著面部区域的关注程度如何?

主要发现

  • 所提方法在Aff-Wild2验证集上取得了0.465的整体得分,显著优于ResNet-50基线模型(0.422),展现出更优的鲁棒性与准确性。
  • 仅使用Aff-Wild2中的50,000个样本,并结合AffectNet与ExpW数据,模型性能与使用全部可用数据训练的模型相当,表明其具有强大的数据效率。
  • 在VGGFace2上进行预训练的模型表现最佳(F1: 0.37,准确率: 0.649,整体得分: 0.465),优于仅在AffectNet、RAF-DB或ExpW上预训练的模型。
  • 模型在验证集上达到0.37的F1得分与0.649的准确率,相较于ResNet-50基线模型,F1得分相对提升了10.4%。
  • Grad-CAM可视化结果表明,即使在遮挡和极端姿态变化下,模型仍能有效聚焦于眼睛、嘴巴和鼻子等关键面部区域。
  • 消融实验表明,加入ECA注意力的CCI分支显著优于仅使用SCAN的模型,且预训练对实现高性能至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。