QUICK REVIEW
[论文解读] Facial Expression Recognition based on Multi-head Cross Attention Network
Jae-Yeop Jeong, Yeong-Gi Hong|arXiv (Cornell University)|Mar 24, 2022
Emotion and Mood Recognition被引用 8
一句话总结
该论文提出了一种增强的深度聚合网络(DAN),采用多头交叉注意力机制,用于开放环境下的面部表情识别,利用ResNet-50特征和注意力机制,在VA估计和表情分类任务上提升性能。通过数据增强、外部数据集以及软投票集成策略,在ABAW 2022验证集上实现了0.44的平均CCC和0.33的平均F1分数。
ABSTRACT
Facial expression in-the-wild is essential for various interactive computing domains. In this paper, we proposed an extended version of DAN model to address the VA estimation and facial expression challenges introduced in ABAW 2022. Our method produced preliminary results of 0.44 of mean CCC value for the VA estimation task, and 0.33 of the average F1 score for the expression classification task.
研究动机与目标
- 解决在非受控、开放环境视频中进行面部表情识别的挑战。
- 提升在ABAW 2022竞赛中对情感维度(Valence-Arousal,VA)估计和表情分类任务的性能。
- 通过数据增强和外部数据库缓解面部表情数据集中类别不平衡的问题。
- 通过结合空间注意力和通道注意力的多头交叉注意力机制,增强特征表示能力。
- 开发一种集成注意力融合与焦点损失的鲁棒模型架构,以提升分类和回归性能。
提出的方法
- 采用在VGGFace2上预训练的ResNet-50主干网络进行视觉特征提取,并引入亲和力损失以最大化类间距离。
- 集成多头交叉注意力模块,结合空间注意力和通道注意力单元,生成动态注意力图。
- 应用注意力融合网络,协调并优化注意力图,以提升特征表示能力。
- 通过训练多个模型变体并聚合验证阶段的预测结果,采用软投票集成策略。
- 应用数据增强技术,包括颜色抖动、随机裁剪和水平翻转,以减少过拟合。
- 将外部数据集(AffectNet、ExpW、Ai-Hub)与Aff-Wild2进行融合,聚焦于重叠的情绪类别,以缓解类别不平衡问题。
实验结果
研究问题
- RQ1注意力机制在多大程度上能改善开放环境下面部表情识别的特征表示?
- RQ2将多个开放环境数据集组合使用,在多大程度上能缓解表情识别中的类别不平衡问题?
- RQ3多头交叉注意力机制是否能同时提升VA估计和表情分类任务的性能?
- RQ4软投票集成策略在ABAW 2022基准上提升泛化能力的效果如何?
- RQ5在低资源面部表情识别场景下,基于注意力的特征优化能带来多大的性能提升?
主要发现
- 所提方法在官方ABAW 2022验证集上,于VA估计任务中实现了0.44的平均组内相关系数(CCC)。
- 该模型在表情分类任务中获得了0.33的平均F1分数,表明在八个情绪类别上表现中等。
- 整合AffectNet、ExpW和Ai-Hub等外部数据集有助于缓解类别不平衡问题,特别是对低频情绪类别的改善效果显著。
- 采用随机裁剪、水平翻转和颜色抖动等数据增强技术,提升了模型泛化能力并减少了过拟合。
- 结合空间注意力和通道注意力单元的多头交叉注意力机制,增强了特征判别能力并提升了模型鲁棒性。
- 软投票集成方法显著提升了验证集上的稳定性与性能表现,尽管最终结果可能因后续提交而更新。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。