QUICK REVIEW
[论文解读] Emotion Recognition for In-the-wild Videos
Hanyu Liu, Jiabei Zeng|arXiv (Cornell University)|Feb 13, 2020
Emotion and Mood Recognition参考文献 19被引用 7
一句话总结
该论文提出了一种混合深度学习模型,结合101层ResNet、卷积块注意力模块(CBAM)和双向长短期记忆(BLSTM)网络,用于在非约束(野外)视频中进行端到端面部表情识别。该方法在Aff-Wild2验证集上实现了64.3%的准确率和43.4%的最终指标(S),比基线模型高出7.43个百分点。
ABSTRACT
This paper is a brief introduction to our submission to the seven basic expression classification track of Affective Behavior Analysis in-the-wild Competition held in conjunction with the IEEE International Conference on Automatic Face and Gesture Recognition (FG) 2020. Our method combines Deep Residual Network (ResNet) and Bidirectional Long Short-Term Memory Network (BLSTM), achieving 64.3% accuracy and 43.4% final metric on the validation set.
研究动机与目标
- 解决在非约束、真实世界视频数据(野外视频)中识别七种基本面部表情的挑战。
- 通过同时利用空间特征提取和面部动态的时间建模,提升面部表情识别性能。
- 通过注意力机制(特别是CBAM)增强深度网络中的特征表示,以聚焦于相关面部区域和通道。
- 开发一种能够在真实世界视频数据中多样化的光照、姿态和表情变化下保持鲁棒性的模型。
提出的方法
- 在每个残差块之后插入CBAM模块,使用101层ResNet以增强空间和通道注意力。
- 应用CBAM通过学习空间位置和特征通道的注意力权重来优化特征图,从而提升判别能力。
- 通过双向长短期记忆网络(BLSTM)处理提取的帧级特征,以建模连续视频帧之间的长程时间依赖关系。
- 处理包含8帧连续视频片段,必要时使用零填充以保持序列一致性。
- 采用全连接层构成分类头,用于预测七种类别的表情:中性、愤怒、厌恶、恐惧、快乐、悲伤、惊讶。
- 在多数据集预训练设置下,使用交叉熵损失、随机梯度下降(SGD)优化,学习率0.0001,动量0.9进行模型训练。
实验结果
研究问题
- RQ1在非约束视频环境中,结合注意力机制的混合CNN-RNN架构能否提升面部表情识别的准确率?
- RQ2在ResNet中集成CBAM在提升面部表情识别中的特征表示方面有多有效?
- RQ3与单向或非循环方法相比,双向LSTM对时间序列的建模在多大程度上提升了识别性能?
- RQ4在Aff-Wild2数据集上,该方法与基线模型相比,在准确率和F1分数方面表现如何?
主要发现
- 所提出的ResNet+CBAM+BLSTM模型在Aff-Wild2数据集验证集上实现了64.3%的准确率。
- 该模型获得了43.4%的最终指标(S),比竞赛公告中报告的36%基线高出7.43个百分点。
- 在ResNet-101主干网络中引入CBAM后,F1分数从0.281(仅ResNet+BLSTM)提升至0.333,表明类别间平衡性得到改善。
- 模型在野外视频数据中表现出对光照、姿态和表情变化的鲁棒性,各类表情的性能均有提升。
- 最佳模型是基于验证集表现从检查点中选取的,表明超参数和训练调度策略得到了有效调优。
- 在多个内部数据集(AffectNet、RAF-DB以及自收集的30万张图像数据集)上进行预训练,有助于提升泛化能力和最终性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。