[论文解读] Learning Vision Transformer with Squeeze and Excitation for Facial Expression Recognition
本工作将 Squeeze and Excitation 块集成到 Vision Transformer 用于面部表情识别,并在 FER-2013 预训练的基础上,在 CK+ 和 SFEW 上实现单模型的最先进结果,在 JAFFE 和 RAF-DB 上具有竞争力。
As various databases of facial expressions have been made accessible over the last few decades, the Facial Expression Recognition (FER) task has gotten a lot of interest. The multiple sources of the available databases raised several challenges for facial recognition task. These challenges are usually addressed by Convolution Neural Network (CNN) architectures. Different from CNN models, a Transformer model based on attention mechanism has been presented recently to address vision tasks. One of the major issue with Transformers is the need of a large data for training, while most FER databases are limited compared to other vision applications. Therefore, we propose in this paper to learn a vision Transformer jointly with a Squeeze and Excitation (SE) block for FER task. The proposed method is evaluated on different publicly available FER databases including CK+, JAFFE,RAF-DB and SFEW. Experiments demonstrate that our model outperforms state-of-the-art methods on CK+ and SFEW and achieves competitive results on JAFFE and RAF-DB.
研究动机与目标
- 通过使用轻量级 SE 块增强 Vision Transformer (ViT) 来解决数据有限的数据集下的 FER 问题。
- 在 FER 数据库(CK+、JAFFE、RAF-DB、SFEW)上微调 ViT-B16-224 并评估与最先进方法的性能。
- 分析 SE 如何影响 ViT 的注意力和鲁棒性,包括注意力可视化和跨数据库评估。
- 评估跨数据库泛化能力(例如 CK+ 的跨数据库评估),以评估所提模型的可迁移性。
提出的方法
- 使用在 JFT-300M 上预训练并在 ImageNet-1K 上微调的 ViT-B16-224 作为 FER 任务的基础模型。
- 在 ViT 分类 token 顶部加入一个 Squeeze and Excitation (SE) 块,通过两个全连接层和一个 sigmoid 门来重新校准通道响应(Excitation);与 cls token 进行逐元素相乘。
- 结合数据增广(随机水平翻转、随机灰度、调整亮度/对比度/饱和度)、Cutout 和 Mixup 正则化,以及 AdamW 优化器(lr = 1.6e-4,批量大小 16)。
- 评估四个数据库(CK+、JAFFE、RAF-DB、SFEW)并进行消融研究,比较 ViT、ViT+SE,有无 FER-2013 预训练。
- 使用 t-SNE 和注意力图(Grad-CAM、Score-CAM、Eigen-CAM)对学习到的表示进行可视化,以分析局部与全局注意力以及 SE 的影响。
实验结果
研究问题
- RQ1ViT 加 SE 块是否能够克服 FER 数据稀缺并在受控实验与野外 FER 数据集上都取得强性能?
- RQ2SE 块对 ViT 的注意力和学习到的 FER 表示有哪些影响?
- RQ3在 FER-2013 预训练是否与 SE 产生协同作用,提升在较小或变化较大的数据集上的 FER 性能?
- RQ4所提模型在不同 FER 数据库上的泛化能力如何(跨数据库评估)?
主要发现
- ViT+SE 在 CK+ 上以 10 折交叉验证达到 99.80% 的准确率,超越了现有方法。
- 在 JAFFE 上,ViT+SE 达到 92.92% 的准确率(10 折交叉验证)。
- 在 RAF-DB 上,ViT+SE 达到 87.22% 的准确率,与最先进的单模型结果相竞争。
- 在 SFEW 上,ViT+SE 达到 54.29% 的准确率(单模型),在其他地方报道了更高的基于集成的结果。
- FER-2013 预训练加 SE 在野外数据集(RAF-DB、SFEW)上带来显著提升,并普遍提升鲁棒性和可分离性(如在 t-SNE 和注意力图中所示)。
- 跨数据库 CK+ 评估显示 ViT+SE 比 ResNet50 泛化更好,SE 提供从 CK+ 到其他数据集的最佳跨数据库迁移;然而,总体泛化仍然适中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。