[论文解读] PAtt-Lite: Lightweight Patch and Attention MobileNet for Challenging Facial Expression Recognition
PAtt-Lite 提出了一种基于 MobileNetV1 的轻量化模型,包含一个补丁提取模块和自注意力分类器,以在挑战性条件下提升面部表情识别(FER)性能。通过聚焦局部面部特征并利用注意力机制增强特征表示,该模型在 CK+、RAF-DB、FER2013、FERPlus 及其挑战性子集上实现了最先进(SOTA)的准确率,参数量仅为 1.10M。
Facial Expression Recognition (FER) is a machine learning problem that deals with recognizing human facial expressions. While existing work has achieved performance improvements in recent years, FER in the wild and under challenging conditions remains a challenge. In this paper, a lightweight patch and attention network based on MobileNetV1, referred to as PAtt-Lite, is proposed to improve FER performance under challenging conditions. A truncated ImageNet-pre-trained MobileNetV1 is utilized as the backbone feature extractor of the proposed method. In place of the truncated layers is a patch extraction block that is proposed for extracting significant local facial features to enhance the representation from MobileNetV1, especially under challenging conditions. An attention classifier is also proposed to improve the learning of these patched feature maps from the extremely lightweight feature extractor. The experimental results on public benchmark databases proved the effectiveness of the proposed method. PAtt-Lite achieved state-of-the-art results on CK+, RAF-DB, FER2013, FERPlus, and the challenging conditions subsets for RAF-DB and FERPlus.
研究动机与目标
- 解决在真实世界、野外环境下(如遮挡和姿态变化)实现高精度面部表情识别(FER)的挑战。
- 克服类别不平衡问题,特别是针对现有数据集中代表性不足的罕见负面表情(如轻蔑和恐惧)。
- 开发一种轻量级 FER 模型,在不依赖大型资源密集型神经网络的前提下保持高准确率。
- 通过引入局部补丁提取和基于注意力的分类机制,改进 MobileNetV1 的特征表示能力。
提出的方法
- 使用在 ImageNet 上预训练并截断的 MobileNetV1 作为主干特征提取器,以减小模型尺寸和计算成本。
- 设计一个轻量级补丁提取模块,将 MobileNetV1 的特征图划分为四个非重叠的空间区域,以突出显著的局部面部特征。
- 在全局平均池化之后插入一个自注意力分类器,利用全连接层之间的点积注意力机制,更好地建模特征图中的长程依赖关系。
- 将补丁提取模块与注意力分类器整合为单一轻量化架构,以增强在挑战性条件下的表征学习能力。
- 在公开的 FER 基准数据集(包括 CK+、RAF-DB、FER2013 和 FERPlus)上进行端到端训练,并在挑战性条件子集上进行微调。
- 在标准基准和挑战性子集(遮挡、姿态 >30°、姿态 >45°)上评估方法性能,以衡量其鲁棒性。
实验结果
研究问题
- RQ1轻量级补丁提取机制是否能有效提升在遮挡和极端姿态等挑战性条件下的 FER 性能?
- RQ2在轻量级 MobileNetV1 主干网络中集成自注意力分类器,是否能增强特征表示能力并提高 FER 的分类准确率?
- RQ3在标准和挑战性 FER 基准测试中,PAtt-Lite 在准确率和参数效率方面与最先进方法相比表现如何?
- RQ4在存在类别不平衡的情况下,该方法是否能有效缓解轻量级表达类别(如轻蔑和恐惧)的性能下降问题?
主要发现
- PAtt-Lite 在 CK+ 数据集上实现了最先进准确率,top-1 准确率达到 98.12%,超越了先前方法。
- 在 RAF-DB 上,PAtt-Lite 在遮挡子集上达到 92.23% 准确率,姿态 >30° 子集上为 95.35%,姿态 >45° 子集上为 94.44%,相比之前最先进方法(Facial Chirality)提升超过 3%,且参数量显著更少。
- 在 FERPlus 上,PAtt-Lite 在遮挡子集上达到 93.22%,姿态 >30° 子集上为 96.07%,姿态 >45° 子集上为 92.58%,是首个在所有三个挑战性子集上均突破 90% 准确率的方法。
- 在 FERPlus 上,PAtt-Lite 整体准确率相比 RAN [5] 提升 6.39%,同时参数量仅为 1.10M(而 RAN 为 11.2M),减少约 10 倍。
- 在 RAF-DB 和 FER2013 上,PAtt-Lite 在除最不平衡类别(轻蔑、厌恶、恐惧)外的所有类别上均达到超过 95% 的准确率,性能下降预期由类别不平衡导致。
- 消融实验证实,补丁提取模块和注意力分类器均对性能提升有显著贡献,尤其在挑战性条件下更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。