Skip to main content
QUICK REVIEW

[论文解读] FER-YOLO-Mamba: Facial Expression Detection and Classification Based on Selective State Space

Hui Ma, Sen Lei|ArXiv.org|May 3, 2024
Face and Expression Recognition被引用 4
一句话总结

本文提出 FER-YOLO-Mamba,一种基于 YOLO 的新型模型,通过整合 Mamba 的选择性状态空间机制,以提升面部表情检测与分类性能。通过结合卷积神经网络的局部特征提取与 Mamba 的长程依赖建模能力,该模型在 RAF-DB 和 SFEW 数据集上实现了最先进性能,mAP 和 F1 分数均得到提升。

ABSTRACT

Facial Expression Recognition (FER) plays a pivotal role in understanding human emotional cues. However, traditional FER methods based on visual information have some limitations, such as preprocessing, feature extraction, and multi-stage classification procedures. These not only increase computational complexity but also require a significant amount of computing resources. Considering Convolutional Neural Network (CNN)-based FER schemes frequently prove inadequate in identifying the deep, long-distance dependencies embedded within facial expression images, and the Transformer's inherent quadratic computational complexity, this paper presents the FER-YOLO-Mamba model, which integrates the principles of Mamba and YOLO technologies to facilitate efficient coordination in facial expression image recognition and localization. Within the FER-YOLO-Mamba model, we further devise a FER-YOLO-VSS dual-branch module, which combines the inherent strengths of convolutional layers in local feature extraction with the exceptional capability of State Space Models (SSMs) in revealing long-distance dependencies. To the best of our knowledge, this is the first Vision Mamba model designed for facial expression detection and classification. To evaluate the performance of the proposed FER-YOLO-Mamba model, we conducted experiments on two benchmark datasets, RAF-DB and SFEW. The experimental results indicate that the FER-YOLO-Mamba model achieved better results compared to other models. The code is available from https://github.com/SwjtuMa/FER-YOLO-Mamba.

研究动机与目标

  • 解决传统 FER 方法依赖多阶段流水线(包括手动预处理、特征提取与分类)的局限性。
  • 克服 Transformer 的二次方计算复杂度以及 CNN 无法建模面部表情数据中长程依赖关系的缺陷。
  • 将具备线性复杂度与选择性状态空间机制的 Mamba 架构整合至基于 YOLO 的目标检测框架中,实现端到端的面部表情识别。
  • 设计一种双分支 FER-YOLO-VSS 模块,通过空间注意力机制融合局部卷积特征与全局上下文表征。
  • 在基准数据集 RAF-DB 与 SFEW 上验证模型在真实场景下的鲁棒性与泛化能力,展现卓越性能。

提出的方法

  • 提出 FER-YOLO-Mamba,一种基于 YOLO 的目标检测框架,采用视觉 Mamba 主干网络,实现面部表情的联合检测与分类。
  • 设计 FER-YOLO-VSS 双分支模块,结合标准卷积层用于局部特征提取,以及选择性状态空间模型(SSM)用于长程依赖建模。
  • 通过全局平均池化、多层感知机(MLPs)与逐元素乘法操作,引入空间注意力机制,以突出特征图中的判别性区域。
  • 利用 Mamba 架构高效的态空间转换动态,以线性复杂度建模空间标记之间的序列依赖关系,避免自注意力机制的二次方开销。
  • 采用交叉熵损失进行分类,标准 YOLO 损失进行边界框回归,端到端训练模型,实现检测与识别任务的联合优化。
  • 在训练过程中应用数据增强与归一化技术,提升模型在光照、姿态与遮挡条件变化下的鲁棒性。

实验结果

研究问题

  • RQ1基于视觉 Mamba 的架构是否能有效建模面部表情图像中的长程依赖关系,同时保持线性计算复杂度?
  • RQ2与独立的 CNN 或 Transformer 模型相比,双分支 FER-YOLO-VSS 模块在 FER 任务中如何提升特征表征能力?
  • RQ3在 RAF-DB 与 SFEW 数据集上,FER-YOLO-Mamba 模型在 mAP、F1 分数与推理效率方面,相较于现有 SOTA 模型的性能提升程度如何?
  • RQ4在遮挡、光照不足与多变头部姿态等挑战性条件下,该模型是否仍能保持鲁棒性能?
  • RQ5空间注意力机制是否能有效突出显著面部区域(如眼睛、嘴巴),从而提升分类准确率?

主要发现

  • 在 RAF-DB 数据集上,FER-YOLO-Mamba 的 mAP 达到 80.31%,优于 YOLOvX 的 78.40%。
  • 在 SFEW 数据集上,FER-YOLO-Mamba 的 mAP 达到 66.7%,高于 YOLOvX 的 64.02%,表明其在具有挑战性的现实数据中具备更强泛化能力。
  • 在 RAF-DB 上,模型平均 F1 得分为 0.75;在 SFEW 上为 0.60,表明其在各类情绪上均表现稳健,即使存在类别不平衡问题。
  • 在 RAF-DB 与 SFEW 上的可视化结果表明,模型能准确定位面部区域,并生成突出关键面部特征的热力图,证实其对判别区域的有效关注。
  • FER-YOLO-VSS 双分支模块通过选择性增强关键区域,显著提升了特征表征能力,体现在 'Happy' 与 'Surprise' 等类别中精确率与召回率的提升。
  • 在背景干扰复杂的场景中,模型仍保持高置信度得分与准确的边界框预测,展现出优异的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。