[논문 리뷰] FER-YOLO-Mamba: Facial Expression Detection and Classification Based on Selective State Space
이 논문은 Mamba의 선택적 상태 공간 메커니즘을 통합한 새로운 YOLO 기반 모델인 FER-YOLO-Mamba를 제안한다. 이 모델은 국소적 특징 추출을 위한 컨볼루션과 Mamba의 장거리 의존성 모델링을 결합하여 RAF-DB 및 SFEW 데이터셋에서 최신 기술 수준의 성능을 달성하며, mAP 및 F1 점수 향상을 이룬다.
Facial Expression Recognition (FER) plays a pivotal role in understanding human emotional cues. However, traditional FER methods based on visual information have some limitations, such as preprocessing, feature extraction, and multi-stage classification procedures. These not only increase computational complexity but also require a significant amount of computing resources. Considering Convolutional Neural Network (CNN)-based FER schemes frequently prove inadequate in identifying the deep, long-distance dependencies embedded within facial expression images, and the Transformer's inherent quadratic computational complexity, this paper presents the FER-YOLO-Mamba model, which integrates the principles of Mamba and YOLO technologies to facilitate efficient coordination in facial expression image recognition and localization. Within the FER-YOLO-Mamba model, we further devise a FER-YOLO-VSS dual-branch module, which combines the inherent strengths of convolutional layers in local feature extraction with the exceptional capability of State Space Models (SSMs) in revealing long-distance dependencies. To the best of our knowledge, this is the first Vision Mamba model designed for facial expression detection and classification. To evaluate the performance of the proposed FER-YOLO-Mamba model, we conducted experiments on two benchmark datasets, RAF-DB and SFEW. The experimental results indicate that the FER-YOLO-Mamba model achieved better results compared to other models. The code is available from https://github.com/SwjtuMa/FER-YOLO-Mamba.
연구 동기 및 목표
- 수동 전처리, 특징 추출, 분류를 포함하는 다단계 파ip라인에 의존하는 전통적 FER 방법의 한계를 해결한다.
- Transformer의 제곱형 계산 복잡도와 CNN이 얼굴 표정 데이터의 장거리 의존성을 모델링할 수 없는 문제를 극복한다.
- 선형 복잡도와 선택적 상태 공간 메커니즘을 갖춘 Mamba 아키텍처를 YOLO 기반 객체 검출 프레임워크에 통합하여 종단 간 얼굴 표정 인식을 실현한다.
- 공간 주의 메커니즘을 통해 국소적 컨볼루션 특징과 전역적 맥락 표현을 융합하는 이중 분지형 FER-YOLO-VSS 모듈을 개발한다.
- RAF-DB 및 SFEW 기준 데이터셋에서 뛰어난 성능을 입증하여, 모델의 강인성과 일반화 능력을 실생활 시나리오에서 검증한다.
제안 방법
- YOLO 기반 객체 검출 프레임워크에 시각 Mamba 백본을 통합하여 얼굴 표정 검출 및 분류를 동시에 수행하는 FER-YOLO-Mamba를 제안한다.
- 국소적 특징 추출을 위한 표준 컨볼루션 레이어와 장거리 의존성 모델링을 위한 선택적 상태 공간 모델(SSM)을 결합한 FER-YOLO-VSS 이중 분지 모듈을 설계한다.
- 전역 평균 풀링, 다층 퍼셉트론(MLP), 요소별 곱셈을 활용한 공간 주의 메커니즘을 통합하여 특징 맵 내에서 구분력 있는 영역을 강조한다.
- Mamba 아키텍처의 효율적인 상태 공간 전이 동역학을 활용해 공간 토큰 간의 순차적 의존성을 선형 복잡도로 모델링하여 자기주의의 제곱형 비용을 피한다.
- 분류를 위한 교차 엔트로피 손실과 바운딩 박스 회귀를 위한 표준 YOLO 손실을 사용하여 종단 간 최적화를 가능하게 하며, 검출 및 인식을 동시에 학습한다.
- 학습 중에 데이터 증강 및 정규화 기법을 적용하여 다양한 조명, 자세, 가림 조건 하에서도 강인성을 향상시킨다.
실험 결과
연구 질문
- RQ1시각 Mamba 기반 아키텍처는 선형 계산 복잡도를 유지하면서도 얼굴 표정 이미지의 장거리 의존성을 효과적으로 모델링할 수 있는가?
- RQ2이중 분지형 FER-YOLO-VSS 모듈의 통합은 FER 작업에서 단독으로 사용되는 CNN 또는 Transformer 기반 모델 대비 특징 표현을 얼마나 향상시키는가?
- RQ3FER-YOLO-Mamba 모델은 RAF-DB 및 SFEW 데이터셋에서 mAP, F1 점수, 추론 효율성 측면에서 기존 최신 기술 수준의 모델을 얼마나 뛰어나게 하는가?
- RQ4모델은 가림, 어두운 조명, 다양한 머리 자세와 같은 도전적인 조건에서도 강인한 성능을 유지하는가?
- RQ5공간 주의 메커니즘이 눈, 입과 같은 주요 얼굴 영역을 효과적으로 강조하여 분류 정확도를 향상시키는가?
주요 결과
- FER-YOLO-Mamba는 RAF-DB 데이터셋에서 mAP 80.31%를 기록하여 YOLOvX의 78.40%를 초월했다.
- SFEW 데이터셋에서 FER-YOLO-Mamba는 mAP 66.7%를 달성했으며, YOLOvX의 64.02%에 비해 더 나은 일반화 능력을 입증했다.
- RAF-DB에서는 평균 F1 점수 0.75, SFEW에서는 0.60을 기록하여 클래스 불균형에도 불구하고 모든 감정 클래스에서 뛰어난 성능을 보였다.
- RAF-DB 및 SFEW에서의 시각화 결과는 모델이 얼굴 영역을 정확히 국소화하고 핵심 얼굴 기능을 강조하는 히트맵을 생성함으로써 구분력 있는 영역에 효과적으로 주의를 기울였음을 확인했다.
- FER-YOLO-VSS 이중 분지 모듈은 '행복' 및 '놀람'과 같은 클래스에서 정밀도와 재현율 향상을 통해 중요한 영역을 선택적으로 강조함으로써 특징 표현을 향상시켰다.
- 배경 간섭이 있는 복잡한 장면에서도 높은 신뢰도 점수와 정확한 바운딩 박스 예측을 유지하여 강인성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.