Skip to main content
QUICK REVIEW

[논문 리뷰] PAtt-Lite: Lightweight Patch and Attention MobileNet for Challenging Facial Expression Recognition

Jia Le Ngwe, Kian Ming Lim|arXiv (Cornell University)|2023. 06. 16.
Emotion and Mood Recognition참고 문헌 49인용 수 4
한 줄 요약

PAtt-Lite는 경량 MobileNetV1 기반 모델로, 패치 추출 블록과 자기주의 분류기를 통해 어려운 조건에서의 얼굴 표정 인식(Facial Expression Recognition, FER)을 향상시킨다. 국소적 얼굴 특징에 초점을 맞추고 주의 메커니즘을 통해 특징 표현을 강화함으로써, CK+, RAF-DB, FER2013, FERPlus 및 그 어려운 서브셋에서 최신 기술 수준의 정확도를 달성하였으며, 파rameter 수가 1.10M에 불과한 것으로 이전 방법들을 능가한다.

ABSTRACT

Facial Expression Recognition (FER) is a machine learning problem that deals with recognizing human facial expressions. While existing work has achieved performance improvements in recent years, FER in the wild and under challenging conditions remains a challenge. In this paper, a lightweight patch and attention network based on MobileNetV1, referred to as PAtt-Lite, is proposed to improve FER performance under challenging conditions. A truncated ImageNet-pre-trained MobileNetV1 is utilized as the backbone feature extractor of the proposed method. In place of the truncated layers is a patch extraction block that is proposed for extracting significant local facial features to enhance the representation from MobileNetV1, especially under challenging conditions. An attention classifier is also proposed to improve the learning of these patched feature maps from the extremely lightweight feature extractor. The experimental results on public benchmark databases proved the effectiveness of the proposed method. PAtt-Lite achieved state-of-the-art results on CK+, RAF-DB, FER2013, FERPlus, and the challenging conditions subsets for RAF-DB and FERPlus.

연구 동기 및 목표

  • 외부 환경에서의 정확한 얼굴 표정 인식(Facial Expression Recognition, FER)에 도전하는 조건, 예를 들어 가림 및 자세 변화와 같은 현실적이고 자연스러운 조건을 해결한다.
  • 기존 데이터셋에서 희귀한 부정적 표정(예: 경멸, 공포)이 부족하여 나타나는 클래스 불균형 문제를 해결한다.
  • 대규모 자원을 요구하는 신경망에 의존하지 않고도 높은 정확도를 유지할 수 있는 경량 FER 모델을 개발한다.
  • 국소적 패치 추출과 주의 기반 분류를 도입하여 MobileNetV1의 특징 표현을 향상시킨다.

제안 방법

  • 모델 크기와 계산 비용을 줄이기 위해, ImageNet으로 미리 훈련된 MobileNetV1의 일부를 잘라내어 백본 특징 추출기로 사용한다.
  • 경량 패치 추출 블록은 MobileNetV1의 특징 맵을 겹치지 않는 네 개의 공간 영역으로 나누어 중요한 국소적 얼굴 특징을 강조한다.
  • 전역 평균 풀링 이후에 자기주의 분류기가 삽입되며, 완전 연결 층 간의 내적 곱 주의 메커니즘을 사용하여 특징 맵 내 장거리 의존성을 더 잘 모델링한다.
  • 패치 추출 블록과 주의 분류기를 하나의 경량 아키텍처에 통합하여 어려운 조건에서 표현 학습을 향상시킨다.
  • 공개된 FER 벤치마크인 CK+, RAF-DB, FER2013, FERPlus에서 엔드 투 엔드로 훈련하고, 어려운 조건 서브셋에서의 미세 조정을 수행한다.
  • 표준 벤치마크와 어려운 서브셋(가림, 자세 >30°, 자세 >45°)에서 평가하여 모델의 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1가림 및 극단적인 자세 변화와 같은 어려운 조건에서 경량 패치 추출 메커니즘이 FER 성능을 향상시킬 수 있는가?
  • RQ2경량 MobileNetV1 백본에 자기주의 분류기를 통합함으로써 특징 표현과 분류 정확도가 향상되는가?
  • RQ3표준 및 어려운 FER 벤치마크에서 정확도와 파rameter 효율성 측면에서 PAtt-Lite는 최신 기술 수준의 방법들과 비교해 어떻게 성능을 내는가?
  • RQ4제안된 방법은 클래스 불균형으로 인해 성능 저하가 예상되는 저자원 표현 클래스(예: 경멸, 혐오, 공포)에 대해 효과적으로 성능 저하를 완화할 수 있는가?

주요 결과

  • PAtt-Lite는 CK+ 데이터셋에서 98.12%의 상위-1 정확도로 최신 기술 수준의 정확도를 달성하여 이전 방법들을 능가하였다.
  • RAF-DB에서 PAtt-Lite는 가림 서브셋에서 92.23%의 정확도, 자세 >30°에서 95.35%, 자세 >45°에서 94.44%를 기록하여 이전 최신 기술 수준 방법(Facial Chirality)을 3% 이상 뛰어넘었으며, 파rameter 수는 훨씬 적었다.
  • FERPlus에서 PAtt-Lite는 가림 서브셋에서 93.22%, 자세 >30°에서 96.07%, 자세 >45°에서 92.58%의 정확도를 기록하여, 세 서브셋 모두에서 90% 이상의 정확도를 달성한 최초의 방법이 되었다.
  • PAtt-Lite는 FERPlus에서 총 정확도 6.39% 향상으로 RAN [5]을 능가했으며, 파rameter 수는 10배 적은 1.10M(대비 11.2M)을 사용하였다.
  • RAF-DB와 FER2013에서 PAtt-Lite는 대부분의 클래스에서 95% 이상의 정확도를 기록했으며, 클래스 불균형으로 인해 성능 저하가 예상되는 가장 불균형한 클래스(경멸, 혐오, 공포)를 제외하고는 모두 이를 충족하였다.
  • 제거 실험을 통해 패치 추출 블록과 주의 분류기가 특히 어려운 조건에서 성능 향상에 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.