Skip to main content
QUICK REVIEW

[논문 리뷰] Facial Expression Recognition with Swin Transformer

Jun-Hwa Kim, Nam‐Ho Kim|arXiv (Cornell University)|2022. 03. 25.
Emotion and Mood RecognitionPsychology인용 수 19
한 줄 요약

이 논문은 시각, 시간적, 청각 모odalities를 활용하여 인-더-와일드(in-the-wild) Aff-Wild2 데이터셋에서 얼굴 표정 인식을 위한 세 스트림 Swin Transformer 기반 모델을 제안한다. 반-믹스 조작(jittering)이라는 새로운 데이터 증강 기법을 도입하여 불균형 데이터에서의 일반화 성능을 향상시켰으며, 검증 세트에서 35.71의 F1 스코어를 기록하여 기준 모델보다 12점 이상 뛰어나다.

ABSTRACT

The task of recognizing human facial expressions plays a vital role in various human-related systems, including health care and medical fields. With the recent success of deep learning and the accessibility of a large amount of annotated data, facial expression recognition research has been mature enough to be utilized in real-world scenarios with audio-visual datasets. In this paper, we introduce Swin transformer-based facial expression approach for an in-the-wild audio-visual dataset of the Aff-Wild2 Expression dataset. Specifically, we employ a three-stream network (i.e., Visual stream, Temporal stream, and Audio stream) for the audio-visual videos to fuse the multi-modal information into facial expression recognition. Experimental results on the Aff-Wild2 dataset show the effectiveness of our proposed multi-modal approaches.

연구 동기 및 목표

  • 멀티모달 데이터를 활용하여 인-더-와일드(in-the-wild) Aff-Wild2 데이터셋에서 얼굴 표정 인식 성능을 향상시키는 것.
  • 새로운 데이터 증강 전략을 통해 얼굴 표정 데이터셋의 클래스 불균형 문제를 해결하는 것.
  • 통합된 멀티모달 프레임워크 내에서 시각, 시간적, 청각 스트림에 대해 Swin Transformer의 표현 능력을 극대화하는 것.
  • 반-믹스 조작이 부분적인 얼굴 입력에 대한 모델의 강건성 향상에 기여하는지 검증하는 것.

제안 방법

  • 시각, 시간적, 청각 스트림 각각에 대해 별도의 Swin Transformer 인코더를 사용하는 세 스트림 네트워크 아키텍처를 채택한다.
  • 시각 스트림은 Swin Transformer Large 백본을 사용하여 단일 캐피처드된 얼굴 이미지를 처리한다.
  • 시간적 스트림은 1초 간격으로 샘플링된 16프레임 클립에서 스파atiotemporal 특징을 추출하기 위해 S3D-컨볼루션 레이어를 활용한다.
  • 청각 스트림은 오디오 신호를 멜-스펙트로그램으로 변환한 후, 이를 Swin Transformer 인코더로 처리한다.
  • 학습 중 반-믹스 조작을 적용하며, 얼굴의 일부(좌우 또는 상하)를 같은 배치에서의 기준 얼굴로 교체하고, 학습 가능한 마스크와 레이블 믹싱을 사용한다.
  • 추론 시에는 모든 세 스트림의 예측을 평균하여 스코어 융합을 수행한다.

실험 결과

연구 질문

  • RQ1Swin Transformer 기반 멀티모달 모델은 제약 없는 인-더-와일드(in-the-wild) 비디오 데이터에서 얼굴 표정을 효과적으로 인식할 수 있는가?
  • RQ2반-믹스 조작 데이터 증강 기법은 불균형 얼굴 표정 데이터셋에서 성능을 어떻게 향상시키는가?
  • RQ3정적 시각 입력 외에 시간적 및 청각 특징은 얼굴 표정 인식에 어떤 기여를 하는가?
  • RQ4후기 융합을 사용하는 제안된 세 스트림 아키텍처는 단일 스트림 또는 조기 융합 기반 베이스라인을 능가하는가?

주요 결과

  • 제안된 세 스트림 모델은 검증 세트에서 F1 스코어 35.71을 기록하여 기준 모델(23.00)보다 유의미하게 뛰어나다.
  • 시각 스트림만으로도 높은 F1 스코어 34.74를 기록하여 Swin Transformer가 단일 프레임 얼굴 표정 인식에서 강력한 성능을 보임을 입증한다.
  • 시간적 및 청각 스트림을 추가함으로써 성능이 35.08(시각 + 시간적)에서 35.71(전체 세 스트림 융합)으로 향상되어 모든 모odalities 간의 상호보완적 정보가 있음을 시사한다.
  • 반-믹스 조작은 일반화 성능 향상에 기여하였으며, 특히 분노(Anger), 혐오(Disgust), 공포(Fear), 놀람(Surprise)와 같은 소수 클래스에 유리하게 작용하여 증강 과정에서 기준 이미지로 사용되었다.
  • 모델는 부분적인 얼굴 입력에 대해서도 강건성을 보였으며, 반-믹스 조작이 주목할 만한 얼굴 영역에 집중하도록 유도하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.