[논문 리뷰] Facial Expression Recognition with Swin Transformer
이 논문은 시각, 시간적, 청각 모odalities를 활용하여 인-더-와일드(in-the-wild) Aff-Wild2 데이터셋에서 얼굴 표정 인식을 위한 세 스트림 Swin Transformer 기반 모델을 제안한다. 반-믹스 조작(jittering)이라는 새로운 데이터 증강 기법을 도입하여 불균형 데이터에서의 일반화 성능을 향상시켰으며, 검증 세트에서 35.71의 F1 스코어를 기록하여 기준 모델보다 12점 이상 뛰어나다.
The task of recognizing human facial expressions plays a vital role in various human-related systems, including health care and medical fields. With the recent success of deep learning and the accessibility of a large amount of annotated data, facial expression recognition research has been mature enough to be utilized in real-world scenarios with audio-visual datasets. In this paper, we introduce Swin transformer-based facial expression approach for an in-the-wild audio-visual dataset of the Aff-Wild2 Expression dataset. Specifically, we employ a three-stream network (i.e., Visual stream, Temporal stream, and Audio stream) for the audio-visual videos to fuse the multi-modal information into facial expression recognition. Experimental results on the Aff-Wild2 dataset show the effectiveness of our proposed multi-modal approaches.
연구 동기 및 목표
- 멀티모달 데이터를 활용하여 인-더-와일드(in-the-wild) Aff-Wild2 데이터셋에서 얼굴 표정 인식 성능을 향상시키는 것.
- 새로운 데이터 증강 전략을 통해 얼굴 표정 데이터셋의 클래스 불균형 문제를 해결하는 것.
- 통합된 멀티모달 프레임워크 내에서 시각, 시간적, 청각 스트림에 대해 Swin Transformer의 표현 능력을 극대화하는 것.
- 반-믹스 조작이 부분적인 얼굴 입력에 대한 모델의 강건성 향상에 기여하는지 검증하는 것.
제안 방법
- 시각, 시간적, 청각 스트림 각각에 대해 별도의 Swin Transformer 인코더를 사용하는 세 스트림 네트워크 아키텍처를 채택한다.
- 시각 스트림은 Swin Transformer Large 백본을 사용하여 단일 캐피처드된 얼굴 이미지를 처리한다.
- 시간적 스트림은 1초 간격으로 샘플링된 16프레임 클립에서 스파atiotemporal 특징을 추출하기 위해 S3D-컨볼루션 레이어를 활용한다.
- 청각 스트림은 오디오 신호를 멜-스펙트로그램으로 변환한 후, 이를 Swin Transformer 인코더로 처리한다.
- 학습 중 반-믹스 조작을 적용하며, 얼굴의 일부(좌우 또는 상하)를 같은 배치에서의 기준 얼굴로 교체하고, 학습 가능한 마스크와 레이블 믹싱을 사용한다.
- 추론 시에는 모든 세 스트림의 예측을 평균하여 스코어 융합을 수행한다.
실험 결과
연구 질문
- RQ1Swin Transformer 기반 멀티모달 모델은 제약 없는 인-더-와일드(in-the-wild) 비디오 데이터에서 얼굴 표정을 효과적으로 인식할 수 있는가?
- RQ2반-믹스 조작 데이터 증강 기법은 불균형 얼굴 표정 데이터셋에서 성능을 어떻게 향상시키는가?
- RQ3정적 시각 입력 외에 시간적 및 청각 특징은 얼굴 표정 인식에 어떤 기여를 하는가?
- RQ4후기 융합을 사용하는 제안된 세 스트림 아키텍처는 단일 스트림 또는 조기 융합 기반 베이스라인을 능가하는가?
주요 결과
- 제안된 세 스트림 모델은 검증 세트에서 F1 스코어 35.71을 기록하여 기준 모델(23.00)보다 유의미하게 뛰어나다.
- 시각 스트림만으로도 높은 F1 스코어 34.74를 기록하여 Swin Transformer가 단일 프레임 얼굴 표정 인식에서 강력한 성능을 보임을 입증한다.
- 시간적 및 청각 스트림을 추가함으로써 성능이 35.08(시각 + 시간적)에서 35.71(전체 세 스트림 융합)으로 향상되어 모든 모odalities 간의 상호보완적 정보가 있음을 시사한다.
- 반-믹스 조작은 일반화 성능 향상에 기여하였으며, 특히 분노(Anger), 혐오(Disgust), 공포(Fear), 놀람(Surprise)와 같은 소수 클래스에 유리하게 작용하여 증강 과정에서 기준 이미지로 사용되었다.
- 모델는 부분적인 얼굴 입력에 대해서도 강건성을 보였으며, 반-믹스 조작이 주목할 만한 얼굴 영역에 집중하도록 유도하기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.