Skip to main content
QUICK REVIEW

[논문 리뷰] Multi Modal Facial Expression Recognition with Transformer-Based Fusion Networks and Dynamic Sampling

Jun-Hwa Kim, Nam‐Ho Kim|arXiv (Cornell University)|2023. 03. 15.
Emotion and Mood Recognition인용 수 5
한 줄 요약

이 논문은 시각적 및 청각적 특징을 융합하여 얼굴 표정 인식 성능을 향상시키기 위해 트랜스포머 기반의 다중 모odal 융합 네트워크를 제안한다. 공통 주의 메커니즘과 동적 샘플링을 활용한 모odal 융합 모듈(MFM)을 통해 시간적 동적 특성과 클래스 불균형 문제를 다룬다. 제안된 방법은 ABAW 2023 검증 세트에서 27.77의 F1 스코어를 기록하여 단일 모odal 기반의 베이스라인을 능가하였다.

ABSTRACT

Facial expression recognition is an essential task for various applications, including emotion detection, mental health analysis, and human-machine interactions. In this paper, we propose a multi-modal facial expression recognition method that exploits audio information along with facial images to provide a crucial clue to differentiate some ambiguous facial expressions. Specifically, we introduce a Modal Fusion Module (MFM) to fuse audio-visual information, where image and audio features are extracted from Swin Transformer. Additionally, we tackle the imbalance problem in the dataset by employing dynamic data resampling. Our model has been evaluated in the Affective Behavior in-the-wild (ABAW) challenge of CVPR 2023.

연구 동기 및 목표

  • 이미지 기반 접근 방식을 초월하여 청각 및 시각 모달을 융합함으로써 얼굴 표정 인식 정확도를 향상시키는 것.
  • Aff-Wild2 데이터셋의 클래스 불균형 문제를 해결하기 위해 동적 데이터 재샘플링 및 다수 클래스의 서브샘플링을 수행하는 것.
  • 각 프레임 중심으로 설정된 다중 동적 청각 윈도우 크기를 활용하여 얼굴 표정의 시간적 동적 특성을 모델링하는 것.
  • 청각 및 시각 모달의 중요도를 적응적으로 가중하는 학습 가능한 융합 기법을 개발하는 것.
  • Swin 트랜스포머 기반 아키텍처를 사용하여 ABAW 2023 AffectNet 인-더-월드 챌린지에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • 모든 모달에 대해 티니 스위니 트랜스포머를 사용하여 청각 및 시각적 특징을 별도로 추출한다.
  • 모달 융합 모듈(MFM)은 상호 주의 메커니즘을 사용한다: 청각 특징이 시각적 특징을 쿼리하고, 반대로 시각적 특징이 청각 특징을 쿼리하여 모달 인식 융합을 가능하게 한다.
  • 상호 주의의 융합 출력(Y_IA 및 Y_AI)은 연결되어 두 개의 추가 트랜스포머 레이어를 통과하여 Y_T를 생성한다.
  • 세 가지 다른 시간 윈도우 크기(작음: 31 프레임, 중간: 47 프레임, 큼: 63 프레임)를 사용하여 각 프레임 주변의 동적 얼굴 표정 변화를 포괄한다.
  • 동적 샘플링은 중심 프레임의 레이블과 80%, 65%, 또는 50% 미만의 프레임이 일치하지 않는 윈도우를 제외하여 레이블 일관성을 확보한다.
  • 다수 클래스(예: '행복')의 서브샘플링을 통해 클래스 불균형 문제를 완화하고, 훈련 중 소수 클래스 샘플은 모두 유지한다.

실험 결과

연구 질문

  • RQ1학습 가능한 주의 메커니즘을 활용한 청각-시각 융합이 단일 이미지 기반 모델을 초월하여 얼굴 표정 인식 성능을 향상시킬 수 있는가?
  • RQ2청각 데이터의 동적 윈도우링 전략이 시간적으로 변동성이 큰 얼굴 표정 인식 성능에 미치는 영향은 어떠한가?
  • RQ3동적 재샘플링 및 서브샘플링 전략이 실세계 데이터셋에서 불균형 클래스에 대한 과적합을 어느 정도 줄일 수 있는가?
  • RQ4상호 주의 기반 MFM이 다중 모달 FER에서 단순한 초기 또는 후기 융합 전략을 능가하는가?
  • RQ5클래스 불균형 상황에서 각 모달(이미지, 청각, 융합)이 최종 예측에 기여하는 정도는 어떠한가?

주요 결과

  • 제안된 모델은 검증 F1 스코어 27.77을 기록하여 이미지 전용 베이스라인(23.00)과 청각 전용 모델(14.12)을 크게 앞서는 성능을 보였다.
  • 융합 표현(Y_T)만으로도 25.09의 F1 스코어를 달성하여 MFM이 다중 모달 신호를 효과적으로 통합함을 입증하였다.
  • 이미지, 청각, 융합 특징의 앙상블이 가장 높은 성능을 기록하여 서로 다른 모달 간의 상호 보완적 정보가 있음을 시사하였다.
  • 레이블 일관성 기반의 임계값 설정 동적 샘플링 전략을 적용함으로써 훈련 안정성과 실세계 데이터에 대한 일반화 능력 향상이 이루어졌다.
  • 다수 클래스('행복')의 서브샘플링 전략은 과적합을 줄이고 소수 클래스 성능 향상을 도모하였으며, 전체 정확도를 저하시키지 않았다.
  • 로그 멜 스펙트로그램과 224×224 입력 해상도를 사용하는 스위니-티니 백본이 모달별 특징 추출 및 융합에 있어 효과적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.