Skip to main content
QUICK REVIEW

[논문 리뷰] Spatial and Temporal Networks for Facial Expression Recognition in the Wild Videos

Shuyi Mao, Xinqi Fan|arXiv (Cornell University)|2021. 07. 12.
Emotion and Mood Recognition참고 문헌 16인용 수 4
한 줄 요약

이 논문은 공간적 및 시간적 모델링을 통해 야외 환경에서의 표정 인식 성능을 향상시키기 위해 ResNet50, CNN-RNN, CNN-Transformer 아키텍처를 조합한 앙상블 모델을 제안한다. VGGFace2에서의 사전 훈련을 통해 야외 환경의 변동성에 대한 강건성을 향상시키며, 앙상블는 ABAW 2021 검증 세트에서 F1 스코어 0.4133, 정확도 0.6216, 최종 평가 지표 0.4821을 달성한다.

ABSTRACT

The paper describes our proposed methodology for the seven basic expression classification track of Affective Behavior Analysis in-the-wild (ABAW) Competition 2021. In this task, facial expression recognition (FER) methods aim to classify the correct expression category from a diverse background, but there are several challenges. First, to adapt the model to in-the-wild scenarios, we use the knowledge from pre-trained large-scale face recognition data. Second, we propose an ensemble model with a convolution neural network (CNN), a CNN-recurrent neural network (CNN-RNN), and a CNN-Transformer (CNN-Transformer), to incorporate both spatial and temporal information. Our ensemble model achieved F1 as 0.4133, accuracy as 0.6216 and final metric as 0.4821 on the validation set.

연구 동기 및 목표

  • 다양한 배경과 조명 조건을 가진 제약 없는 실생활 영상 환경에서의 표정 인식 과제를 해결한다.
  • VGGFace2와 같은 대규모 얼굴 인식 데이터셋에서의 사전 훈련 가중치를 활용하여 모델 일반화 능력을 향상시킨다.
  • 영상 데이터에서 개별 프레임의 공간적 특징과 순차적 프레임 간의 시간적 동적 특징을 효과적으로 캡처한다.
  • ABAW 2021 표정 인식 벤치마크에서 성능을 향상시키기 위해 다양한 아키텍처를 조합한 강건한 앙상블 프레임워크를 개발한다.

제안 방법

  • 제약 없는 환경에서의 특징 추출을 향상시키기 위해 VGGFace2 데이터셋에서의 가중치로 초기화된 사전 훈련된 ResNet50 모델을 사용한다.
  • ResNet50이 각 프레임에서 공간적 특징을 추출하고, 이중층 GRU가 시퀀스를 처리하여 시간적 의존성을 모델링하는 CNN-RNN 아키텍처를 구현한다.
  • RNN을 다중 헤드 자기주의 어텐션으로 대체하여 장거리 시간적 관계를 더 효율적으로 캡처하는 CNN-Transformer 모듈을 통합한다.
  • 프레임 순서 정보를 유지하기 위해 Transformer에 사인파 위치 인코딩을 적용한다.
  • 세 모델(ResNet50, CNN-RNN, CNN-Transformer)의 예측 결과를 가중 평균을 통해 조합하여 최종 앙상블 출력을 구성한다.
  • 4개의 GPU 환경에서 10 에포크 동안 SGD로 훈련하며, 다중 단계 학습률 스케줄러를 사용한다. 훈련은 다대다 모드에서 9프레임 시퀀스를 사용하고, 추론은 다대일 모드에서 수행한다.

실험 결과

연구 질문

  • RQ1대규모 얼굴 인식 데이터에서의 사전 훈련이 제약 없는 표정 인식 성능에 어떻게 기여하는가?
  • RQ2RNN 기반과 Transformer 기반의 시간적 모델링 접근 방식은 표정 영상의 순차적 동적 특징을 얼마나 다르게 캡처하는가?
  • RQ3다양한 아키텍처(CNN, CNN-RNN, CNN-Transformer)의 앙상블이 ABAW 2021 표정 인식 벤치마크에서 개별 모델을 초월할 수 있는가?
  • RQ4공간적 및 시간적 모델링 구성 요소의 통합은 최종 F1 스코어와 통합 평가 지표에 어떤 영향을 미치는가?

주요 결과

  • 앙상블 모델은 최종 평가 지표 0.4821을 달성하여 베이스라인 VGG-Face 모델(0.36)에 비해 상당한 성능 향상을 보였다.
  • VGGFace2에서 사전 훈련한 ResNet50는 F1 스코어를 0.3763에서 0.4124로, 정확도를 0.5713에서 0.6216으로 향상시켜 대규모 사전 훈련의 유용성을 입증했다.
  • CNN-RNN 및 CNN-Transformer 구성 요소는 각각 F1 스코어 0.4126과 0.4127을 기록하여 시간적 모델링에서 뛰어난 성능을 보였다.
  • 세 모델의 전체 앙상블는 가장 높은 F1 스코어(0.4133), 정확도(0.6216), 최종 평가 지표(0.4821)를 기록하여 앙상블의 효과성을 확인했다.
  • 사전 훈련된 ResNet50는 AU 검출 트랙에서도 뛰어난 성능을 보였으며, 최종 지표 0.6734를 기록하여 학습된 특징의 이식성(transferability)을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.