[논문 리뷰] Emotion Recognition for In-the-wild Videos
이 논문은 101층의 ResNet과 컨volutional 블록 주의 모듈(CBAM), 양방향 장기 단기 기억(BLSTM) 네트워크를 조합한 하이브리드 딥 러닝 모델을 제안한다. 이는 비제약 조건(인-더-와일드) 비디오에서 엔드 투 엔드로 얼굴 표정 인식을 수행하기 위한 것이다. 이 방법은 Aff-Wild2 검증 세트에서 64.3%의 정확도와 43.4%의 최종 지표(S)를 기록하여 베이스라인보다 7.43个百分点 높은 성능을 달성한다.
This paper is a brief introduction to our submission to the seven basic expression classification track of Affective Behavior Analysis in-the-wild Competition held in conjunction with the IEEE International Conference on Automatic Face and Gesture Recognition (FG) 2020. Our method combines Deep Residual Network (ResNet) and Bidirectional Long Short-Term Memory Network (BLSTM), achieving 64.3% accuracy and 43.4% final metric on the validation set.
연구 동기 및 목표
- 비제약 조건의 실제 세계 비디오 데이터(인-더-와일드 비디오)에서 일곱 가지 기본 얼굴 표정을 인식하는 데 도전하는 것.
- 얼굴의 동적 특징을 위한 공간적 특징 추출과 시간적 모델링을 융합하여 얼굴 표정 인식 성능을 향상시키는 것.
- 특히 CBAM를 통해 주목사용 메커니즘을 활용하여 깊이 신경망의 특징 표현을 향상시키고, 관련 있는 얼굴 영역과 채널에 집중하는 것.
- 실제 세계 비디오 데이터에 존재하는 다양한 조명, 자세, 표정 변형에 대해 일반화 가능한 강건한 모델을 개발하는 것.
제안 방법
- 각 잔차 블록 뒤에 CBAM 모듈을 삽입한 101층의 ResNet을 사용하여 공간적 및 채널별 특징 주목을 향상시킨다.
- CBAM를 통해 공간적 위치와 특징 채널에 대한 주목 가중치를 학습하여 특징 맵을 정밀하게 조정함으로써 분류 능력을 향상시킨다.
- 연속된 비디오 프레임 간의 장기적 시간적 의존성을 모델링하기 위해 추출된 프레임 수준의 특징을 양방향 LSTM(BLSTM)을 통해 처리한다.
- 8개의 연속 프레임으로 이루어진 비디오 클립을 처리하며, 필요에 따라 영점 패딩을 적용하여 시퀀스 일관성을 유지한다.
- 중립, 분노, 혐오, 공포, 기쁨, 슬픔, 놀람의 일곱 가지 감정 클래스를 예측하기 위해 완전 연결층을 갖춘 분류 헤드를 사용한다.
- 다중 데이터셋 사전 학습 설정에서 교차 엔트로피 손실을 사용하여 확률적 경사 하강법(SGD), 학습률 0.0001, 모멘터 0.9를 사용해 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1주목사용 메커니즘을 통합한 하이브리드 CNN-RNN 아키텍처가 비제약 조건 비디오 환경에서 얼굴 표정 인식 정확도를 향상시킬 수 있는가?
- RQ2ResNet에 CBAM를 통합하는 것이 얼굴 표정 인식에서 특징 표현을 향상시키는 데 얼마나 효과적인가?
- RQ3단방향 또는 비반복적 접근 방식에 비해 시간적 시퀀스를 양방향 LSTM으로 모델링함으로써 인식 성능 향상 정도는 어느 정도인가?
- RQ4제안된 방법은 Aff-Wild2 데이터셋에서 정확도와 F1-스코어 측면에서 기존의 베이스라인 모델에 비해 어떻게 비교되는가?
주요 결과
- 제안된 ResNet+CBAM+BLSTM 모델은 Aff-Wild2 데이터셋의 검증 세트에서 64.3%의 정확도를 기록하였다.
- 모델은 최종 지표(S)로 43.4%를 기록하였으며, 대회 공고에서 제시된 36%의 베이스라인보다 7.43个百分点 높았다.
- ResNet-101 기반 구조에 CBAM를 추가함으로써 F1-스코어가 ResNet+BLSTM의 0.281에서 0.333으로 향상되어 클래스 간 균형이 향상됨을 확인하였다.
- 다양한 표현 카테고리에서의 성능 향상으로 인해, 모델가 인-더-와일드 비디오 데이터의 변형에 대해 강건함을 입증하였다.
- 최고 성능을 보인 모델는 검증 세트 성능 기반 체크포인트에서 선별되었으며, 효과적인 하이퍼파ram터 및 훈련 스케줄 조정이 이루어졌음을 시사한다.
- AffectNet, RAF-DB 및 자체 수집한 300만 장의 이미지 데이터셋 등 여러 내부 데이터셋에서의 사전 학습이 일반화 능력 향상과 최종 성능 향상에 기여하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.