QUICK REVIEW
[논문 리뷰] An Audio-Video Deep and Transfer Learning Framework for Multimodal Emotion Recognition in the wild
Denis Dresvyanskiy, Elena Ryumina|arXiv (Cornell University)|2020. 10. 07.
Speech and Audio Processing인용 수 9
한 줄 요약
이 논문은 음성 및 영상 모odal을 사용하여 야외 환경에서의 정서 인식을 위한 다중모odal 딥 러닝 및 전이 학습 프레임워크를 제안한다. 영상에 대해서는 VGGFace2와 VGG-FER 모델을 활용한 전이 학습을 적용하고, 음성은 Spleeter를 통해 분리하여 단모달 예측을 가중치 기반 융합 전략으로 융합한다—ABAW 얼굴 표정 서브챌린지에서 테스트 세트 성능이 42.10%에 도달한다.
ABSTRACT
In this paper, we present our contribution to ABAW facial expression challenge. We report the proposed system and the official challenge results adhering to the challenge protocol. Using end-to-end deep learning and benefiting from transfer learning approaches, we reached a test set challenge performance measure of 42.10%.
연구 동기 및 목표
- 통제되지 않은 실생활 환경(야외)에서 딥 러닝을 활용한 다중모달 정서 인식을 향상시키기 위해.
- 정서 인식에 있어 영상 및 음성 모달에서의 전이 학습의 효과성을 조사하기 위해.
- 전체 성능 향상을 위해 단모달 예측을 융합하는 다양한 융합 전략을 평가하기 위해.
- 다중모달 정서 인식 시스템에서 음성 모달의 기여도를 분석하기 위해.
- ABAW 얼굴 표정 챌린지 데이터셋에서 가중치 기반 융합 기법을 활용해 모델 성능을 최적화하기 위해.
제안 방법
- 영상 기반 정서 인식을 위해 전이 학습을 활용해 VGGFace2 및 VGG-FER 모델을 얼굴 표정 데이터에 맞게 미세 조정한다.
- 깊이 임베딩의 평균 및 표준편차를 사용하여 4초 간격의 영상 윈도우에 대해 2D CNN + SVM을 통해 시간적 모델링을 적용한다.
- Spleeter를 사용해 음성에서 보컬 성분을 분리하여 배경 잡음의 간섭을 줄인다.
- 음성 표현 학습을 위해 1D CNN + LSTM 및 PANN 기반 모델을 활용한다.
- 단모달 예측을 두 가지 전략으로 융합한다: 단순 가중치 기반 융합(SWF) 및 모델 및 클래스 기반 가중치 기반 융합(MCWF).
- 클래스 불균형 문제를 완화하고 강건성을 향상시키기 위해 로그 기반 클래스 가중치 및 데이터 증강(회전, 반전, 밝기 조정)을 적용한다.
실험 결과
연구 질문
- RQ1VGGFace2 및 VGG-FER를 사용한 전이 학습은 야외 환경에서 영상 기반 정서 인식에 얼마나 효과적인가?
- RQ2노이즈가 많거나 음성이 없는 녹음자료가 존재하는 상황에서도 음성 기반 모델이 다중모달 정서 인식 성능을 향상시킬 수 있는가?
- RQ3SWF와 MCWF 중 어느 융합 전략이 다중모달 정서 인식에서 더 높은 성능을 낼 수 있는가?
- RQ4영상 시퀀스에서 동적인 얼굴 표정을 캡처하기 위해 최적의 시간 윈도우 크기는 얼마인가?
- RQ5다양한 음성 전처리 및 모델링 기법은 최종 인식 정확도에 어떤 영향을 미치는가?
주요 결과
- 제안된 다중모달 융합 시스템은 테스트 세트 챌린지 성능로 42.10%를 기록하여 모든 제출 사례 중 최고 성능를 달성했다.
- VGGFace2 기반 CNN + SVM 모델은 검증 세트에서 55.66%의 성능을 기록했고, 테스트 세트에서는 42.00%를 기록하여 독립된 음성 모델보다 뛰어난 성능를 보였다.
- MCWF를 사용해 VGGFace2 + SVM 및 1D CNN + LSTM 모델을 융합한 구성이 테스트 세트에서 42.10%의 성능를 기록하여 가장 뛰어난 성능를 보였다.
- 음성 기반 모델(1D CNN + LSTM 및 PANN)은 성능 향상에 거의 기여하지 않았는데, 이는 배경 잡음 및 침묵 등의 데이터 품질 문제로 인한 것으로 보인다.
- MCWF 융합 전략은 단순 평균화보다 성능 향상을 이끌었으며, 특히 다양한 영상 모델을 융합할 경우에 두드러진 효과를 보였다.
- VGG-FER 기반 CNN + KELM 모델은 VGGFace2 + SVM 접근 방식보다 낮은 성능를 보였는데, 이는 도메인 특화 미세 조정이 필수적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.