Skip to main content
QUICK REVIEW

[논문 리뷰] Audio-video Emotion Recognition in the Wild using Deep Hybrid Networks

Xin Guo, Luisa F. Polanía|arXiv (Cornell University)|2020. 02. 20.
Speech and Audio Processing참고 문헌 25인용 수 8
한 줄 요약

이 논문은 야외 환경에서 음성-시각 정서 인식을 위한 딥 하이브리드 신경망을 제안한다. 얼굴 영상에 대해 VGG-LSTM 모델을, 음성 특징에 대해 SVM과 LSTM을, 음성에서 유도된 이미지 맵에 대해 Inception(v2)-LSTM을 결합한다. 이 방법은 검증 세트에서 55.61%의 정확도와 테스트 세트에서 51.15%의 정확도를 기록하여 EmotiW 2017 기준선(38.81%)을 크게 뛰어넘는 성능을 보였다.

ABSTRACT

This paper presents an audiovisual-based emotion recognition hybrid network. While most of the previous work focuses either on using deep models or hand-engineered features extracted from images, we explore multiple deep models built on both images and audio signals. Specifically, in addition to convolutional neural networks (CNN) and recurrent neutral networks (RNN) trained on facial images, the hybrid network also contains one SVM classifier trained on holistic acoustic feature vectors, one long short-term memory network (LSTM) trained on short-term feature sequences extracted from segmented audio clips, and one Inception(v2)-LSTM network trained on image-like maps, which are built based on short-term acoustic feature sequences. Experimental results show that the proposed hybrid network outperforms the baseline method by a large margin.

연구 동기 및 목표

  • 노이즈가 많고 조건이 불안정하고 통제되지 않은 환경에서의 실생활 영상에서 정서 인식의 과제를 해결한다.
  • 이전 방법들이 주로 시각적 특징에 집중하는 데 비해, 음성 채널 정보를 극대화하여 한계를 극복한다.
  • 후기 융합을 통한 다중모odal 딥 러닝 모델 통합을 통해 EmotiW 2017 음성-영상 정서 인식 서브챌린지의 성능을 향상시킨다.
  • 특히 시퀀스 모델링과 특징 맵 표현을 통해 음성 및 시각 모델을 융합할 경우 정확도 향상이 가능함을 입증한다.

제안 방법

  • 8프레임 간격으로 추출한 정렬된 얼굴 영상에 대해 VGG-16 기반의 CNN-LSTM 네트워크를 훈련시켜 얼굴 표정의 시간적 동역학을 모델링한다.
  • 두 개의 스트림 VGG-LSTM 아키텍처를 적용: 하나는 자체 개발한 방법으로 검출한 얼굴에 대해, 다른 하나는 대회 조직자로부터 제공된 얼굴에 대해 훈련시켜 강건성을 향상시킨다.
  • openSmile를 통해 추출한 통합 음성 특징 벡터에 대해 SVM 분류기를 훈련시어 음성 기반 정서 인식을 수행한다.
  • 단기 음성 특징 시퀀스에 대해 LSTM 네트워크를 구현하여 음성 모odal의 시간적 동역학을 모델링한다.
  • 단기 음성 특징을 스택하여 이미지 유사 맵을 구성하고, Inception(v2)-LSTM 네트워크를 훈련시켜 음성 표현의 시공간 패턴을 학습한다.
  • 모든 다섯 개의 모델(두 개의 VGG-LSTM, 하나의 SVM, 하나의 LSTM, 하나의 Inception(v2)-LSTM)의 예측을 격자 탐색 최적화된 결정 수준 융합을 통해 융합하여 검증 정확도를 최대화한다.

실험 결과

연구 질문

  • RQ1시각 및 음성 모달을 융합한 하이브리드 딥 러닝 아키텍처가 비제어 환경의 영상에서 정서 인식 정확도를 크게 향상시킬 수 있는가?
  • RQ2단기 음성 특징에서 유도된 이미지 유사 맵을 사용하는 것이 원시 음성 시퀀스에 비해 정서적 동역학을 모델링하는 데 어떻게 비교되는가?
  • RQ3프레임 간격이 있는 얼굴 영상에 대해 CNN-LSTM을 엔드 투 엔드로 훈련시키는 것이 특징 추출 후 별도의 RNN 훈련을 수행하는 것보다 우수한가?
  • RQ4특히 LSTM과 음성 특징에 대한 SVM을 사용한 음성 기반 모델이 시각 모델과 융합되었을 때 전체 성능에 얼마나 기여하는가?
  • RQ5음성 및 영상의 다양한 표현 방식에 대해 훈련된 다수의 딥 모델을 후기 융합하면 EmotiW 2017 벤치마크에서 우수한 성능을 달성할 수 있는가?

주요 결과

  • 제안된 하이브리드 네트워크는 검증 세트에서 55.61%의 정확도를 기록하여 EmotiW 2017 음성-영상 정서 인식 서브챌린지 기준선(38.81%)보다 뚜렷한 향상을 보였다.
  • 정렬된 얼굴에 대해 훈련된 최고 성능의 VGG-LSTM 모델은 49.61%의 정확도를 기록하여 2016년 서브챌린지 우승자(45.43%)를 초월했다.
  • 다른 얼굴 검출 방법을 사용해 훈련된 두 개의 VGG-LSTM 모델 조합은 검증 세트에서 51.02%의 정확도를 달성하여 다중 소스 얼굴 검출의 이점이 있음을 입증했다.
  • 음성 기반 모델, 특히 음성 맵에 대해 훈련된 Inception(v2)-LSTM은 검증 세트에서 26.63%의 정확도를 기록했으며 분노 클래스에서 뛰어난 성능을 보여 전체 융합 성능 향상에 기여했다.
  • 최종 하이브리드 네트워크는 테스트 세트에서 51.15%의 정확도를 기록했고, 정밀도 가중 평균 클래스별 정확도는 41.21%로 감정 클래스 간에 우수한 일반화 능력을 보였다.
  • 테스트 세트의 혼동 행렬을 분석한 결과, 행복(63.89% 재현율)과 중립(50.78% 재현율)에 대해 가장 잘 작동했고, 놀람(0% 재현율)에 대해 가장 어려움을 겪었음을 확인하여 특정 감정에 대한 과제가 있음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.