Skip to main content
QUICK REVIEW

[논문 리뷰] Emotion Recognition in Audio and Video Using Deep Neural Networks

Mandeep Singh, Yuan Fang|arXiv (Cornell University)|2020. 06. 15.
Emotion and Mood Recognition참고 문헌 11인용 수 14
한 줄 요약

이 논문은 IEMOCAP 데이터셋을 사용하여 청각 스펙트로그램과 영상 프레임을 융합하는 다중모달 딥러닝 접근법을 제안한다. 청각에는 CNN+RNN, 영상에는 3D-CNN을 적용하여 3개 감정에서 71.75%의 정확도와 4개 감정에서 54.0%의 정확도를 달성한다. 융합 모델은 청각과 얼굴 표정 특징 간 상보성을 활용하여 감정 인식 성능을 향상시키지만, 클래스 불균형과 최적화되지 않은 공간 크롭 기법으로 인해 성능이 제한된다.

ABSTRACT

Humans are able to comprehend information from multiple domains for e.g. speech, text and visual. With advancement of deep learning technology there has been significant improvement of speech recognition. Recognizing emotion from speech is important aspect and with deep learning technology emotion recognition has improved in accuracy and latency. There are still many challenges to improve accuracy. In this work, we attempt to explore different neural networks to improve accuracy of emotion recognition. With different architectures explored, we find (CNN+RNN) + 3DCNN multi-model architecture which processes audio spectrograms and corresponding video frames giving emotion prediction accuracy of 54.0% among 4 emotions and 71.75% among 3 emotions using IEMOCAP[2] dataset.

연구 동기 및 목표

  • 딥 뉴럴 네트워크를 활용하여 음성 및 영상의 감정 인식 정확도를 향상시키는 것.
  • 감정 인식을 위한 청각 및 영상 특징의 다중모달 융합 효과를 조사하는 것.
  • 기존 아키텍처와 데이터 전처리에서 성능을 저해하는 요소를 특정하는 것.
  • 데이터 증강, 노이즈 제거 및 공간 크롭 기법이 모델 정확도에 미치는 영향을 탐색하는 것.
  • IEMOCAP 데이터셋에서 다양한 딥러닝 아키텍처(CNN, RNN, LSTM, 3D-CNN)의 성능을 평가하는 것.

제안 방법

  • 청각 스트림은 스펙트로그램을 입력으로 사용하며, 시간적 및 주파수적 특징을 추출하기 위해 CNN, CNN+RNN 또는 CNN+LSTM 아키텍처를 적용한다.
  • 영상 스트림은 영상 프레임에서 공간-시간적 특징을 추출하기 위해 3D-CNN을 사용한다. 주로 얼굴 표정에 초점을 맞춘다.
  • 최종 예측은 청각 및 영상 하위 네트워크의 마지막 레이어를 연결한 후 전결합층을 거쳐 수행된다.
  • 모델은 10명의 피험자와 9개 감정을 포함한 총 12시간의 음성영상 기록을 포함하는 IEMOCAP 데이터셋을 사용해 훈련 및 평가된다.
  • 저자들은 주로 전체 정확도를 평가 지표로 사용하며, 데이터 증강, 노이즈 제거 및 크롭 기법에 대한 분석 실험을 수행한다.
  • 얼굴 검출 및 자동 크롭 기법을 탐색하여 얼굴 영역에 집중하고 배경 노이즈를 줄이는 데 기여할 수 있음을 고려한다.

실험 결과

연구 질문

  • RQ1다중모달 딥러닝 아키텍처를 통해 청각 및 영상 특징을 융합할 경우, 단일모달 모델 대비 감정 인식 정확도가 향상되는가?
  • RQ2CNN, RNN, LSTM 및 3D-CNN 등의 다양한 신경망 아키텍처는 청각 및 영상 감정 인식 성능에 어떤 영향을 미치는가?
  • RQ3특히 '기쁨' 클래스의 데이터 불균형이 모델 예측 정확도에 어떤 영향을 미치는가?
  • RQ4데이터 증강 기법은 모델 일반화 능력을 향상시키는가, 아니면 감정 관련 특징을 왜곡함으로써 성능을 떨어뜨리는가?
  • RQ5오디오 전처리 과정에서 노이즈 제거를 수행하지 않을 경우, 노이즈 제거된 스펙트로그램 대비 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • CNN+RNN+3DCNN 다중모달 아키텍처는 IEMOCAP 데이터셋을 사용하여 3개 감정에서 71.75%의 정확도, 4개 감정에서 54.0%의 정확도를 달성했다.
  • 다중모달 모델은 3개 감정에서 단일모달 청각 모델보다 성능이 뛰어나, 영상 프레임이 감정 정보를 보완적으로 제공한다는 것을 시사한다.
  • 기쁨 예측이 가장 약한 클래스였으며, 데이터 수가 적고 성능이 열악하여 클래스 불균형이 주요 성능 저하 요인임을 시사한다.
  • 크롭 및 회전을 통한 데이터 증강은 성능을 약간 악화시켰는데, 감정 인식에 핵심적인 시간 및 주파수 특징이 왜곡되었기 때문일 것이다.
  • 직접적인 데이터 증강을 적용해도 성능 향상이 이루어지지 않았으며, 이러한 방법들이 감정 관련 청각적 및 시각적 특징을 변형시켜 영향을 미쳤을 가능성이 있다.
  • 얼굴 주변 자동 크롭 기법은 정확도를 크게 향상시킬 것으로 기대되며, 현재 큰 크롭 창은 관련 없거나 노이즈가 많은 영역을 포함하고 있기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.