Skip to main content
QUICK REVIEW

[논문 리뷰] Emotion Recognition from Speech

Kannan Venkataramanan, Haresh Rengaraj Rajamohan|arXiv (Cornell University)|2019. 12. 22.
Emotion and Mood Recognition참고 문헌 19인용 수 9
한 줄 요약

이 논문은 RAVDESS 데이터셋에서 2성별 × 7감정의 14클래스 작업에 대해 68%의 정확도를 달성하는 4층 2차원 컨볼루션 신경망(CNN)을 제안한다. 이는 로그-멜 스펙트로그램 특징을 사용한 것으로, 모델 복잡성보다 특징 선택(특히 로그-멜 스펙트로그램)이 더 중요하다는 것을 발견했으며, 음고와 에너지의 차이로 인해 성별별 모델링이 성능 향상에 기여한다.

ABSTRACT

In this work, we conduct an extensive comparison of various approaches to speech based emotion recognition systems. The analyses were carried out on audio recordings from Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS). After pre-processing the raw audio files, features such as Log-Mel Spectrogram, Mel-Frequency Cepstral Coefficients (MFCCs), pitch and energy were considered. The significance of these features for emotion classification was compared by applying methods such as Long Short Term Memory (LSTM), Convolutional Neural Networks (CNNs), Hidden Markov Models (HMMs) and Deep Neural Networks (DNNs). On the 14-class (2 genders x 7 emotions) classification task, an accuracy of 68% was achieved with a 4-layer 2 dimensional CNN using the Log-Mel Spectrogram features. We also observe that, in emotion recognition, the choice of audio features impacts the results much more than the model complexity.

연구 동기 및 목표

  • 음성 감정 인식(SER)을 위한 가장 효과적인 오디오 특징과 딥러닝 아키텍처를 규명하는 것.
  • MFCC, 로그-멜 스펙트로그램, 음고, 에너지 등의 다양한 특징 유형과 LSTM, CNN, HMM, DNN 등의 아키텍처에서의 모델 성능을 평가하는 것.
  • 외부 TESS 데이터셋에서의 성능을 통해 모델의 일반화 능력을 평가하는 것.
  • 성별에 따라 별도로 모델링할 경우 감정 인식 성능 향상이 이루어지는지 조사하는 것.
  • 활성화 시각화와 주의 메커니즘을 통해 모델의 해석 가능성(해석 가능성)을 탐색하는 것.

제안 방법

  • 연구는 24명의 배우가 참여한 RAVDESS 데이터셋을 사용하며, 8개 감정이 포함된 1440개의 음성 발화가 성별과 강도에 따라 균형 잡혀져 있다.
  • 오디오가 사전 처리되어 로그-멜 스펙트로그램, MFCC, 음고, 에너지 특징으로 변환되어 모델 입력으로 사용된다.
  • 주요 아키텍처로는 4층의 2차원 CNN을 사용하며, 글로벌 평균 풀링을 적용한다. 이 모델은 14클래스 및 이진(긍정/부정) 감정 분류 작업에 대해 로그-멜 스펙트로그램을 기반으로 훈련된다.
  • 모델 성능은 검증 및 테스트 세트에서 정확도, F1 점수, 상위-2 및 상위-3 카테고리 정확도를 사용하여 평가된다.
  • 모델은 TESS 데이터셋에서 미세조정 및 테스트되어 강건성과 일반화 능력을 평가한다.
  • 클래스 활성화 맵을 사용하여 최종 예측에 가장 영향을 주는 로그-멜 스펙트로그램 영역을 시각화하여 모델의 설명 가능성을 높인다.

실험 결과

연구 질문

  • RQ1음성 감정 인식에서 가장 높은 정확도를 낼 수 있는 오디오 특징 표현(예: 로그-멜 스펙트로그램, MFCC, 음고, 에너지)은 무엇인가?
  • RQ22차원 CNN, LSTM, HMM, 3차원 CNN 등의 모델 아키텍처가 RAVDESS 데이터셋에서 성능에 미치는 영향은 어떠한가?
  • RQ3음고와 에너지의 차이로 인해 성별에 따라 별도의 감정 분류 모델링이 성능 향상에 기여하는가?
  • RQ4RAVDESS에서 훈련된 모델이 TESS 데이터셋으로 일반화되는 정도는 어떠한가? 이는 도메인 이동에 대한 강건성 여부를 나타낸다.
  • RQ5주의 메커니즘 또는 Atrous 공간 프로브 풀링(ASPP)이 SER에서 특징 학습을 추가로 향상시킬 수 있는가?

주요 결과

  • 로그-멜 스펙트로그램 특징을 사용한 4층 2차원 CNN은 14클래스 감정 인식 작업에서 68%의 테스트 정확도를 기록했으며, 다른 모델과 특징보다 뛰어난 성능을 보였다.
  • 로그-멜 스펙트로그램은 델타 계수를 결합한 경우조차도 MFCC보다 뚜렷이 뛰어난 성능을 보여, 감정 신호에 대한 분류 능력이 뛰어나다는 것을 시사한다.
  • 성별에 따라 별도로 모델링할 경우 음고와 에너지의 차이로 인해 성능 향상이 이루어졌다.
  • 이진 분류(긍정 대 비금성 감정)에서는 88%의 정확도를 기록하여 넓은 감정 범주에서 강력한 성능을 보였다.
  • 외부 TESS 데이터셋에서는 62%의 정확도를 기록했으며, 이는 14%의 우연한 수준을 훨씬 뛰어넘어 훈련 데이터를 초월한 강건한 일반화 능력을 보여준다.
  • 64세 여성 화자에 대해 성별을 잘못 분류한 것은 낮은 음고로 인한 것으로, 이는 화자 연령과 성별에 기반한 계층적 모델의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.