Skip to main content
QUICK REVIEW

[논문 리뷰] Linguistic and Gender Variation in Speech Emotion Recognition using Spectral Features

Zachary Dair, Ryan Donovan|arXiv (Cornell University)|2021. 12. 17.
Music and Audio Processing인용 수 4
한 줄 요약

이 연구는 스펙트럼 특징(예: 메르 주파수 케프스트럼 계수(MFCC), 멜스펙트로그램, 스펙트럼 대비)를 사용하여 성별 및 언어적 차이가 음성 감정 인식(SER)에 미치는 영향을 조사한다. 영어, 독일어, 이탈리아어 데이터셋을 기반으로 컨volutional 신경망(CNN)을 훈련시었으며, 감정 분류 정확도가 단일어 및 교차어 설정에서는 높지만 다국어 데이터에서는 상당히 낮게 나타났으며, 특히 고에너지(예: 분노, 기쁨) 및 저에너지(예: 혐오, 공포) 감정에서 남성과 여성 화자 간에 뚜렷한 성능 차이가 관찰되었다.

ABSTRACT

This work explores the effect of gender and linguistic-based vocal variations on the accuracy of emotive expression classification. Emotive expressions are considered from the perspective of spectral features in speech (Mel-frequency Cepstral Coefficient, Melspectrogram, Spectral Contrast). Emotions are considered from the perspective of Basic Emotion Theory. A convolutional neural network is utilised to classify emotive expressions in emotive audio datasets in English, German, and Italian. Vocal variations for spectral features assessed by (i) a comparative analysis identifying suitable spectral features, (ii) the classification performance for mono, multi and cross-lingual emotive data and (iii) an empirical evaluation of a machine learning model to assess the effects of gender and linguistic variation on classification accuracy. The results showed that spectral features provide a potential avenue for increasing emotive expression classification. Additionally, the accuracy of emotive expression classification was high within mono and cross-lingual emotive data, but poor in multi-lingual data. Similarly, there were differences in classification accuracy between gender populations. These results demonstrate the importance of accounting for population differences to enable accurate speech emotion recognition.

연구 동기 및 목표

  • 스펙트럼 특징을 활용하여 성별 및 언어적 다양성이 음성 감정 인식(SER)에 미치는 영향을 조사하기.
  • 모델 기반의 CNN가 단일어, 다국어, 교차어 음성 감정 분류에서 어떻게 성능을 발휘하는지 평가하기.
  • 다양한 인구 집단에서 감정 분류에 가장 효과적인 스펙트럼 특징(MFCC, 멜스펙트로그램, 스펙트럼 대비)을 특정하기.
  • 성별 및 언어에 기인한 음성 특징이 SER 시스템의 일반화 능력과 정확도에 미치는 영향을 평가하기.
  • 다국어 및 다성별 SER 성능 향상을 위해 표준화된 데이터 수집 및 정규화 기법이 필요하다는 점을 부각하기.

제안 방법

  • 영어, 독일어, 이탈리아어 음성 데이터에서 멜 주파수 케프스트럼 계수(MFCC), 멜스펙트로그램, 스펙트럼 대비 등의 스펙트럼 특징을 추출하였다.
  • 추출된 스펙트럼 특징을 기반으로 컨volutional 신경망(CNN)을 훈련 및 평가하여 감정 분류를 수행하였다.
  • 모델은 세 가지 설정에서 테스트되었으며, 각각 단일어(동일 언어), 다국어(훈련 및 테스트에 다수 언어 포함), 교차어(한 언어로 훈련, 다른 언어로 테스트)였다.
  • 비교 분석을 통해 다양한 성별 및 언어 집단에서 감정 분류에 가장 효과적인 스펙트럼 특징을 규명하였다.
  • 실증적 평가를 통해 여섯 가지 기본 감정(분노, 혐오, 공포, 기쁨, 슬픔, 놀라움)에 대한 성별 및 언어의 영향을 성능 지표를 기반으로 분석하였다.
  • 통계적 평가를 통해 성능 차이가 인구 집단의 본질적 차이 때문인지 데이터 샘플링 한계 때문인지를 판단하였다.

실험 결과

연구 질문

  • RQ1음성 특징에서 성별 차이가 스펙트럼 특징을 활용한 음성 감정 인식 정확도에 어떻게 영향을 미치는가?
  • RQ2영어, 독일어, 이탈리아어 간 언어적 다양성이 CNN 기반 감정 분류 모델의 성능에 어느 정도 영향을 미치는가?
  • RQ3MFCC, 멜스펙트로그램, 스펙트럼 대비 중 어떤 스펙트럼 특징이 다양한 성별 및 언어 집단에서 감정 분류에 가장 효과적인가?
  • RQ4다국어 SER 성능이 단일어 및 교차어 설정보다 떨어지는 이유는 무엇이며, 녹음 변동성과 정규화 기법은 어떤 역할을 하는가?
  • RQ5신호 에너지 및 진폭 특징은 남성과 여성 화자 간에 서로 다른 언어에서 감정 탐지 정확도에 어떻게 영향을 미치는가?

주요 결과

  • CNN 모델은 단일어 및 교차어 설정에서는 높은 감정 분류 정확도를 달성했지만, 언어적 다양성과 녹음 변동성으로 인해 다국어 설정에서는 성능이 크게 떨어졌다.
  • 고에너지 감정(예: 분노, 기쁨)은 독일어 화자 중 남성에서 더 정확하게 탐지되었으며, 이는 이 집단에서 높은 진폭과 날카로운 음성 특징 때문일 수 있다.
  • 저에너지 감정(예: 혐오, 공포)은 모든 언어에서 여성 화자에서 더 정확하게 분류되었으며, 이는 낮은 진폭과 부드러운 음성 발화 방식 때문일 수 있다.
  • 남성과 여성 화자 간 스펙트럼 표현의 뚜렷한 차이로 인해 성별에 따라 성능 격차가 발생하였으며, 복합 성별 모델은 성별 특화 모델보다 성능이 열 劣했다.
  • 이 연구는 진폭과 에너지와 관련된 스펙트럼 특징이 성별 및 언어적 다양성을 고려할 때 정확한 감정 인식에 핵심적인 역할을 한다고 규명하였다.
  • 작은 표본 크기(N = 40)와 언어 집단 간 불균형한 화자 분포로 인해 관찰된 차이가 과대평가되었을 수 있으며, 향후 연구에서는 더 크고 균형 잡힌 데이터셋이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.