Skip to main content
QUICK REVIEW

[논문 리뷰] The Role of Phonetic Units in Speech Emotion Recognition

Jiahong Yuan, Xingyu Cai|arXiv (Cornell University)|2021. 08. 02.
Emotion and Mood Recognition참고 문헌 24인용 수 9
한 줄 요약

이 논문은 미세조정된 Wav2vec 2.0를 사용하여 정서에 따라 달라지는 음성 인식을 활용하여 음소, 광범위한 음소 클래스, 그리고 syllables를 분류하는 새로운 음성 정서 인식 방법을 제안한다. 이는 음소 단위를 통합할 경우 정확도가 크게 향상됨을 보여주며, 특히 광범위한 음소 클래스를 사용할 경우 IEMOCAP에서 기존의 음소 및 문장 수준 모델을 뛰어넘는 최고의 성능을 기록하였다. 또한 이 방법은 이질어 환경에서도 유망한 성능을 보였다.

ABSTRACT

We propose a method for emotion recognition through emotiondependent speech recognition using Wav2vec 2.0. Our method achieved a significant improvement over most previously reported results on IEMOCAP, a benchmark emotion dataset. Different types of phonetic units are employed and compared in terms of accuracy and robustness of emotion recognition within and across datasets and languages. Models of phonemes, broad phonetic classes, and syllables all significantly outperform the utterance model, demonstrating that phonetic units are helpful and should be incorporated in speech emotion recognition. The best performance is from using broad phonetic classes. Further research is needed to investigate the optimal set of broad phonetic classes for the task of emotion recognition. Finally, we found that Wav2vec 2.0 can be fine-tuned to recognize coarser-grained or larger phonetic units than phonemes, such as broad phonetic classes and syllables.

연구 동기 및 목표

  • 음소, 광범위한 음소 클래스, 그리고 음절과 같은 음소 단위를 통합할 경우 음성 정서 인식 성능이 향상되는지 조사하기 위해.
  • 다양한 언어와 데이터셋 간에 정서 인식 모델의 강건성과 일반화 능력을 평가하기 위해.
  • 기존의 음소 수준 모델에 비해 더 흐린 또는 더 큰 음소 단위(예: 광범위한 음소 클래스, 음절)가 정서 인식에서 더 뛰어난 성능을 내는지 판단하기 위해.
  • Wav2vec 2.0가 음소 이외의 더 넓거나 큰 단위(예: 광범위한 음소 클래스, 음절)를 인식하기 위해 효과적으로 미세조정될 수 있는지 탐색하기 위해.
  • 광범위한 음소 클래스와 음절이 언어에 관계없이 일반적인 성격을 지닌다는 점을 감안해, 이들이 이질어 정서 인식 잠재력을 갖추고 있는지 평가하기 위해.

제안 방법

  • 음성 정서 인식을 위해 사전에 훈련된 Wav2vec 2.0 모델을 음소, 광범위한 음소 클래스, 음절과 같은 정서에 따라 달라지는 음소 단위를 예측하도록 미세조정한다.
  • 모든 단위에 동일한 Wav2vec 2.0 아키텍처를 사용하며, 맥락 기반 표현 위에 작업에 특화된 분류 헤드를 추가한다.
  • 모든 음성 문장이 정서 레이블과 함께 음소 단위로 변환된 IEMOCAP 데이터셋에서 훈련을 수행한다.
  • 결과 모델을 IEMOCAP과 EmoDB(독일어), KSU(아랍어), 중국어 정서 음성(Mandarin Chinese)의 세 개의 이질어 데이터셋에서 평가한다.
  • 샘플링 주파수 불일치 문제를 완화하기 위해 중국어 데이터셋에서 테스트할 경우 오디오를 8 kHz에서 16 kHz로 업샘플링하고, 데이터 증강 기법을 적용한다.
  • 모든 데이터셋과 음소 단위 유형에서 주요 평가 지표로 가중 정확도를 사용한다.

실험 결과

연구 질문

  • RQ1Wav2vec 2.0는 기존의 음소 외에 더 흐린 또는 더 큰 음소 단위인 광범위한 음소 클래스나 음절을 인식하도록 미세조정될 수 있는가?
  • RQ2음소, 광범위한 음소 클래스, 음절 중 어떤 음소 단위가 가장 높은 정서 인식 정확도를 기록하는가?
  • RQ3한 언어에서 훈련된 정서 인식 모델의 성능이 다른 언어로 일반화될 경우, 특히 언어에 관계없이 일반적인 성격을 지닌 단위인 광범위한 음소 클래스를 사용할 경우 어떻게 되는가?
  • RQ4광범위한 음소 클래스나 음절을 사용할 경우, 언어에 특화된 음소에 비해 이질어 정서 인식에서 강건성이 향상되는가?
  • RQ5예를 들어 샘플링 주파수 불일치와 같은 데이터 불일치가 다양한 데이터셋 간 이동성에 영향을 미치는가?

주요 결과

  • 광범위한 음소 클래스를 기반으로 훈련된 모델이 IEMOCAP 데이터셋에서 가장 높은 정서 인식 정확도를 기록했으며, 음소 및 문장 수준 모델을 뛰어넘었다.
  • IEMOCAP에서 가장 우수한 성능을 기록한 모델은 광범위한 음소 클래스를 사용하여 가중 정확도 73.2%를 기록했으며, 이는 이전에 보고된 결과보다 유의미하게 향상된 성능이었다.
  • 이질어 데이터셋에서 광범위한 음소 클래스 모델은 EmoDB(독일어)에서 66.7%, KSU(아랍어)에서 60.6%, Mandarin Affective Speech에서 39.9%의 정확도를 기록하여 음소 모델보다 더 우수한 일반화 능력을 보였다.
  • 음절 수준의 모델은 독일어 및 아랍어 데이터셋에서 음소 수준 모델을 능가했으며, 각각 68.4%와 55.0%의 정확도를 기록하여 더 뛰어난 강건성을 보였다.
  • 중국어 데이터셋에서의 낮은 성능(음소 기반 40.7%)은 주로 8 kHz 대비 16 kHz 샘플링 주파수 불일치 때문이었으며, 원본 8 kHz 데이터에서 7겹 교차 검증을 수행한 결과 초기음과 종성음 기반으로 75.2%의 정확도를 기록하여 이를 확인하였다.
  • Wav2vec 2.0를 더 크거나 더 흐린 음소 단위인 광범위한 음소 클래스나 음절과 같은 단위에 대해 미세조정하는 것은 가능하고 효과적이며, 언어 모델이 필요 없이도 가능함을 보여주어 모델이 계층적인 음소 표현을 학습하는 데 있어 뛰어난 유연성을 지닌다는 것을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.