Skip to main content
QUICK REVIEW

[논문 리뷰] Cross Lingual Cross Corpus Speech Emotion Recognition

Shivali Goel, Homayoon Beigi|arXiv (Cornell University)|2020. 03. 18.
Emotion and Mood Recognition참고 문헌 24인용 수 15
한 줄 요약

이 논문은 다중 작업 학습 프레임워크를 사용하여 언어 간 및 코퍼스 간 음성 정서 인식(SER)을 조사한다. 이는 정서와 언어 정체성을 동시에 예측한다. 연구 결과, IS09 특징이 MFCC보다 우수하며, 전이 학습은 소규모 데이터셋에서 성능을 향상시킨다. 언어 ID를 보조 작업으로 추가하더라도 유의미한 성능 향상이 없음을 확인했으며, 이는 네 개의 언어에서 음성 정서 표현이 주로 언어에 의존하지 않는다는 것을 시사한다.

ABSTRACT

The majority of existing speech emotion recognition models are trained and evaluated on a single corpus and a single language setting. These systems do not perform as well when applied in a cross-corpus and cross-language scenario. This paper presents results for speech emotion recognition for 4 languages in both single corpus and cross corpus setting. Additionally, since multi-task learning (MTL) with gender, naturalness and arousal as auxiliary tasks has shown to enhance the generalisation capabilities of the emotion models, this paper introduces language ID as another auxiliary task in MTL framework to explore the role of spoken language on emotion recognition which has not been studied yet.

연구 동기 및 목표

  • 모델이 한 코퍼스나 언어에서 학습된 후 다른 코퍼스나 언어에 적용되었을 때 SER 성능에 격차가 존재하는 문제를 해결하기 위해.
  • 말하기 언어가 음성에서 정서 표현에 영향을 미치는지 여부를 연구하기 위해, 이는 SER 분야에서 거의 다뤄지지 않은 요소이다.
  • 성별, 자연스러움, 각성도, 언어 ID를 보조 작업으로 삼아 전이 학습과 다중 작업 학습(MTL)의 효과성을 평가하기 위해.
  • 일致한 특징 세트와 데이터 분할 조건에서 기존 기계 학습(SVC)과 딥 러닝(LSTM) 간 성능을 비교하기 위해.
  • 다양하고 자원이 적은, 그리고 연기된 음성 코퍼스를 다국어로 통합하여 일반화 능력을 평가하기 위해.

제안 방법

  • 다양한 음성 정서 데이터셋 다섯 개를 사용: EMO-DB(독일어), SAVEE(영어), EMOVO(이탈리아어), MASC(중국어), IEMOCAP(영어).
  • IS09 및 MFCC 특징을 추출하고, 로지스틱 회귀, SVC, LSTM 분류기를 사용하여 기준 및 전이 학습 실험을 수행.
  • IEMOCAP(대규모 영어 코퍼스)에서 사전 학습하고, 더 작은 데이터셋에서 미세 조정함으로써 전이 학습을 구현.
  • 모델이 공통 LSTM 기반 아키텍처를 사용하여 정서와 언어 ID를 동시에 예측하는 다중 작업 학습 프레임워크를 설계.
  • 표준화된 훈련-테스트 분할 조건에서 교차 코퍼스 및 교차 언어 설정에서 정확도 점수를 사용해 성능을 평가.
  • 단일 작업 및 다중 작업 모델을 비교하는 분석 실험을 수행하고, 동일한 데이터 분할 및 전처리 조건을 사용해 이전 연구 결과와의 유효성을 검증.

실험 결과

연구 질문

  • RQ1다양한 언어에서 단일 코퍼스와 교차 코퍼스 설정 간 SER 성능은 어떻게 달라지나?
  • RQ2다중 작업 학습에서 언어 식별을 보조 작업으로 통합하면 언어 간 정서 인식 성능이 향상되는가?
  • RQ3IS09와 MFCC 중 어느 특징 세트가 다양한 코퍼스와 언어에서 더 뛰어난 SER 성능을 낼 수 있는가?
  • RQ4대규모 코퍼스(IEMOCAP)에서의 전이 학습이 소규모, 자원이 적은 코퍼스에서의 SER 정확도에 얼마나 기여하는가?
  • RQ5최적의 특징을 사용하는 기존 기계 학습 모델(SVC + IS09)이 동일한 분할 조건에서 딥 러닝 모델을 능가할 수 있는가?

주요 결과

  • IS09 특징은 모든 데이터셋에서 MFCC보다 유의미하게 뛰어난 성능을 보였으며, SVC를 사용할 경우 EMO-DB에서 최고의 정확도 88.37%를 기록했다.
  • 전이 학습은 소규모 데이터셋에서 SER 성능을 향상시켰다: IEMOCAP에서 사전 학습한 후 EMO-DB에서 미세 조정했을 때 정확도가 46.51%에서 83.72%로 상승했다.
  • 다중 작업 학습에서 언어 ID를 보조 작업으로 추가하더라도 정서 인식 정확도 향상이 없었으며, 이는 정서 표현이 주로 언어에 의존하지 않는다는 것을 시사한다.
  • IS09 특징을 사용하는 기존 기계 학습 모델(SVC)은 EMO-DB에서 65.00%의 정확도, IEMOCAP에서는 61.00%의 정확도를 기록했으며, 동일한 분할 조건에서 이전의 딥 러닝 모델을 능가했다.
  • 다중 작업 모델은 언어 ID를 97% 이상의 정확도로 예측했으며, 언어 정체성이 학습 가능한 것을 확인했지만, 이 정보의 통합이 정서 인식 성능 향상에 기여하지는 않았다.
  • EMOVO에서 미세 조정 실험에서 성능이 약간 떨어졌으며, 이는 유사한 언어 가문 내에서도 도메인 이동 또는 데이터 분포의 차이가 존재할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.