Skip to main content
QUICK REVIEW

[논문 리뷰] On the Impact of Word Error Rate on Acoustic-Linguistic Speech Emotion Recognition: An Update for the Deep Learning Era

Shahin Amiriparian, Artem Sokolov|arXiv (Cornell University)|2021. 04. 20.
Speech Recognition and Synthesis참고 문헌 31인용 수 9
한 줄 요약

이 논문은 딥 러닝 시대에 자동 음성 인식(ASR) 단어 오류률(WER)이 음향-언어적 음성 정서 인식(SER)에 미치는 영향을 조사한다. 현대적인 ASR 시스템(RNN-T, CTC, wav2vec)과 사전 훈련된 텍스트 인코더(BERT, DeepMoji, ELECTRA)를 사용하여 음향 특징(OpenSMILE, DeepSpectrum, auDeep, BoAW)과 ASR 생성 텍스트 및 골드 표준 텍스트를 융합함으로써, IEMOCAP에서 라이트 퓨전을 통해 개발 세트 기준 73.6%, 테스트 세트 기준 73.8%의 최신 기술 수준(SOTA)의 무작위 평균 재현율(UAR)을 달성하였다.

ABSTRACT

Text encodings from automatic speech recognition (ASR) transcripts and audio representations have shown promise in speech emotion recognition (SER) ever since. Yet, it is challenging to explain the effect of each information stream on the SER systems. Further, more clarification is required for analysing the impact of ASR's word error rate (WER) on linguistic emotion recognition per se and in the context of fusion with acoustic information exploitation in the age of deep ASR systems. In order to tackle the above issues, we create transcripts from the original speech by applying three modern ASR systems, including an end-to-end model trained with recurrent neural network-transducer loss, a model with connectionist temporal classification loss, and a wav2vec framework for self-supervised learning. Afterwards, we use pre-trained textual models to extract text representations from the ASR outputs and the gold standard. For extraction and learning of acoustic speech features, we utilise openSMILE, openXBoW, DeepSpectrum, and auDeep. Finally, we conduct decision-level fusion on both information streams -- acoustics and linguistics. Using the best development configuration, we achieve state-of-the-art unweighted average recall values of $73.6\,\%$ and $73.8\,\%$ on the speaker-independent development and test partitions of IEMOCAP, respectively.

연구 동기 및 목표

  • 현대 딥 러닝 시스템에서 ASR 단어 오류률(WER)이 언어적 음성 정서 인식(SER)에 미치는 영향을 조사하기 위해.
  • 엔드 투 엔드 SER 시스템에서 골드 표준(GS) 텍스트와 ASR 생성 텍스트 간의 성능 격차를 평가하기 위해.
  • 최신 기술 수준의 SER 성능을 달성하기 위한 음향 및 언어적 특징 세트의 최적 조합을 규명하기 위해.
  • 음향, 골드 표준 텍스트, ASR 텍스트 표현을 융합하는 라이트 퓨전 전략의 효과성을 평가하기 위해.
  • 향후 SER 연구를 위한 생태학적으로 타당한 벤치마크를 제공하기 위해 실제 ASR 출력을 사용하고 이상화된 인간 텍스트가 아닌 자료를 사용하기 위해.

제안 방법

  • 원시 오디오에 대해 세 가지 현대적인 ASR 시스템(RNN-T, CTC, wav2vec)을 적용하여 ASR 텍스트를 생성하고, 골드 표준 번역과의 WER를 측정하였다.
  • 사전 훈련된 NLP 모델(BERT, DeepMoji, ELECTRA)을 사용하여 ASR 출력 및 골드 표준 텍스트에서 문맥 기반 텍스트 임베딩을 추출하였다.
  • 네 가지 음향 특징 추출 방법을 사용: openSMILE(ComParE 2016), BoAW(openXBOW에서 유래), DeepSpectrum(사전 훈련된 DenseNet121 사용), auDeep(오토인코더 기반 표현 학습).
  • 다양한 음향 및 언어적 특징 세트의 예측을 융합하기 위해 다수결 투표 방식의 라이트 퓨전을 적용하였다.
  • IEMOCAP 데이터셋의 개발 및 테스트 세트에서 개별 및 조합된 특징 세트의 성능을 평가하기 위해 종합적인 아블레이션 연구를 수행하였다.
  • 성능 평가에는 무작위 평균 재현율(UAR)을 사용하였으며, 다수의 구성에서 통계적 유의성을 평가하였다.

실험 결과

연구 질문

  • RQ1ASR 단어 오류률(WER)이 증가할수록 언어적 음성 정서 인식 성능에 어떤 영향을 미치는가?
  • RQ2음향 특징과 융합할 때, ASR 생성 텍스트와 골드 표준 텍스트 간의 SER 성능는 어떻게 비교되는가?
  • RQ3라이트 퓨전 환경에서 음향 및 언어적 특징 세트의 어떤 조합이 가장 높은 SER 성능를 제공하는가?
  • RQ4ASR 기반 및 골드 표준 텍스트 임베딩 간의 유사성이 초기 또는 후기 융합에서 성능 향상의 한계를 초래하는가?
  • RQ5목표 데이터셋에 대한 파라미터 튜닝 없이도 실제 ASR 출력을 사용하여 최신 기술 수준의 SER 성능를 달성할 수 있는가?

주요 결과

  • 골드 표준 텍스트는 언어적 단독 SER에서 일관되게 ASR 생성 텍스트를 앞섰으며, 낮은 WER일수록 더 높은 무작위 평균 재현율(UAR)과 명확한 상관관계를 보였다.
  • 고립된 상태에서는 성능가 낮았음에도 불구하고, 음향 특징과 융합되었을 때 ASR 기반 텍스트 특징은 여전히 긍정적인 기여를 하였으며, IEMOCAP 테스트 세트에서 73.8% UAR을 달성하였다.
  • 최고 성능을 보인 구성은 개발 세트에서 73.6% UAR, 테스트 세트에서 73.8% UAR를 기록하였으며, 이는 화자 독립적 IEMOCAP 평가 기준으로 새로운 최신 기술 수준(SOTA)을 나타내었다.
  • 모든 특징 세트(음향, GS-텍스트, ASR-텍스트)의 조합이 평균 UAR 66.2%와 최대 UAR 73.6%를 기록하여 다양한 표현 방식의 융합이 유의미한 이점을 제공함을 시사하였다.
  • ASR 기반 및 GS 기반 텍스트 특징의 융합은 GS-텍스트 단독 사용보다 성능 향상이 이루어지지 않았는데, 이는 높은 특징 유사성과 중복성 때문일 것이다.
  • 가장 높은 성능을 보인 융합 전략은 BERT, DeepMoji, auDeep 특징을 음향 표현과 융합한 것으로, 다중 모odal 및 다중 아키텍처 융합의 가치를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.