Skip to main content
QUICK REVIEW

[논문 리뷰] Bimodal Speech Emotion Recognition Using Pre-Trained Language Models

Verena Heußer, Niklas Freymuth|arXiv (Cornell University)|2019. 01. 01.
Emotion and Mood Recognition참고 문헌 68인용 수 9
한 줄 요약

이 논문은 사전 훈련된 언어 모델(BERT/XLNet)과 음성 정서 인식(SER)을 결합한 모듈러한 이중모달 프레임워크인 IEmoNet을 제안한다. 텍스트에 대해 언어 모델을 미세조정하고 별도의 SER 시스템과 통합함으로써, 제공된 번역문을 사용할 경우 IEMOCAP 데이터셋에서 73.5%의 정확도를 달성하고, 자동으로 번역된 입력을 사용할 경우 71.4%의 정확도를 기록하여 사전 훈련된 모델이 이중모달 정서 인식에 효과적임을 입증한다.

ABSTRACT

Speech emotion recognition is a challenging task and an important step towards more natural human-machine interaction. We show that pre-trained language models can be fine-tuned for text emotion recognition, achieving an accuracy of 69.5% on Task 4A of SemEval 2017, improving upon the previous state of the art by over 3% absolute. We combine these language models with speech emotion recognition, achieving results of 73.5% accuracy when using provided transcriptions and speech data on a subset of four classes of the IEMOCAP dataset. The use of noise-induced transcriptions and speech data results in an accuracy of 71.4%. For our experiments, we created IEmoNet, a modular and adaptable bimodal framework for speech emotion recognition based on pre-trained language models. Lastly, we discuss the idea of using an emotional classifier as a reward for reinforcement learning as a step towards more successful and convenient human-machine interaction.

연구 동기 및 목표

  • 음성 정서 인식 성능을 향상시키기 위해 사전 훈련된 언어 모델을 음성 특징과 통합한다.
  • 텍스트 및 음성 모듈을 별도로 훈련할 수 있도록 독립적이고 유연한 이중모달 정서 인식 프레임워크를 개발한다.
  • 강화 학습에서 정서 분류를 보상 신호로 사용하여 더 자연스러운 인간-기계 상호작용을 가능하게 한다.
  • 사전 훈련된 언어 모델의 텍스트 정서 인식 성능 평가 및 음성 기반 정서 인식과의 통합 방법을 탐색한다.
  • 다중모달 정서 인식에서 자동 음성 인식(ASR) 번역문과 기저 진술 번역문을 사용할 경우의 영향을 평가한다.

제안 방법

  • SemEval 2017 Task 4A 데이터셋에 대해 BERT와 XLNet을 텍스트 정서 인식을 위해 미세조정하여 69.5%의 정확도를 달성한다.
  • ASR, SER, TER 하위 모듈를 별도로 훈련할 수 있도록 독립적인 모듈러 프레임워크인 IEmoNet을 설계한다.
  • 미세조정된 사전 훈련된 언어 모델과 음성 정서 인식 모델을 공통의 분류 헤드를 사용하여 통합한다.
  • IEMOCAP 데이터셋에서 평가를 위해 10겹 교차검증을 수행하며, 제공된 번역문과 노이즈가 포함된 번역문을 모두 사용한다.
  • 과적합을 방지하고 효율성을 유지하기 위해 언어 모델의 분류 헤드와 일부 레이어만 훈련한다.
  • 네 가지 정서 클래스에 대해 가중 정확도(WA)와 무게 없음 정확도(UA)를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1BERT와 XLNet과 같은 사전 훈련된 언어 모델이 텍스트 정서 인식을 위해 효과적으로 미세조정 가능하며, 표준 벤치마크에서 성능 향상을 이끌 수 있는가?
  • RQ2사전 훈련된 언어 모델을 음성 정서 인식 모델과 통합할 경우 이중모달 환경에서 전체 분류 정확도에 어떤 영향을 미치는가?
  • RQ3기저 진술 번역문과 자동으로 생성된(노이즈가 있는) 번역문을 사용할 경우 다중모달 정서 인식 시스템에서 성능 차이가 발생하는가?
  • RQ4IEmoNet과 같은 모듈러 프레임워크는 전체 모델을 다시 훈련하지 않고도 효율적이고 영리하며 고성능의 이중모달 정서 인식을 가능하게 하는가?
  • RQ5자동 정서 인식을 강화 학습의 보상 신호로 사용하는 것이 대화 시스템의 성능 향상에 실현 가능한가?

주요 결과

  • SemEval 2017 Task 4A 데이터셋에 대해 BERT와 XLNet을 미세조정한 결과 69.5%의 정확도를 기록하여 이전 최고 성능을 3个百分点 이상 초월했다.
  • 제공된 번역문과 음성 데이터를 사용할 경우 IEmoNet은 IEMOCAP 데이터셋에서 BERT 기반 텍스트 모델링을 통해 73.5%의 가중 정확도를 달성했다.
  • 노이즈가 포함된 자동 번역 입력을 사용할 경우 71.4%의 가중 정확도를 기록하여 번역 오류에 대한 강건성을 입증했다.
  • 가장 높은 성능을 보인 SER 모델은 이중방향 LSTMs와 자기주의 주의(self-attention)의 하이브리드로, 128차원 주의 히든 벡터를 사용하여 IEMOCAP에서 63.8%의 무게 없음 정확도를 달성했다.
  • 분류 헤드와 언어 모델의 일부 레이어만 미세조정한 결과, 엔드 투 엔드 미세조정보다 더 좋은 성능을 기록했으며, 이는 큰 사전 훈련된 모델의 영향력이 우세하기 때문일 것이다.
  • IEmoNet의 모듈러 설계 덕분에 전체 시스템을 다시 훈련하지 않고도 텍스트 및 음성 모듈를 즉시 교체할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.