Skip to main content
QUICK REVIEW

[논문 리뷰] Emotion Recognition From Speech With Recurrent Neural Networks

V. K. Chernykh, Prikhodko, Pavel|arXiv (Cornell University)|2017. 01. 27.
Speech and Audio Processing참고 문헌 32인용 수 127
한 줄 요약

이 논문은 말에서 감정을 인식하기 위해 CTC 손실이 있는 순환 신경망(RNN) 접근법을 제시하고, IEMOCAP에서 평가하며 baselines 및 인간 성능과 비교합니다.

ABSTRACT

In this paper the task of emotion recognition from speech is considered. Proposed approach uses deep recurrent neural network trained on a sequence of acoustic features calculated over small speech intervals. At the same time special probabilistic-nature CTC loss function allows to consider long utterances containing both emotional and neutral parts. The effectiveness of such an approach is shown in two ways. Firstly, the comparison with recent advances in this field is carried out. Secondly, human performance on the same task is measured. Both criteria show the high quality of the proposed method.

연구 동기 및 목표

  • 長 언어 속에서 감정이 국소화될 수 있는 상황에서 감정 인식의 어려움을 다룬다.
  • 프레임 수준 특징을 uttterance 수준의 감정 라벨에 맞추기 위해 CTC 손실이 있는 깊은 순환 신경망을 활용한다.
  • 발화자 독립 교차 검증 하에서 프레임 단위 및 한 레이블 기준선과 비교하며 CTC 기반 시퀀스-투-시퀀스 학습을 검증한다.
  • 제안된 방법의 품질을 동일한 작업에서 인간 성능과 비교하여 평가한다.

제안 방법

  • 오디오를 200 ms 프레임으로 전처리하고 100 ms 중복을 가지며 프레임당 34개의 음향 특징(MFCC, 크로마, 에너지 등)을 추출한다.
  • NULL를 포함한 확장된 레이블 세트에 대한 확률을 출력하기 위한 Bi-directional LSTM 기반 신경망을 사용한다.
  • 정렬되지 않은 긴 입력 시퀀스를 다루고 감정 라벨의 시퀀스를 생성하기 위해 Connectionist Temporal Classification (CTC) 손실로 학습한다.
  • 사운드 스피커 독립성을 보장하기 위해 그룹화된 교차 검증 하에서 프레임 단위 및 한 레이블 기준선과 비교한다.
  • 클래스 불균형을 다루기 위해 전체 정확도와 평균 클래스 정확도를 평가한다.

실험 결과

연구 질문

  • RQ1CTC 기반 RNN 모델이 긴 음성 시퀀스에서 프레임 수준의 음향 특징으로부터 uttterance 수준의 감정을 정확히 인식할 수 있는가?
  • RQ2IEMOCAP 데이터셋에서 발화자 독립 평가 하에 CTC 접근법은 프레임 단위 및 한 레이블 기준선과 어떻게 비교되는가?
  • RQ3인간 평가자 간의 주관성과 라벨 일관성이 모델 성능에 어떤 영향을 주는가?
  • RQ4기계의 성능이 감정 인식 태스크에서 인간 성능에 얼마나 근접했는가?

주요 결과

  • CTC는 54%의 전체 정확도와 54%의 평균 클래스 정확도를 달성하여 프레임 단위(45%/41%) 및 한 레이블(51%/49%) 기준선보다 우수하고 인간 성능(69%/70%)에 근접합니다.
  • 프레임 단위 기준선은 더 긴 uttterance에서 불안정성을 보이는 반면, CTC는 견고한 성능을 유지합니다.
  • 인간 평가자는 모델보다 높은 정확도를 달성하여 감정 라벨링의 주관적 측면과 개선 여지를 강조합니다.
  • 모델의 오류 패턴은 인간의 라벨링 불일치와 부분적으로 일치하여 모델이 인간과 유사한 지각 단서를 포착함을 시사합니다.
  • 본 접근법은 말에서 CTC를 이용한 끝-to-끝 시퀀스 모델링의 가능성을 보여줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.