[논문 리뷰] Multimodal Speech Emotion Recognition and Ambiguity Resolution
본 논문은 경량의 수작업(hand-crafted) 특징 기반 ML 모델과 딥러닝을 멀티모달(오디오와 텍스트) 음성 감정 인식에서 IEMOCAP으로 비교하고, 간단한 ML 앙상블이 DL 방법에 버금갈 수 있으며 텍스트를 추가하면 성능이 향상된다는 것을 보여준다.
Identifying emotion from speech is a non-trivial task pertaining to the ambiguous definition of emotion itself. In this work, we adopt a feature-engineering based approach to tackle the task of speech emotion recognition. Formalizing our problem as a multi-class classification problem, we compare the performance of two categories of models. For both, we extract eight hand-crafted features from the audio signal. In the first approach, the extracted features are used to train six traditional machine learning classifiers, whereas the second approach is based on deep learning wherein a baseline feed-forward neural network and an LSTM-based classifier are trained over the same features. In order to resolve ambiguity in communication, we also include features from the text domain. We report accuracy, f-score, precision, and recall for the different experiment settings we evaluated our models in. Overall, we show that lighter machine learning based models trained over a few hand-crafted features are able to achieve performance comparable to the current deep learning based state-of-the-art method for emotion recognition.
연구 동기 및 목표
- 감정 정의가 모호하더라도 감정 인식 연구의 필요성을 제시한다.
- 동일한 특징으로 학습된 전통적 ML 모델과 DL 모델을 비교한다.
- 텍스트 모듈러리와 오디오+텍스트 융합이 감정 인식 정확도에 미치는 영향을 조사한다.
- IEMOCAP에서 오디오 단독, 텍스트 단독, 그리고 멀티모달 설정에서 모델을 평가한다.
- 멀티모달 SER에서 특징 중요도에 대한 통찰을 제공하고 향후 개선점을 논의한다.
제안 방법
- 8개의 수작업 시간 도메인 오디오 특징을 추출한다 (피치, 고조파, 에너지, 정지, 중심 모멘트).
- 텍스트 대본에서 TFIDF 특징을 계산한다.
- 동일한 오디오 특징을 사용하여 전통적 ML 분류기(RF, Gradient Boosting, SVM, Naive Bayes, 로지스틱 회귀)를 학습하고, DL 모델(MLP, LSTM)과 비교한다.
- RF, XGBoost, MLP를 결합한 간단한 앙상블 방법을 구현하고(MNB 및 LR를 포함한 확장 앙상블)
- 멀티모달 설정에서 오디오와 텍스트 특징을 간단한 연결(concatenation)로 융합한다.
- 세 가지 설정(오디오 단독, 텍스트 단독, 오디오+텍스트)에서 정확도, 정밀도, 재현율, F1-점수로 평가한다.
실험 결과
연구 질문
- RQ1IEMOCAP에서 여섯 가지 감정 분류를 대상으로 수작업 오디오 특징과 전통 ML 모델이 DL 모델과 어떻게 비교되는가?
- RQ2텍스트 데이터를 포함시키면 SER 성능이 향상되는가, 그리고 멀티모달 융합이 결과에 어떤 영향을 미치는가?
- RQ3감정 예측에 가장 기여하는 특징은 무엇이며, 융합이 모달리티별 애매성을 해결하는 데 도움이 되는가?
- RQ4감정 클래스 간 혼동에 대한 모달리티(오디오, 텍스트, 멀티모달)의 영향은 무엇인가?
- RQ5경량 모델이 이 작업에서 최첨단 DL 접근법에 근접하거나 이를 능가하는 성능을 낼 수 있는가?
주요 결과
- 8개의 오디오 특징으로 학습된 경량 ML 앙상블이 IEMOCAP에서 더 깊은 DL 모델과 비슷한 성능을 달성한다.
- 오디오 단독 결과에서 LSTM은 여러 설정에서 앙상블 E1에 비해 저조하며, 특히 중립 및 일부 근접한 감정 구분에서 그렇다.
- 텍스트 단독 모델이 좋은 성능을 보이며, TRE(텍스트 인코더)가 여섯 개 감정 클래스에서 견고하게 작동한다.
- 오디오+텍스트 융합은 단일 모달리티 모델에 비해 약 14%의 지표 개선을 보이며 강한 모달 간 정보 결합을 시사한다.
- 텍스트 특징은 화남과 행복을 올바르게 분류하는 데 도움을 주며, 오디오 특징은 슬픔 탐지를 개선한다.
- 8개 특징 중 고조파(harmonics)와 pause가 예측에 가장 중요한 오디오 특징으로 나타난다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.