Skip to main content
QUICK REVIEW

[논문 리뷰] Optimizing Speech Emotion Recognition using Manta-Ray Based Feature Selection

Soham Chattopadhyay, Arijit Dey|arXiv (Cornell University)|2020. 09. 18.
Speech and Audio Processing인용 수 8
한 줄 요약

이 논문은 멜 주파수 해상도 인자 계수(MFCC)와 선형 예측 부호화(LPC) 특징을 조합한 새로운 음성 정서 인식 프레임워크를 제안한다. 이후 특징 선택을 위해 물고기 떼 사냥 최적화(MFO) 알고리즘을 적용하여 비중복적이며 최적화된 특징 조합을 도출한다. 다층퍼셉트론(MLP) 분류기를 사용하여 SAVEE 데이터셋에서 97.49%의 최신 기술 수준의 정확도를 달성하였고, Emo-DB 데이터셋에서는 97.68%의 정확도를 기록하여, 최적화된 비중복 특징 조합을 통한 뛰어난 성능을 입증한다.

ABSTRACT

Emotion recognition from audio signals has been regarded as a challenging task in signal processing as it can be considered as a collection of static and dynamic classification tasks. Recognition of emotions from speech data has been heavily relied upon end-to-end feature extraction and classification using machine learning models, though the absence of feature selection and optimization have restrained the performance of these methods. Recent studies have shown that Mel Frequency Cepstral Coefficients (MFCC) have been emerged as one of the most relied feature extraction methods, though it circumscribes the accuracy of classification with a very small feature dimension. In this paper, we propose that the concatenation of features, extracted by using different existing feature extraction methods can not only boost the classification accuracy but also expands the possibility of efficient feature selection. We have used Linear Predictive Coding (LPC) apart from the MFCC feature extraction method, before feature merging. Besides, we have performed a novel application of Manta Ray optimization in speech emotion recognition tasks that resulted in a state-of-the-art result in this field. We have evaluated the performance of our model using SAVEE and Emo-DB, two publicly available datasets. Our proposed method outperformed all the existing methods in speech emotion analysis and resulted in a decent result in these two datasets with a classification accuracy of 97.06% and 97.68% respectively.

연구 동기 및 목표

  • 다양한 특징 추출 방법을 통합하여 음성 정서 인식(SER)에서의 중복적이고 최적화되지 않은 특징 문제를 해결하고자 한다.
  • 새로운 생물학적 흐름 기반 최적화 알고리즘인 물고기 떼 사냥 최적화(MFO)를 적용하여 가장 분류에 유용한 특징을 선별함으로써 분류 정확도를 향상시키고자 한다.
  • 기존 최신 기술 수준의 접근 방식과 비교하기 위해 표준 공개 데이터셋(SAVEE 및 Emo-DB)에서 제안된 방법의 성능을 검증하고자 한다.
  • 하이브리드 특징 표현(MFCC + LPC)과 메타휴리스틱 최적화를 조합하여 정서 인식 성능 향상을 위한 효과성을 탐색하고자 한다.
  • 다양한 분류기(KNN 및 MLP)와 데이터셋에서 모델의 강건성과 일반화 능력을 평가하고자 한다.

제안 방법

  • 음성 신호 전처리 및 음성 신호에서 MFCC와 LPC 특징을 추출하여 종합적인 특징 벡터를 구성한다.
  • MFCC와 LPC의 특징을 연결하여 고차원의 초기 특징 집합을 생성하며, 이는 스펙트럼적 특성과 선형 예측 특성을 모두 반영한다.
  • 물고기 떼 사냥 최적화(MFO) 알고리즘을 적용하여 연결된 특징 집합에서 가장 관련성 있고 비중복적인 특징을 선별함으로써 차원 감소를 이루되, 분류 능력은 유지한다.
  • 선별된 특징은 두 개의 은닉층(각각 5개 뉴런)을 가진 다층퍼셉트론(MLP) 분류기와 비교 평가를 위한 KNN 분류기(k=5)에 입력된다.
  • 모델 성능은 SAVEE 및 Emo-DB 데이터셋에서 5겹 교차검증을 통해 평가되며, 정확도, 정밀도, 재현도, F1 점수 등의 표준 지표를 사용한다.
  • MFO 기반 특징 선택의 우수성을 입증하기 위해 유전 알고리즘, 입자 군집 최적화, 회색 늑대 최적화와의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1MFCC와 LPC 특징의 연결이 음성 정서 인식 모델의 분류 능력을 향상시키는가?
  • RQ2물고기 떼 사냥 최적화(MFO) 알고리즘의 적용이 다른 메타휴리스틱 알고리즘에 비해 특징 선택 효율성과 분류 정확도 측면에서 더 우수한가?
  • RQ3기존 최신 기술 수준의 접근 방식과 비교하여 제안된 방법은 SAVEE 및 Emo-DB와 같은 표준 벤치마크 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ4MLP 분류기와 KNN 분류기를 사용할 경우 최적화된 특징 집합의 성능에 어떤 영향을 미치는가?
  • RQ5MFO를 통한 특징 차원 감소가 분류 정확도를 희생시키지 않으면서 모델 효율성을 얼마나 향상시키는가?

주요 결과

  • 제안된 방법은 MFO 기반 특징 선택을 사용한 MLP 분류기를 통해 SAVEE 데이터셋에서 최신 기술 수준의 분류 정확도 97.49%를 달성하였다.
  • Emo-DB 데이터셋에서는 97.68%의 분류 정확도를 기록하여 문헌에 보고된 모든 기존 방법을 초월하였다.
  • MFO 알고리즘이 SAVEE 데이터셋에서 43개, Emo-DB 데이터셋에서 61개의 특징만을 선별하여 차원 감소를 크게 이룩하면서도 높은 정확도를 유지하였다.
  • MLP 분류기가 KNN 분류기보다 우수했으며, Emo-DB에서 97.68%의 정확도, SAVEE에서 97.06%의 정확도를 기록하였고, 모든 폴드에서 F1 점수와 정밀도가 높았다.
  • 기타 최적화 알고리즘과 비교하여 MFO는 SAVEE에서 97.06%의 정확도, Emo-DB에서 97.68%의 정확도를 기록하며 가장 높은 정확도와 정밀도, 재현도를 확보했으며, 특히 Emo-DB에서 뛰어난 성능을 보였다.
  • 5겹 교차검증에서 다양한 폴드 간에 정확도, 정밀도, 재현도, F1 점수의 표준편차가 낮아 일관된 성능을 보이며 모델의 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.