[논문 리뷰] An Ensemble 1D-CNN-LSTM-GRU Model with Data Augmentation for Speech Emotion Recognition
이 논문은 데이터 증강 기법을 활용하여 1D-CNN, LSTM, GRU 아키텍처를 조합한 앙상블 딥 러닝 모델을 제안한다. 국소적 특징을 추출하는 블록(LFAB)을 활용하여 확장된 컨볼루션, 배치 정규화, 최대 풀링을 적용하고, LSTM 및 GRU를 통해 장기적 시계열 모델링을 구현함으로써, 수작업으로 추출한 음성 특징과 노이즈/피치/스트레칭 증강 기법을 사용하여 과적합을 줄이고, 다섯 가지 벤치마크 데이터셋(TESS, EMO-DB, RAVDESS, SAVEE, CREMA-D)에서 최신 기술 수준의 가중 평균 정확도를 달성한다.
In this paper, we propose an ensemble of deep neural networks along with data augmentation (DA) learned using effective speech-based features to recognize emotions from speech. Our ensemble model is built on three deep neural network-based models. These neural networks are built using the basic local feature acquiring blocks (LFAB) which are consecutive layers of dilated 1D Convolutional Neural networks followed by the max pooling and batch normalization layers. To acquire the long-term dependencies in speech signals further two variants are proposed by adding Gated Recurrent Unit (GRU) and Long Short Term Memory (LSTM) layers respectively. All three network models have consecutive fully connected layers before the final softmax layer for classification. The ensemble model uses a weighted average to provide the final classification. We have utilized five standard benchmark datasets: TESS, EMO-DB, RAVDESS, SAVEE, and CREMA-D for evaluation. We have performed DA by injecting Additive White Gaussian Noise, pitch shifting, and stretching the signal level to generalize the models, and thus increasing the accuracy of the models and reducing the overfitting as well. We handcrafted five categories of features: Mel-frequency cepstral coefficients, Log Mel-Scaled Spectrogram, Zero-Crossing Rate, Chromagram, and statistical Root Mean Square Energy value from each audio sample. These features are used as the input to the LFAB blocks that further extract the hidden local features which are then fed to either fully connected layers or to LSTM or GRU based on the model type to acquire the additional long-term contextual representations. LFAB followed by GRU or LSTM results in better performance compared to the baseline model. The ensemble model achieves the state-of-the-art weighted average accuracy in all the datasets.
연구 동기 및 목표
- 앙상블 프레임워크를 통해 다수의 딥 네트워크 아키텍처를 조합하여 음성 정서 인식 정확도를 향상시키는 것.
- 추가 백색 가우시안 노이즈, 피치 시프팅, 신호 스트레칭과 같은 효과적인 데이터 증강 기법을 통해 과적합을 완화하고 모델 일반화 능력을 향상시키는 것.
- 확장된 1D 컨볼루션, 배치 정규화, 최대 풀링을 갖춘 새로운 국소적 특징 추출 블록(LFAB)을 통해 음성 신호로부터 강건한 국소적 및 장기적 시계열 특징을 추출하는 것.
- TESS, EMO-DB, RAVDESS, SAVEE, CREMA-D와 같은 다양한 표준 벤치마크 데이터셋에서 모델 성능을 평가하는 것.
- 하이브리드 아키텍처(1D-CNN + LSTM/GRU)가 정서 분류를 위한 국소적 및 순차적 음성 패턴을 더 잘 포착할 수 있음을 입증하는 것.
제안 방법
- 모델는 순차적인 확장된 1D 컨볼루션 레이어, 최대 풀링, 배치 정규화로 구성된 국소적 특징 추출 블록(LFAB)을 활용하여 원시 음성에서 계층적 국소적 특징을 추출한다.
- 세 가지 별도의 모델을 구성한다: 완전 연결 레이어만을 사용하는 모델, GRU를 사용하는 모델, LSTM을 사용하는 모델로, 각각 LFAB가 추출한 특징을 처리하여 장기적 의존성을 모델링한다.
- 세 모델의 출력을 가중 평균하는 앙상블 전략을 적용하여 최종 분류 성능을 향상시킨다.
- 다섯 가지 수작업 특징—메르 주파수 cepstral 계수, 로그 메르 스펙트로그램, 제로 크로싱 레이트, 크로마그램, 루트 평균 제곱 에너지—을 추출하여 LFAB 블록의 입력으로 사용한다.
- 추가 백색 가우시안 노이즈, 피치 시프팅, 시간 스트레칭을 통해 데이터 증강을 적용하여 훈련 데이터의 다양성을 높이고 과적합을 줄인다.
- 앙상블 출력에 소프트맥스 레이어를 적용하여 최종 분류를 수행하며, 모델 가중치는 표준 역전파 알고리즘을 통해 최적화한다.
실험 결과
연구 질문
- RQ11D-CNN, LSTM, GRU 모델의 앙상블은 개별 아키텍처에 비해 음성 정서 인식 정확도를 향상시킬 수 있는가?
- RQ2확장된 컨볼루션을 갖춘 국소적 특징 추출 블록(LFAB)의 통합은 음성 신호로부터 특징 추출을 향상시키는가?
- RQ3노이즈 주입, 피치 시프팅, 시간 스트레칭을 통한 데이터 증강이 음성 정서 인식에서 모델 일반화 능력 향상과 과적합 감소에 어느 정도 기여하는가?
- RQ4동일한 특징 추출 기반 아키텍처에서 LSTM과 GRU의 다양한 조합이 다양한 음성 정서 데이터셋에서 성능에 어떤 영향을 미치는가?
- RQ5제안된 앙상블 모델은 TESS, EMO-DB, RAVDESS, SAVEE, CREMA-D를 포함한 다수의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하는가?
주요 결과
- 앙상블 모델은 TESS, EMO-DB, RAVDESS, SAVEE, CREMA-D 등 다섯 가지 벤치마크 데이터셋에서 최신 기술 수준의 가중 평균 정확도를 달성한다.
- LFAB 이후에 GRU 또는 LSTM을 사용한 모델는 반복 레이어가 없는 베이스라인 모델보다 성능이 뛰어나, 장기적 시계열 의존성 모델링의 중요성을 입증한다.
- 데이터 증강은 과적합을 크게 줄이고 일반화 능력을 향상시키며, 특히 SAVEE와 CREMA-D와 같은 작은 데이터셋에서 두드러진 효과를 보인다.
- 메르 주파수 cepstral 계수, 로그 메르 스펙트로그램, 제로 크로싱 레이트, 크로마그램, RMS 에너지 등 수작업 특징의 사용은 모델 성능 향상에 효과적임을 입증한다.
- 가중 평균 앙상블 전략은 세 모델의 예측을 효과적으로 통합하여 단일 모델보다 더 강건하고 정확한 분류를 이룬다.
- RAVDESS 데이터셋에서 기존 최신 기술 수준의 방법보다 높은 보고된 정확도를 달성하였으며, 가중 평균 정확도가 이를 초월한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.