Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating Multi-Feature Selection and Ensembling for Audio Classification

Muhammad Turab, Teerath Kumar|arXiv (Cornell University)|2022. 06. 15.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 다양한 딥러닝 모델(CNN, EfficientNet, MobileNet)을 사용하여 세 가지 음성 특징(Mel 스펙트로그램, 멜 주파수 해석 계수(MFCC), 제로 크로싱 레이트(ZCR))를 조합함으로써 음성 분류에 다중 특징 앙상블을 조사한다. 세 가지 말하기 숫자 데이터셋에서의 결과는 높은 성능을 보이는 개별 특징—주로 Mel 스펙트로그램과 MFCC—만을 앙상블하는 것이 단일 특징이나 전체 특징 앙상블보다도 뛰어난 정확도와 효율성을 달성함을 보여준다.

ABSTRACT

Deep Learning (DL) algorithms have shown impressive performance in diverse domains. Among them, audio has attracted many researchers over the last couple of decades due to some interesting patterns--particularly in classification of audio data. For better performance of audio classification, feature selection and combination play a key role as they have the potential to make or break the performance of any DL model. To investigate this role, we conduct an extensive evaluation of the performance of several cutting-edge DL models (i.e., Convolutional Neural Network, EfficientNet, MobileNet, Supper Vector Machine and Multi-Perceptron) with various state-of-the-art audio features (i.e., Mel Spectrogram, Mel Frequency Cepstral Coefficients, and Zero Crossing Rate) either independently or as a combination (i.e., through ensembling) on three different datasets (i.e., Free Spoken Digits Dataset, Audio Urdu Digits Dataset, and Audio Gujarati Digits Dataset). Overall, results suggest feature selection depends on both the dataset and the model. However, feature combinations should be restricted to the only features that already achieve good performances when used individually (i.e., mostly Mel Spectrogram, Mel Frequency Cepstral Coefficients). Such feature combination/ensembling enabled us to outperform the previous state-of-the-art results irrespective of our choice of DL model.

연구 동기 및 목표

  • 다양한 딥러닝 모델과 데이터셋에서 다양한 음성 특징 조합이 딥러닝 모델 성능에 미치는 영향을 조사하는 것.
  • 다양한 딥러닝 아키텍처를 통해 다중 음성 특징(Mel 스펙트로그램, MFCC, ZCR)을 앙상블하는 것의 효과성을 평가하는 것.
  • 개별 특징과 비교했을 때 특징 앙상블이 분류 정확도와 추론 효율성을 향상시키는지 확인하는 것.
  • 특히 말하기 숫자 분류에 있어 다양한 데이터셋과 모델 간에 일반화 가능한 최적의 특징 조합을 규명하는 것.
  • 향후 음성 특징 앙상블 및 음성 분류를 위한 딥러닝 연구를 지원하기 위해 코드와 훈련된 모델을 공개하는 것.

제안 방법

  • 원시 음성 신호에서 최신의 세 가지 음성 특징—Mel 스펙트로그램(MS), 멜 주파수 해석 계수(MFCC), 제로 크로싱 레이트(ZCR)—를 추출하였다.
  • 각 특징을 개별적으로 사용하여 세 가지 딥러닝 모델—합성곱 신경망(CNN), EfficientNetB0, MobileNetV1—을 훈련하고 평가하였다.
  • 다양한 특징의 특징맵을 연결함으로써 동일한 모델에 입력하는 방식으로 특징 앙상블을 구현하였다(예: MS + MFCC, MS + MFCC + ZCR).
  • 기준 훈련 및 검증 프로토콜을 사용하여 세 가지 벤치마크 데이터셋—Free Spoken Digits Dataset(FSD), Audio Urdu Digits Dataset(AUDD), Audio Gujarati Digits Dataset(AGDD)—에서 실험하였다.
  • 정확도(평균 ± 표준편차)와 추론 시간(ms)을 측정하여 성능의 효과성과 효율성을 평가하였다.
  • 모든 특징 조합과 모델에 대해 추론 분석을 수행하여 최적의 구성 요건을 규명하였으며, 검증 정확도 곡선을 통해 에포크 수에 따른 학습 동역학을 시각화하였다.

실험 결과

연구 질문

  • RQ1다양한 딥러닝 모델과 데이터셋에서 개별 음성 특징(MS, MFCC, ZCR) 중 어느 것이 가장 높은 분류 정확도를 달성하는가?
  • RQ2다중 음성 특징 앙상블이 일관되게 모델 성능을 향상시키는가, 아니면 성능 저하를 초래할 수 있는가?
  • RQ3특정 특징 조합이 음성 분류에서 다양한 모델과 데이터셋 간에 잘 일반화되는가?
  • RQ4특징 앙상블이 추론 시간과 모델 효율성에 어떤 영향을 미치는가?
  • RQ5특징 선택 및 앙상블에 대한 체계적인 접근 방식이 말하기 숫자 분류 분야에서 최신 기술 성능을 초월할 수 있는가?

주요 결과

  • Mel 스펙트로그램(MS)과 멜 주파수 해석 계수(MFCC)는 모든 모델과 데이터셋에서 가장 높은 정확도를 달성했으며, MS는 일관되게 MFCC를 뛰어나거나 동등한 성능을 보였다.
  • 제로 크로싱 레이트(ZCR)는 모든 모델에서 성능을 심각하게 떨어뜨렸으며, 구자라트 데이터셋에서 EfficientNetB0의 정확도가 최소 0.321까지 하락하였다.
  • 모든 세 가지 특징(MS, MFCC, ZCR)을 앙성한 결과는 MS와 MFCC만 앙성한 결과보다 일관되게 열등했으며, 저성능 특징을 추가할 경우 전체 성능이 악화됨을 시사한다.
  • 가장 높은 성능을 보인 구성은 MS와 MFCC를 앙성한 것으로, MobileNetV1을 사용하여 Free Spoken Digits Dataset에서 0.987 ± 0.05의 정확도를 달성하였으며, 이는 이전 최고 성능 기록을 초월하였다.
  • MobileNetV1에 MS와 MFCC 조합을 적용한 결과, 0.63 ms의 추론 시간에 0.987 ± 0.05의 정확도를 달성하여 높은 효율성을 입증하였다.
  • 검증 곡선은 MS와 MFCC는 안정적인 학습 동역학을 보였지만, ZCR은 특히 더 큰 모델인 EfficientNet에서 불안정성을 유발하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.