Skip to main content
QUICK REVIEW

[논문 리뷰] Comparing the Accuracy of Deep Neural Networks (DNN) and Convolutional Neural Network (CNN) in Music Genre Recognition (MGR): Experiments on Kurdish Music

Aza Zuhair, Hossein Hassani|arXiv (Cornell University)|2021. 11. 22.
Music and Audio Processing인용 수 4
한 줄 요약

이 연구는 쿠르드 음악의 음악 장르 인식을 위해 딥 신경망(DNN)과 컨볼루션 신경망(CNN)을 평가한다. 8개의 장르에 걸쳐 총 880개의 30초짜리 오디오 샘플로 구성된 맞춤형 데이터셋을 사용하였다. CNN은 92%의 정확도를 기록하여 DNN의 90%를 능가했으며, 이는 저자원 음악 도메인에서 스펙트럼 패턴을 보다 효과적으로 포착할 수 있음을 보여주며 CNN의 우월성을 입증한다.

ABSTRACT

Musicologists use various labels to classify similar music styles under a shared title. But, non-specialists may categorize music differently. That could be through finding patterns in harmony, instruments, and form of the music. People usually identify a music genre solely by listening, but now computers and Artificial Intelligence (AI) can automate this process. The work on applying AI in the classification of types of music has been growing recently, but there is no evidence of such research on the Kurdish music genres. In this research, we developed a dataset that contains 880 samples from eight different Kurdish music genres. We evaluated two machine learning approaches, a Deep Neural Network (DNN) and a Convolutional Neural Network (CNN), to recognize the genres. The results showed that the CNN model outperformed the DNN by achieving 92% versus 90% accuracy.

연구 동기 및 목표

  • 쿠르드 음악은 문화적으로 중요한 장르이지만 연구가 부족한 분야이므로, 자동 음악 장르 인식 연구의 부족을 보완하고자 한다.
  • 훈련 및 평가를 위해 8개의 서로 다른 장르에 걸쳐 총 880개의 쿠르드 음악 샘플로 구성된 새로운 커리티드 데이터셋을 개발하고자 한다.
  • MFCC 특징을 사용하여 DNN 및 CNN 모델의 성능을 비교함으로써 쿠르드 음악 장르 분류 능력을 평가하고자 한다.
  • 데이터 세그먼트 길이와 모델 아키텍처가 분류 정확도에 미치는 영향을 조사하고자 한다.
  • 미래의 쿠르드 음악 정보 검색 및 추천 시스템 연구를 지원하기 위해 공개 가능한 고품질의 데이터셋과 훈련된 모델을 제공하고자 한다.

제안 방법

  • 다양한 출처(유튜브, 사운드클라우드, CD 등)에서 880개의 오디오 샘플을 수집하여 일관성을 확보하기 위해 WAV 형식으로 변환하였다.
  • Librosa(v0.8.1)를 사용하여 메르 주파수 세프스트랄 계수(MFCCs)를 추출하였으며, 이는 유일한 특징 표현 방식으로 사용되었다.
  • 각 30초짜리 오디오 파일을 30개의 1초 샘플로 분할하여 훈련 데이터 크기를 증가시켰으며, 데이터셋 크기와 세그먼트 길이 간 균형을 유지하였다.
  • 훈련, 검증, 테스트 세트에 걸쳐 장르 분포가 균일하도록 보장하기 위해 전략적 교차 검증(StratifiedKFold)을 사용하여 데이터셋을 분할하였다.
  • 에포크 수와 드롭아웃 정규화와 같은 다양한 초모델 하이퍼파라미터를 적용하여 DNN 및 CNN 모델을 훈련하고 평가하였다.
  • 초기 실험에서 관찰된 과적합을 완화하기 위해 최종 레이어에 0.3 드롭아웃 비율을 적용하였다.

실험 결과

연구 질문

  • RQ1MFCC 특징을 사용할 때 DNN와 CNN 모델이 쿠르드 음악 장르를 분류하는 데 있어 정확도에서 어떻게 비교되는가?
  • RQ2세그먼트 길이(예: 1초 대비 2.4초)가 쿠르드 음악의 음악 장르 인식 성능에 어떤 영향을 미치는가?
  • RQ3데이터 셔플링 및 교차 검증 전략은 저자원 음악 분류에서 모델의 일반화 능력과 과적합에 어떤 영향을 미치는가?
  • RQ4커스터마이징된 쿠르드 음악 데이터셋이 딥 러닝 모델을 사용하여 높은 분류 정확도를 달성할 수 있는가?
  • RQ5아키텍처 정규화(예: 드롭아웃)는 분할된 오디오 데이터로 훈련된 모델에서 과적합을 효과적으로 줄일 수 있는가?

주요 결과

  • CNN 모델은 동일한 데이터셋에서 92%의 테스트 정확도를 기록하여 DNN 모델의 90%를 뛰어넘었다.
  • CNN 모델은 DNN 모델 대비 낮은 손실(23%)을 기록하여 더 나은 일반화 능력과 더 적은 분류 오류를 보였다.
  • 다섯 번째 실험에서 1초 오디오 세그먼트와 30 에포크를 사용한 결과, 두 모델 모두 최고의 성능을 기록하였으며, 특히 CNN이 뛰어난 정확도를 유지하였다.
  • 0.3 드롭아웃 레이어를 추가함으로써 과적합이 효과적으로 제거되었으며, 최종 실험에서 훈련 정확도가 검증 정확도 이하로 떨어지는 것을 확인할 수 있었다.
  • 전략적 교차 검증(StratifiedKFold)을 사용함으로써 무작위 분할 대비 모델의 안정성 향상과 데이터 불균형 문제 감소가 이루어졌다.
  • 연구 결과, 더 긴 오디오 세그먼트(예: 2.4초)는 성능 향상에 기여할 수 있음을 확인하였지만, 데이터셋 크기 유지 및 과적합 방지를 위해 1초 세그먼트를 사용하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.