Skip to main content
QUICK REVIEW

[논문 리뷰] Audio Classical Composer Identification by Deep Neural Network

Zhen Hu, Kun Fu|arXiv (Cornell University)|2013. 01. 15.
Music and Audio Processing참고 문헌 16인용 수 6
한 줄 요약

이 논문은 깊이 있는 표현 학습을 통해 작곡가 간의 특징 분리 성능을 향상시키기 위해 딥 벨리프 네트워크(DBN)와 스택드 노이즈 제거 오토인코더(SDA)를 조합한 하이브리드 딥 러닝 모델을 제안한다. 이 모델은 MIREX의 데이터와 유사한 크기의 자체 구축한 데이터셋에서 76.26%의 정확도를 달성한다.

ABSTRACT

Audio Classical Composer Identification (ACC) is an important problem in Music Information Retrieval (MIR) which aims at identifying the composer for audio classical music clips. The famous annual competition, Music Information Retrieval Evaluation eXchange (MIREX), also takes it as one of the four training&testing tasks. We built a hybrid model based on Deep Belief Network (DBN) and Stacked Denoising Autoencoder (SDA) to identify the composer from audio signal. As a matter of copyright, sponsors of MIREX cannot publish their data set. We built a comparable data set to test our model. We got an accuracy of 76.26% in our data set which is better than some pure models and shallow models. We think our method is promising even though we test it in a different data set, since our data set is comparable to that in MIREX by size. We also found that samples from different classes become farther away from each other when transformed by more layers in our model.

연구 동기 및 목표

  • 음악 정보 검색(MIR) 분야에서 핵심 과제인 오디오 클립으로부터 고전 음악 작곡가를 식별하는 문제를 해결하기 위해.
  • 원시 오디오 신호로부터 강건하고 계층적인 표현을 학습할 수 있는 딥 러닝 모델을 개발하기 위해.
  • MIREX 데이터는 저작권 제약이 있어 자체 구축한 데이터셋을 활용해 모델을 평가하기 위해.
  • 더 깊은 아키텍처가 학습된 특징 공간에서 클래스 간 분리 성능을 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 계층적 특징 학습을 위해 딥 벨리프 네트워크(DBN)와 스택드 노이즈 제거 오토인코더(SDA)를 스택하여 하이브리드 아키텍처를 구성한다.
  • DBN은 원시 오디오 특징을 대상으로 거칠게 단계별로 학습하여 초기 표현을 학습한다.
  • SDA는 손상된 입력 특징을 재구성함으로써 모델의 강건성과 일반화 능력을 향상시킨다.
  • 최종 모델은 소프트맥스 레이어를 통해 학습된 계층적 특징을 사용해 작곡가 분류를 수행한다.
  • 모델은 MIREX 데이터의 크기와 복잡도를 모방하기 위해 자체 구축한 데이터셋에서 엔드 투 엔드로 훈련된다.
  • 특징 공간 분석 결과, 네트워크의 깊이가 증가할수록 작곡가 간의 클래스 간 거리가 증가함을 확인했다.

실험 결과

연구 질문

  • RQ1DBN과 SDA를 조합한 하이브리드 딥 러닝 모델이 오디오 신호로부터 고전 음악 작곡가를 효과적으로 식별할 수 있는가?
  • RQ2비-MIREX 데이터셋에서 제안된 모델의 성능은 순수하거나 浅층 모델에 비해 어떻게 비교되는가?
  • RQ3모델의 더 깊은 아키텍처가 서로 다른 작곡가의 특징을 더 잘 분리하는가?
  • RQ4모델이 공식적으로 MIREX에서 발표하지 않은 데이터셋으로도 일반화 가능한가?
  • RQ5특징 표현 공간이 깊이에 따라 어떻게 변화하는가? 특히 클래스 간 거리 측면에서.

주요 결과

  • 제안된 하이브리드 DBN-SDA 모델은 자체 구축한 데이터셋에서 76.26%의 정확도를 달성했으며, 여러 순수 및 얕은 모델보다 뛰어난 성능을 보였다.
  • 비-MIREX 데이터셋에서도 테스트한 결과 모델의 성능이 유망하게 나타나, 이식 가능성 잠재력을 보였다.
  • 모델의 더 깊은 층에서는 작곡가 간의 클래스 간 거리가 증가하여, 작곡가 간 특징의 구분 능력 향상이 확인되었다.
  • 모델의 아키텍처는 작곡가 분류 성능 향상을 위해 효과적으로 계층적 표현을 학습하고 있었다.
  • 공식 MIREX 데이터 없이도 자체 구축한 데이터셋에서의 성능이 모델의 실용성과 타당성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.