Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Scale MIDI-based Composer Classification

Qiuqiang Kong, Keunwoo Choi|arXiv (Cornell University)|2020. 10. 28.
Music and Audio Processing참고 문헌 26인용 수 6
한 줄 요약

이 논문은 거대한 MIDI 기반 작곡가 분류 시스템을 제안하며, GiantMIDI-Piano 데이터셋에서 유도된 프레임, 온셋, 속도 롤을 사용하여 컨volutional recurrent neural networks(CRNNs)를 활용해 최신 기술 수준의 성능을 달성한다. 실험 결과, 10명의 작곡가 분류 과제에서는 MIDI 표현 방식이 오디오 기반 로그 멜 스펙트로그램보다 우수한 성능(정확도: 0.739)을 보였으나, 100명의 작곡가 과제에서는 오디오 특징이 톤의 일반화 능력 덕분에 승리하였다.

ABSTRACT

Music classification is a task to classify a music piece into labels such as genres or composers. We propose large-scale MIDI based composer classification systems using GiantMIDI-Piano, a transcription-based dataset. We propose to use piano rolls, onset rolls, and velocity rolls as input representations and use deep neural networks as classifiers. To our knowledge, we are the first to investigate the composer classification problem with up to 100 composers. By using convolutional recurrent neural networks as models, our MIDI based composer classification system achieves a 10-composer and a 100-composer classification accuracies of 0.648 and 0.385 (evaluated on 30-second clips) and 0.739 and 0.489 (evaluated on music pieces), respectively. Our MIDI based composer system outperforms several audio-based baseline classification systems, indicating the effectiveness of using compact MIDI representations for composer classification.

연구 동기 및 목표

  • 클래식 피아노 음악을 중심으로 한 작곡가 분류를 위한 대규모 심볼릭 음악 데이터셋의 부족 문제를 해결하기 위해.
  • MIDI 기반 표현 방식이 작곡가 분류 과제에서 오디오 기반 특징보다 우월한지 조사하기 위해.
  • 딥 러닝 모델의 입력 표현으로서 프레임, 온셋, 속도 롤의 효과를 평가하기 위해.
  • MIDI 및 오디오 특징을 모두 사용하여 10명과 100명의 작곡가 분류 과제 간 성능을 비교하기 위해.
  • 모델의 혼동 패턴을 분석하고 분류 과정에서 작곡가별로 중요한 특징을 규명하기 위해.

제안 방법

  • 연구는 전사된 MIDI 파일에서 추출한 프레임 롤, 온셋 롤, 속도 롤을 입력 표현으로 사용하며, 각각 시간 프레임 T와 편도 88개인 편도 K에 해당하는 T×K 텐서 형식을 취한다.
  • 모델은 컨volutional 신경망(CNNs)과 컨볼루션 회귀 신경망(CRNNs)을 사용하여 구현되며, 후자는 국소적 특징 추출을 위한 CNN과 시간적 모델링을 위한 LSTM을 조합한다.
  • 오디오 기반 기준선은 표준 전처리를 거친 오디오 클립에서 계산된 로그-매그니튜드 멜 스펙트로그램(X_mel)을 입력으로 사용한다.
  • 시스템은 30초 클립과 전체 음악 조각을 대상으로 훈련 및 평가되며, 조각 단위 예측은 클립 수준의 예측을 평균화하여 도출된다.
  • 100명의 작곡가 분류 과제에서는 불균형 데이터셋에서의 공정성을 확보하기 위해 모든 작곡가에 대해 매크로 평균 정확도를 사용한다.
  • 훈련 및 평가는 10,854개의 MIDI 파일을 포함한 GiantMIDI-Piano 데이터셋을 기반으로 수행되었으며, 2,786명의 작곡가로부터 유래되었으며, 평가에는 30초 클립과 전체 조각이 사용되었다.

실험 결과

연구 질문

  • RQ1대규모 작곡가 분류 과제에서 MIDI 기반 표현 방식이 오디오 기반 표현 방식을 능가할 수 있는가?
  • RQ2프레임, 온셋, 속도 롤이 개별적으로나 조합하여 사용할 경우, 다양한 작곡가 집합에서 분류 정확도에 어떤 영향을 미치는가?
  • RQ3작곡가 수가 증가함에 따라(MIDI 기반 모델의 성능은 향상되거나 저하되는가? (10명 대비 100명))
  • RQ4어떤 작곡가가 가장 쉽게 또는 가장 어려운지 분류되며, 그 인식에 가장 기여하는 특징은 무엇인가?
  • RQ5모델 아키텍처(CNN 대비 CRNN)가 MIDI 및 오디오 입력에 대해 성능에 어떤 영향을 미치는가?

주요 결과

  • 프레임 + 온셋 + 속도 롤을 사용한 CRNN 모델이 전체 음악 조각 예측에서 10명의 작곡가 분류 과제에서 최고의 정확도 0.739를 기록하였다.
  • 30초 클립에서 MIDI 기반 CRNN 시스템은 10명의 작곡가 분류 과제에서 정확도 0.648을 기록하였으며, 이는 오디오 기반 CRNN(0.620)과 모든 다른 MIDI 설정보다 뛰어났다.
  • 100명의 작곡가 분류 과제에서는 오디오 기반 로그 멜 스펙트로그램이 모든 MIDI 표현 방식을 압도하여 CRNN 기반으로 0.385의 정확도를 기록하였고, 최고의 MIDI 시스템은 0.342의 정확도를 기록하였다.
  • 속도 롤의 포함은 일부 작곡가(예: 리스트)의 분류 성능을 향상시켰지만, 다른 작곡가(예: 바흐, 쇼팽)의 성능을 떨어뜨렸으며, 이는 작곡가별 특징의 관련성에 따라 다름을 시사한다.
  • 클립 수준의 출력을 평균화한 조각 단위 예측은 클립 단위 예측보다 정확도가 향상되었으며, 최고의 시스템은 10명의 작곡가 과제에서 0.739, 100명의 작곡가 과제에서 0.489의 정확도를 달성하였다.
  • 베를리너는 자주 숙제르트와 모차르트와 혼동되었으며, 한델과 J.S. 바흐는 공통된 바ロック 시대의 스타일적 특성으로 인해 높은 혼동률을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.