Skip to main content
QUICK REVIEW

[논문 리뷰] Symbolic Music Data Version 1.0

Christian Walder|arXiv (Cornell University)|2016. 06. 08.
Music and Audio Processing참고 문헌 4인용 수 3
한 줄 요약

이 논문은 클래식 아카이브에서 수집한 19,700개의 정제되고 사전처리된 MIDI 파일을 바탕으로 한 Symbolic Music Data Version 1.0을 소개한다. 이 데이터셋은 틱 단위의 노트 시작/종료 시간을 통해 상징적 음악을 표현한다. 저자들은 저품질 파일을 제외하기 위해 확률적 필터링 모델을 적용하고, 서명 벡터를 기반으로 계층적 군집화를 사용하여 학습/검증/테스트 분할을 수행하며, 기존 피아노롤 형식보다 더 정확하게 음역과 다성성을 반영하는 개선된 표현 방식을 제공한다.

ABSTRACT

In this document, we introduce a new dataset designed for training machine learning models of symbolic music data. Five datasets are provided, one of which is from a newly collected corpus of 20K midi files. We describe our preprocessing and cleaning pipeline, which includes the exclusion of a number of files based on scores from a previously developed probabilistic machine learning model. We also define training, testing and validation splits for the new dataset, based on a clustering scheme which we also describe. Some simple histograms are included.

연구 동기 및 목표

  • 기계학습 모델 훈련을 위한 고품질, 대규모 상징적 음악 데이터셋을 구축하기 위해.
  • 기존 피아노롤 표현 방식의 한계를 해결하기 위해 이진 상태가 아닌 명시적인 노트 발화 및 종료 시점을 모델링하기 위해.
  • 동일한 음악 작품의 여러 버전이 존재할 경우 통계적 종속성과 데이터 泄露를 최소화하기 위해 음악적 내용 기반으로 파일을 군집화하여 데이터 분할 전략을 수립하기 위해.
  • 학습된 확률적 모델을 활용해 저품질 또는 손상된 MIDI 파일을 제거함으로써 데이터 품질을 향상시키기 위해.
  • 정확한 시간적 노트 경계를 유지함으로써 다성 음악과 표현적 템포의 모델링을 더 정확하게 구현하기 위해.

제안 방법

  • 클래식 아카이브에서 수집한 20,006개의 MIDI 파일에서 유래한 데이터셋으로, 히وري스틱 필터링 점수에 의해 306개가 제외됨.
  • 필터링 점수는 사전 학습된 모델 기반의 음성 확률의 음수 로그 평균에 표준 오차를 더한 값으로 계산되며, 저품질 파일을 식별하기 위해 사용됨.
  • 지속pedal 효과를 처리하고 동일 채널에서 겹치거나 중복된 음표를 제거하기 위해 음표 이벤트를 처리함.
  • 피아노 연주 모델링과의 일관성을 확보하기 위해 드럼 트랙 및 두 개 이하의 음표를 가진 채널은 제거됨.
  • 모든 소스 데이터셋에서 공통되는 해상도인 1분당 2400 틱으로 시간을 재샘플링하여 시간 표현을 표준화함.
  • 각 파일의 서명 벡터는 정규화된 피치 클래스 히스토그램과 양자화된 음표 지속시간에서 유도되며, 계층적 군집화에 사용되어 데이터 분할을 구성함.

실험 결과

연구 질문

  • RQ1피아노롤 표현 방식에 비해 더 높은 시간 정밀도를 확보한 대규모 상징적 음악 데이터셋을 어떻게 구성할 수 있는가?
  • RQ2원본 파일에 접근할 수 없는 대규모 아카이브에서 저품질 또는 손상된 MIDI 파일을 효과적으로 필터링할 수 있는 방법은 무엇인가?
  • RQ3동일한 음악 작품의 여러 버전이 존재할 경우, 통계적 종속성을 최소화하기 위해 데이터 분할을 어떻게 설계할 수 있는가?
  • RQ4기존 형식에 비해 새로운 표현 방식이 표현적 템포와 다성 구조를 얼마나 잘 유지하는가?
  • RQ5기존 데이터셋에서 학습된 확률적 모델이 새로운 대규모 코퍼스에서 저품질 파일을 효과적으로 식별하고 제거할 수 있는가?

주요 결과

  • 저자들은 사전 학습된 필터링 점수 기반으로 원본 20,006개의 파일 중 306개를 제외하고 19,700개의 고품질 MIDI 파일로 구성된 데이터셋을 성공적으로 정제함.
  • 음성 확률의 음수 로그와 표준 오차를 기반으로 한 필터링 방법은 听음 테스트를 통해 검증되었으며, 저품질 파일을 효과적으로 식별함.
  • 계층적 군집화 기반의 분할 전략은 연속적이고 내용이 유사한 청크로 이루어진 학습, 검증, 테스트 세트를 생성하여 데이터 泄露를 감소시킴.
  • CMA 데이터셋은 최대 46개의 파트를 포함하고 있어 라벨의 '바르사 뉘아르 데 산티멘탈레'와 홀스트의 '베누스'와 같은 복잡한 다성 음악을 반영함.
  • 기존 피아노롤 형식에 비해 새로운 표현 방식은 음표 지속시간과 다성성을 더 정확하게 반영하여 표현적 연주 모델링에 더 유리함.
  • 데이터셋은 표준화된 1분당 2400 틱 해상도로 제공되어 모든 모델 간의 호환성을 확보하고 양자화 오차를 최소화함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.