[논문 리뷰] Towards multi-instrument drum transcription
이 논문은 대규모 합성 데이터셋을 도입하고, 표준 3개의 드럼(스네어, 베이스드럼, 하이햇)을 초월하여 다중 악기 드럼 편집을 가능하게 하기 위해 컨볼루션 신경망과 컨볼루션 순환 신경망(CRNN)을 훈련한다. 이로 인해 실제 음원 데이터에 대한 일반화 능력이 향상된다. 주요 기여는 8개 및 18개 드럼 악기 클래스를 지원하는 공개 가능하고 균형 잡힌 합성 데이터셋과 훈련된 모델이며, 톰스와 심벌과 같은 소수의 악기들에 대한 성능 향상이 이루어졌다.
Automatic drum transcription, a subtask of the more general automatic music transcription, deals with extracting drum instrument note onsets from an audio source. Recently, progress in transcription performance has been made using non-negative matrix factorization as well as deep learning methods. However, these works primarily focus on transcribing three drum instruments only: snare drum, bass drum, and hi-hat. Yet, for many applications, the ability to transcribe more drum instruments which make up standard drum kits used in western popular music would be desirable. In this work, convolutional and convolutional recurrent neural networks are trained to transcribe a wider range of drum instruments. First, the shortcomings of publicly available datasets in this context are discussed. To overcome these limitations, a larger synthetic dataset is introduced. Then, methods to train models using the new dataset focusing on generalization to real world data are investigated. Finally, the trained models are evaluated on publicly available datasets and results are discussed. The contributions of this work comprise: (i.) a large-scale synthetic dataset for drum transcription, (ii.) first steps towards an automatic drum transcription system that supports a larger range of instruments by evaluating and discussing training setups and the impact of datasets in this context, and (iii.) a publicly available set of trained models for drum transcription. Additional materials are available at http://ifs.tuwien.ac.at/~vogl/dafx2018
연구 동기 및 목표
- 기존 자동 드럼 편집 시스템이 스네어, 베이스드럼, 하이햇이라는 세 가지 주요 드럼 악기만 처리하는 데에 한계가 있다는 문제를 해결하기 위해.
- 4197개의 트랙(~259시간)으로 구성된 대규모이고 균형 잡힌 합성 데이터셋을 기반으로 훈련하여 실제 음원 데이터에 대한 일반화 능력을 향상시키기 위해.
- 데이터셋 구성, 클래스 균형, 훈련 전략이 여러 악기 클래스에 걸쳐 편집 성능에 미치는 영향을 평가하기 위해.
- 미래의 다중 악기 드럼 편집 연구를 위해 공개 가능한 훈련된 모델 및 데이터셋을 제공하기 위해.
제안 방법
- 다중 드럼 악기의 온셋 활성화를 동시에 예측하기 위해 엔드 투 엔드 컨볼루션 및 컨볼루션 순환 신경망(CRNN)을 훈련하기 위해.
- General MIDI 매핑을 사용하여 8개 및 18개 드럼 악기 클래스를 포함하는 4197개 트랙과 약 ~259시간의 오디오를 포함한 합성 데이터셋을 생성하기 위해.
- 톰스와 심벌과 같은 소수의 악기들에 대한 성능 향상을 위해 클래스 불균형을 줄이기 위한 데이터 균형 기법을 적용하기 위해.
- 모든 대상 악기를 동시에 편집할 수 있도록 단일 모델을 사용하는 다중 작업 훈련 설정을 적용하여 파라미터 효율성과 일반화 능력을 향상시키기 위해.
- 공개 데이터셋(예: ENST, MAESTRO)에서 모델 성능을 평가하여 교차 데이터셋 일반화 능력과 강건성을 평가하기 위해.
- 가짜 혼동 행렬을 통해 오류 패턴을 분석하여 유사한 소리를 내는 악기들(예: BD/LT, CHH/PHH) 간의 오분류를 식별하기 위해.
실험 결과
연구 질문
- RQ1표준 3개의 악기(스네어, 베이스드럼, 하이햇)를 초월하여 최대 18개의 악기 클래스를 효과적으로 편집할 수 있는 단일 딥 러닝 모델이 가능한가?
- RQ2실제 음원 데이터셋만으로 훈련하는 것과 비교해, 대규모 합성 및 균형 잡힌 데이터셋으로 훈련하면 실제 음원 오디오에 대한 일반화 능력이 어떻게 향상되는가?
- RQ3데이터 균형 및 혼합 훈련 전략(예: 합성 데이터에서 사전 훈련한 후 실제 데이터로 보완 훈련)이 소수의 악기 클래스에 대한 성능에 어떤 영향을 미치는가?
- RQ4편집 오류 패턴은 악기 클래스 간에 어떻게 달라지며, 이는 악기의 청각적 유사성과 레이블링의 모호성에 대해 어떤 통찰을 제공하는가?
주요 결과
- 합성 데이터셋으로 훈련된 모델는 실질적인 음원 데이터에 대해 잘 일반화되며, 실질적인 벤치마크인 ENST 및 MAESTRO에서 직접적인 실세계 데이터 미세조정 없이도 뛰어난 성능을 기록한다.
- 합성 데이터셋으로 훈련함으로써 소수의 악기 클래스(예: LT, MT, RD, CRC, CHC)에 대한 성능 향상이 관찰되어 데이터 증강으로서의 효과를 입증한다.
- 합성 데이터셋의 균형 잡힘은 소수의 악기 클래스에서의 훈련 성능 향상을 이끌었지만, 항상 교차 데이터셋 일반화 능력을 향상시키진 않았으며, 이는 데이터 분포 설계 시의 상충 관계를 시사한다.
- 가짜 혼동 행렬을 통해 유사한 소리를 내는 악기들(예: 하이햇 변형, 톰스, 심벌)이 자주 오분류되는 것으로 나타나, 드럼 음색 분류에 내재된 청각적 모호성을 시사한다.
- 합성 MIDI 데이터셋에서 사전 훈련한 후 실세계 데이터셋을 병합하여 보완 훈련한 결과, 희귀 악기의 탐지 능력까지 포함해 모든 악기 클래스에서 뛰어난 성능을 기록한 모델이 도출되었다.
- 이 시스템은 다중 악기 드럼 편집이 스케일 단위로 가능하다는 것을 입증하며, 공개 가능한 모델과 데이터셋을 통해 재현 가능한 연구와 향후 개발을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.