Skip to main content
QUICK REVIEW

[논문 리뷰] Unaligned Supervision For Automatic Music Transcription in The Wild

Ben Maman, Amit H. Bermano|arXiv (Cornell University)|2022. 04. 28.
Music and Audio Processing인용 수 5
한 줄 요약

이 논문은 비정렬된 음악 스코어와 합성 데이터를 사용하여 완전 자동으로 훈련이 가능한 다이내믹 악기 자동 음악 변환(Multi-instrument Automatic Music Transcription, AMT)을 위한 새로운 프레임워크 Note EM을 제안한다. 기대값-최대화(Expectation-Maximization) 방법을 통해 반복적으로 변환 예측과 스코어 정렬을 개선함으로써, MAESTRO에서 89.7%의 노트 수준 F1 점수와 MAPS에서 87.3%의 점수를 달성하여 훈련에 해당 데이터셋을 사용하지 않았음에도 불구하고 최신 기술 수준(SOTA)의 성능을 보이며, 다양한 악기와 장르에 걸쳐 강력한 일반화 능력을 입증한다.

ABSTRACT

Multi-instrument Automatic Music Transcription (AMT), or the decoding of a musical recording into semantic musical content, is one of the holy grails of Music Information Retrieval. Current AMT approaches are restricted to piano and (some) guitar recordings, due to difficult data collection. In order to overcome data collection barriers, previous AMT approaches attempt to employ musical scores in the form of a digitized version of the same song or piece. The scores are typically aligned using audio features and strenuous human intervention to generate training labels. We introduce NoteEM, a method for simultaneously training a transcriber and aligning the scores to their corresponding performances, in a fully-automated process. Using this unaligned supervision scheme, complemented by pseudo-labels and pitch-shift augmentation, our method enables training on in-the-wild recordings with unprecedented accuracy and instrumental variety. Using only synthetic data and unaligned supervision, we report SOTA note-level accuracy of the MAPS dataset, and large favorable margins on cross-dataset evaluations. We also demonstrate robustness and ease of use; we report comparable results when training on a small, easily obtainable, self-collected dataset, and we propose alternative labeling to the MusicNet dataset, which we show to be more accurate. Our project page is available at https://benadar293.github.io

연구 동기 및 목표

  • 실제 환경에서의 녹음 데이터에 대한 최소한의 감독 하에 훈련이 가능하도록 하여 다이내믹 악기 AMT에서의 데이터 부족 문제를 해결하고자 한다.
  • 수동으로 정렬된 오류로 인해 정확도가 낮은 기존 데이터셋(예: MusicNet)의 한계를 해결하고자 한다.
  • 인간의 간섭 없이 변환기와 스코어를 동시에 훈련하고 음악 스코어를 오디오에 정렬하는 완전 자동화된 종단 간 프레임워크를 개발하고자 한다.
  • 기존 데이터셋에서 다루지 않는 악기와 장르를 포함하여 다양한 악기와 장르에서 고성능의 변환을 가능하게 하고자 한다.
  • 합성 데이터와 비정렬된 감독 신호를 조합함으로써, 교차 데이터셋 평가에서 완전히 감독된 방법을 능가할 수 있음을 입증하고자 한다.

제안 방법

  • 이 방법은 신경망 기반 변환기와 비정렬된 음악 스코어를 오디오에 정렬하는 데 사용되는 기대값-최대화(Expectation-Maximization, EM) 프레임워크를 공동으로 사용한다.
  • E단계에서는 현재 변환기가 레이블이 없는 오디오에서 노트의 시작 시점과 페치를 예측하고, 이러한 예측을 바탕으로 가능도 기반 정렬을 통해 스코어를 오디오에 맞추기 위해 왜곡한다.
  • M단계에서는 E단계에서 생성된 정렬 최적화된 레이블을 사용하여 변환기를 재학습한다.
  • 실제 환경의 녹음 데이터로 반복적인 개선을 수행하기 전에 합성 데이터를 사용하여 프레임워크를 초기화한다.
  • 학습 중에 허위 레이블링과 톤 올리기 증강을 활용하여 강건성과 일반화 능력을 향상시킨다.
  • 악기 ID 예측을 통합하여 악기별로 구분된 변환을 지원함으로써 정확한 악기 포함 노트 평가가 가능하다.

실험 결과

연구 질문

  • RQ1인간이 정렬한 레이블이 없는 비정렬된 음악 스코어를 효과적으로 활용하여 고정밀도 AMT 모델을 훈련시킬 수 있는가?
  • RQ2기존의 특징 기반 정렬 방법과 비교할 때, EM 기반의 변환기와 정렬의 공동 훈련 방식은 레이블 품질과 변환 정확도 측면에서 어떻게 다른가?
  • RQ3합성 데이터와 비정렬된 감독 신호를 조합하여 실제 환경의 다양한 악기와 장르에 걸쳐 일반화 성능을 얼마나 잘 달성할 수 있는가?
  • RQ4목표 데이터셋의 훈련 데이터를 사용하지 않고도 교차 데이터셋 평가에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5이 논문에서 제안한 대안적 레이블링 체계는 MusicNet 데이터셋의 품질에 비해 얼마나 우수한가, 특히 호른, 바순, 클라리넷과 같은 악기에서는 F1 점수 향상이 15점 이상 초과되는가?

주요 결과

  • Note EM은 MAESTRO 테스트 세트에서 MAESTRO 훈련 데이터를 사용하지 않고도 노트 수준 F1 점수 89.7%를 기록하였으며, 동일 조건에서 이전 방법이 보고한 28% F1에 비해 뚜렷이 뛰어난 성능을 보였다.
  • MAPS 데이터셋에서는 노트 수준 F1 점수 87.3%를 기록하여, 예상치 못한 연주와 악기들에 대한 강력한 일반화 능력을 입증하였다.
  • 이 방법을 사용할 경우, 기존 MusicNet 애너테이션 대비 생성된 레이블을 사용할 때 테스트 세트에서 변환 정확도가 20퍼센트 포인트 이상 향상되었다.
  • 11~22개의 악기(바이올린, 클라리넷, 하프시코드, 호른 포함)에 걸쳐 고성능의 변환을 가능하게 하였으며, 특히 바순과 호른과 같은 도전적인 악기에서 뚜렷한 성능 향상을 보였다.
  • 작은 크기의 자가 수집 데이터셋으로 훈련해도, 대규모 정제된 데이터셋으로 훈련된 기존 방법과 유사한 성능을 달성하여, 사용의 용이성과 확장성의 가능성을 입증하였다.
  • 이 논문에서 제안한 MusicNet EM 레이블링 체계는 원본 MusicNet 애너테이션보다 정확도가 높으며, 특히 호른, 바순, 클라리넷과 같은 악기에서는 F1 점수 향상이 15점 초과로 뚜렷하게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.