Skip to main content
QUICK REVIEW

[논문 리뷰] MT3: Multi-Task Multitrack Music Transcription

Josh Gardner, Ian Simon|arXiv (Cornell University)|2021. 11. 04.
Music and Audio Processing참고 문헌 39인용 수 4
한 줄 요약

MT3는 다양한 데이터셋에서 다양한 악기 조합을 종합적으로 편집하는 데 사용되는 보정된 T5 기반 트랜스포머 모델을 사용하는 통합형 다중 작업, 다중 트랙 음악 편집 프레임워크를 제안한다. 이는 특히 저자원 악기인 기타와 같은 경우에 최신 기술 수준을 달성하며, 최대 260%의 상대적 향상도를 기록한다. 또한 다양한 악기 편성과 세분성에 걸쳐 일관된 평가와 강력한 악기 레이블링을 가능하게 한다.

ABSTRACT

Automatic Music Transcription (AMT), inferring musical notes from raw audio, is a challenging task at the core of music understanding. Unlike Automatic Speech Recognition (ASR), which typically focuses on the words of a single speaker, AMT often requires transcribing multiple instruments simultaneously, all while preserving fine-scale pitch and timing information. Further, many AMT datasets are "low-resource", as even expert musicians find music transcription difficult and time-consuming. Thus, prior work has focused on task-specific architectures, tailored to the individual instruments of each task. In this work, motivated by the promising results of sequence-to-sequence transfer learning for low-resource Natural Language Processing (NLP), we demonstrate that a general-purpose Transformer model can perform multi-task AMT, jointly transcribing arbitrary combinations of musical instruments across several transcription datasets. We show this unified training framework achieves high-quality transcription results across a range of datasets, dramatically improving performance for low-resource instruments (such as guitar), while preserving strong performance for abundant instruments (such as piano). Finally, by expanding the scope of AMT, we expose the need for more consistent evaluation metrics and better dataset alignment, and provide a strong baseline for this new direction of multi-task AMT.

연구 동기 및 목표

  • 다양한 데이터셋에 걸쳐 다중 작업, 다중 트랙 음악 편집을 위한 통합 프레임워크의 부재를 해결하기 위해.
  • 다양한 저자원 데이터셋 간의 전이 학습을 활용하여 음악 편집의 데이터 부족 문제를 해결하기 위해.
  • 다양한 AMT 데이터셋 간의 일관된 평가 지표와 표준화된 테스트 세트 분할을 수립하기 위해.
  • 다양한 데이터셋에서의 공동 학습을 통해 저자원 악기(예: 기타)의 성능을 향상시키기 위해.
  • 미래의 다악기 음악 편집 연구를 위한 강력하고 일반화 가능한 기준을 제공하기 위해.

제안 방법

  • 원시 오디오 스펙트로그램을 토큰화된 다중 트랙 MIDI 출력으로 매핑하기 위해 시퀀스-투-시퀀스 트랜스포머 아키텍처(T5 기반)를 사용한다.
  • 모델 출력을 다중 트랙 MIDI 파일로 매핑하는 영리하고 컴act한 토크나이제이션 체계를 도입하여, 다양한 악기 조합을 가진 데이터셋 간의 공동 학습을 가능하게 한다.
  • 6개의 다중 트랙 AMT 데이터셋(MAESTRO, Cerberus4, GuitarSet, MusicNet, Slakh2100, URMP)을 통합하여 다중 작업 학습을 위한 유일한 벤치마크로 구성한다.
  • 모든 데이터셋에 동일한 노트 기반 평가 지표(시작점, 종료점, 악기 F1)와 표준화된 테스트 세트 분할을 적용한다.
  • 악기 그룹화 수준(플랫, MIDI 클래스, 전체)을 평가하여 레이블의 세분성에 대한 모델의 강건성을 평가한다.
  • 모델은 모든 6개 데이터셋의 혼합 데이터로 엔드 투 엔드로 학습되어, 제로샷 일반화와 저자원 성능 향상을 가능하게 한다.

실험 결과

연구 질문

  • RQ1단일의 일반적인 트랜스포머 모델이 다양한 저자원 다중 트랙 음악 편집 데이터셋에서 뛰어난 성능을 달성할 수 있는가?
  • RQ2다양한 데이터셋에서의 공동 학습이 전용 모델 대비 저자원 악기의 성능 향상에 어떤 영향을 미치는가?
  • RQ3모델이 악기 레이블의 세분성 수준(예: 전체 vs. MIDI 클래스)이 변화함에 따라 높은 악기 레이블링 정확도를 얼마나 유지하는가?
  • RQ4일관된 평가 프로토콜과 표준화된 지표 및 테스트 분할을 도입함으로써 AMT 연구의 비교 가능성과 재현 가능성이 얼마나 향상되는가?
  • RQ5데이터 혼합과 전이 학습이 알려지지 않은 데이터셋으로의 제로샷 일반화에 어떤 영향을 미치는가?

주요 결과

  • MT3는 모든 6개의 다중 트랙 AMT 데이터셋에서 최신 기술 수준의 성능을 달성하며, 이전의 데이터셋 전용 모델과 전문가 수준의 DSP 기반 소프트웨어를 모두 능가한다.
  • 저자원 악기인 기타의 경우, 기준 모델 대비 MT3가 편집 F1 점수에서 최대 260%의 상대적 향상을 기록한다.
  • 모델은 높은 악기 레이블링 정확도를 유지하며, 가장 세분화된 수준(전체 그룹화)에서도 다악기 F1 점수가 시작점-종료점 F1 점수와 유사한 수준을 유지하여 악기 오분류가 최소한임을 시사한다.
  • 이심화된 데이터셋 제거 실험을 통해 모델이 새로운 데이터셋으로의 일반화 능력이 뛰어나며, 분포 변화에 대한 강건성을 입증한다.
  • 표준화된 분할과 지표를 포함한 일관된 평가 프로토콜의 도입으로 다양한 데이터셋과 모델 간의 공정한 비교가 가능해졌다.
  • 통합 학습 프레임워크는 고자원 악기(예: 피아노)의 성능을 떨어뜨리지 않은 채 저자원 악기의 성능 향상에 상당한 기여를 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.