Skip to main content
QUICK REVIEW

[논문 리뷰] Multitask Learning for Fundamental Frequency Estimation in Music

Rachel Bittner|arXiv (Cornell University)|2018. 09. 02.
Music and Audio Processing참고 문헌 38인용 수 12
한 줄 요약

이 논문은 다중 곡선 주파수(f0) 추정, 멜로디 추정, 보컬 추정, 베이스 라인 추정 등의 음악 작업을 동시에 수행하기 위해 공유 백본 네트워크와 작업별 헤드를 사용하는 다중 작업 딥 러닝 모델을 제안한다. 이 모델은 단일 작업 기반 모델을 능가하며, 합성 데이터로 훈련된 작업들까지 포함해 작업 수가 많아질수록 성능 향상을 보이며, 다중 음악에서 f0 추정을 위한 공유 표현 학습의 이점을 입증한다.

ABSTRACT

Fundamental frequency (f0) estimation from polyphonic music includes the tasks of multiple-f0, melody, vocal, and bass line estimation. Historically these problems have been approached separately, and only recently, using learning-based approaches. We present a multitask deep learning architecture that jointly estimates outputs for various tasks including multiple-f0, melody, vocal and bass line estimation, and is trained using a large, semi-automatically annotated dataset. We show that the multitask model outperforms its single-task counterparts, and explore the effect of various design decisions in our approach, and show that it performs better or at least competitively when compared against strong baseline methods.

연구 동기 및 목표

  • 음악에서 레이블이 부족한 f0 데이터 문제를 관련 f0 추정 작업 간의 다중 작업 학습을 통해 해결하고자 한다.
  • 멜로디, 보컬, 베이스, 다중-f0 작업 간 표현 공유를 통해 f0 추정의 일반화 능력과 성능을 향상시키고자 한다.
  • 실제 다성음 음악에 대한 일반화 능력을 향상시키기 위해 합성 오디오(piano/guitar)를 훈련에 포함시키는 영향을 탐색하고자 한다.
  • 공유 표현 학습에도 불구하고 다중 작업 훈련이 작업별 최적화 모델을 능가할 수 있는지 조사하고자 한다.
  • 현재 f0 추정의 한계, 특히 음성 검출과 톤 감지에서의 문제점을 규명하고 향후 개선 방안을 제안하고자 한다.

제안 방법

  • 공유 컨볼루션 신경망 백본이 원시 오디오를 처리하여 모든 작업에 대해 계층적 특징을 추출한다.
  • 공유된 특징에 작업별 헤드를 부착하여 멜로디, 보컬, 베이스, 다중-f0 추정에 대한 f0를 예측한다.
  • 조화적 CQT(HCQT)가 비조화성 성분을 억제하도록 마스킹되어, 모델이 음정과 관련된 특징에 집중하도록 유도된다.
  • 실제 데이터, 반자동으로 레이블링된 데이터, 피아노 및 기타에서 생성된 합성 오디오를 조합하여 모델을 종합적으로 훈련시킨다.
  • f0 정확도를 최적화하기 위한 손실 함수가 설계되었으며, 음성 검출과 주파수 추적에 별도의 목표가 설정되어 있다.
  • 데이터 증강 및 합성 데이터 생성을 통해 음악적 톤 색채와 다성음 수준의 다양성과 커버리지가 향상된다.

실험 결과

연구 질문

  • RQ1다중 작업 학습이 다수의 음악 작업에서 단일 작업 모델 대비 f0 추정 성능을 향상시키는가?
  • RQ2합성 오디오 데이터를 포함시킬 경우 다중 작업 모델의 성능에 어떤 영향을 미치는가?
  • RQ3다중 작업 학습 프레임워크에서 작업 수를 늘일 경우 전체 f0 추정 정확도에 어떤 영향을 미치는가?
  • RQ4왜 모델은 음성 검출, 특히 보컬과 베이스에서 성능이 열등한가? 이를 어떻게 완화할 수 있는가?
  • RQ5공유 표현 학습이 다양한 f0 추정 작업 간 일반화 능력을 얼마나 향상시키는가?

주요 결과

  • 다중 작업 모델은 멜로디, 보컬, 베이스 f0 추정을 포함한 다양한 데이터셋과 작업에서 모든 단일 작업 기반 모델을 능가한다.
  • 추가로 작업을 더할수록 성능 향상이 이루어지며, 일부 작업이 순수하게 합성 데이터로 훈련된 경우에도 효과적인 지식 전이가 이루어짐을 시사한다.
  • 합성 피아노 및 기타 데이터의 포함이 다중-f0 추정 성능을 크게 향상시키며, 다른 작업의 성능은 저하되지 않는다.
  • 모델은 멜로디 및 다중-f0 작업에서 뛰어난 성능을 보이나, 특히 보컬과 베이스에서 음성 검출에 어려움을 겪으며, 이는 톤 모델링 부족 때문임을 시사한다.
  • 베이스 f0 추정 성능이 떨어지는 것은 자동 주파수 추적기에서 기인한 노이즈가 많은 참조 레이블(옥타브 오류 및 음성 오류 포함) 때문일 가능성이 높다.
  • 마스킹된 HCQT 특징에 의존하는 모델은 비조화성 온셋 트랜지언트를 포착하지 못해, 추가적인 온셋 모델링이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.