Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple F0 Estimation in Vocal Ensembles using Convolutional Neural Networks

Helena Cuesta, Brian McFee|arXiv (Cornell University)|2020. 09. 09.
Music and Audio Processing참고 문헌 37인용 수 7
한 줄 요약

이 논문은 하모닉 컨stant-Q 변환(HCQT) 특징과 진폭 및 위상 정보를 사용하여 아카펠라 보컬 앙상블에서 다중 기본 주파수(F0) 추정을 위한 컨volution 신경망(CNN) 기반 방법을 제안한다. 이 모델은 특히 20 센트의 높은 주파수 해상도에서 상태 최신 기법들을 능가하며, 리버브와 유니즌 노래에 대해 강건함을 입증한다.

ABSTRACT

This paper addresses the extraction of multiple F0 values from polyphonic and a cappella vocal performances using convolutional neural networks (CNNs). We address the major challenges of ensemble singing, i.e., all melodic sources are vocals and singers sing in harmony. We build upon an existing architecture to produce a pitch salience function of the input signal, where the harmonic constant-Q transform (HCQT) and its associated phase differentials are used as an input representation. The pitch salience function is subsequently thresholded to obtain a multiple F0 estimation output. For training, we build a dataset that comprises several multi-track datasets of vocal quartets with F0 annotations. This work proposes and evaluates a set of CNNs for this task in diverse scenarios and data configurations, including recordings with additional reverb. Our models outperform a state-of-the-art method intended for the same music genre when evaluated with an increased F0 resolution, as well as a general-purpose method for multi-F0 estimation. We conclude with a discussion on future research directions.

연구 동기 및 목표

  • 모든 소스가 유사한 톤과 하모닉 성분을 지닌 다성음 및 아카펠라 보컬 앙상블에서 다중 F0 추정의 과제를 해결한다.
  • 고립된 음성 녹음 또는 악보 동기화에 의존하는 기존 기법의 한계를 극복하여, 실제 녹음에 대해 실용적이지 않은 점을 해결한다.
  • 리버브와 유니즌 노래를 포함한 다양한 녹음 조건에서 일반화 가능한 딥 러닝 모델을 개발한다.
  • 입력 표현에 진폭 외에 위상 차분을 통합하여 추정 정밀도를 향상시킨다.
  • 훈련 및 평가를 지원하기 위해 F0 레이블이 부여된 대규모 고품질 보컬 쿼арт렛 데이터셋을 구축한다.

제안 방법

  • 하모닉 컨스턴트-Q 변환(HCQT)과 그 위상 차분을 사용하여 하모닉 구조와 시간적 동적 특성을 캡처하는 입력 특징을 사용한다.
  • HCQT 표현을 처리하여 주파수 감각 함수를 생성하는 CNN 아키텍처를 설계한다. 이 함수는 가능한 F0 후보를 강조한다.
  • 감각 지도에 임계값 설정과 피크 추출을 적용하여 출력에서 이산적인 F0 값을 추출한다.
  • 다중 트랙 녹음에서 유도된 보컬 쿼арт렛의 고유 데이터셋을 사용하여 모델을 훈련하며, 주파수 이동 및 리버브를 통한 증강을 적용한다.
  • 정확도 향상을 위해 진폭과 위상 정보를 융합하는 다양한 전략을 실험한다.
  • 검증 세트를 사용하여 피크 검출에 최적의 임계값을 결정함으로써 다양한 조건에서의 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1혼합 오디오만을 사용하여 고립된 음성 녹음 없이 아카펠라 보컬 앙상블에서 다중 F0 값을 효과적으로 추정할 수 있는가?
  • RQ2입력 표현에 위상 정보를 포함시키면 특히 고해상도에서 F0 추정 정확도에 어떤 영향을 미치는가?
  • RQ3리버브가 가미된 오디오로 훈련하면 실제 리버브가 강한 녹음 조건으로의 일반화 능력이 얼마나 향상되는가?
  • RQ4다양한 주파수 허용 오차 조건에서 제안된 모델은 상태 최신 기법과 비교해 F0 추정 성능에서 어떤가?
  • RQ5유니즌 노래와 높은 리버브가 포함된 새로운 녹음 조건에서도 모델이 일반화 가능한가? 이는 합창 음악에서 흔한 상황이다.

주요 결과

  • 제안된 모델은 같은 음악 장르(바버셔프 쿼арт렛)에서 상태 최신 기법보다 100 센트와 20 센트 주파수 허용 오차 모두에서 성능이 뛰어나며, 20 센트에서 성능 저하가 매우 적다(-2% F-Score 대비 베이스라인의 -17% 및 -26%).
  • 입력 표현에 위상 차분을 통합함으로써 F0 추정 정밀도가 향상되었으며, 이는 특히 고해상도(20 센트)에서 진폭 전용 기준보다 뛰어난 성능을 보여준다.
  • 드라이 신호와 리버브 신호를 모두 사용해 훈련한 모델은 리버브가 강한 테스트 샘플에서 평균 F-Score가 10% 향상되어 드라이 신호만으로 훈련한 모델보다 우수하다.
  • 높은 리버브와 다수의 가수로 구성된 어려운 합창 데이터셋에서 평가한 결과, 모델은 평균 F-Score 0.704를 기록하여 베이스라인 방법의 0.653을 초월했다.
  • 모델은 유니즌 노래에 대해 강건함을 보이며, 여러 목소리가 같은 음을 노래할 때도 높은 성능을 유지한다.
  • F0 컨투어의 후처리가 시간적 연속성을 향상시키며, 향후 작업에서 보다 고품질 출력을 얻기 위해 이러한 정제 단계를 포함하는 것이 바람직하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.