Skip to main content
QUICK REVIEW

[논문 리뷰] Acoustic Modeling for Automatic Lyrics-to-Audio Alignment

Chitralekha Gupta, Emre Yılmaz|arXiv (Cornell University)|2019. 06. 25.
Music and Audio Processing참고 문헌 36인용 수 5
한 줄 요약

이 논문은 다성분 음악에서 자동 가사-오디오 정렬을 향상시키기 위한 이중 접근법을 제안한다: (1) 배경 음악에 대한 강건성을 높이기 위해 전통적인 MFCC에 음성 및 음악 정보를 반영한 특징을 통합하고, (2) 소규모 도메인 내 다성분 데이터를 사용해 대규모 단독 노래 음성 모델을 적응시켜 도메인 불일치를 줄인다. 이 방법은 Mauch-poly 데이터셋에서 평균 정렬 오차 1.93초를 기록하여, 데이터 집약적인 엔드 투 엔드 모델을 제외한 이전 모든 시스템을 능가한다.

ABSTRACT

Automatic lyrics to polyphonic audio alignment is a challenging task not only because the vocals are corrupted by background music, but also there is a lack of annotated polyphonic corpus for effective acoustic modeling. In this work, we propose (1) using additional speech and music-informed features and (2) adapting the acoustic models trained on a large amount of solo singing vocals towards polyphonic music using a small amount of in-domain data. Incorporating additional information such as voicing and auditory features together with conventional acoustic features aims to bring robustness against the increased spectro-temporal variations in singing vocals. By adapting the acoustic model using a small amount of polyphonic audio data, we reduce the domain mismatch between training and testing data. We perform several alignment experiments and present an in-depth alignment error analysis on acoustic features, and model adaptation techniques. The results demonstrate that the proposed strategy provides a significant error reduction of word boundary alignment over comparable existing systems, especially on more challenging polyphonic data with long-duration musical interludes.

연구 동기 및 목표

  • 다성분 음악에서 배경 음악이 보컬을 오염시키고 단독 노래 모델이 도메인 불일치로 실패하는 자동 가사-오디오 정렬 과제를 해결하기 위해.
  • 음성 및 음악 정보를 반영한 특징을 통합할 경우, 스펙트로-시간적 변동성과 배경 간섭에 대한 강건성이 향상되는지 조사하기 위해.
  • 소규모 다성분 데이터를 사용해 사전 훈련된 단독 노래 음성 모델을 적응시켜 도메인 간 격차를 줄이는 효과를 평가하기 위해.
  • 대규모 다성분 데이터셋에 의존하지 않고 지식 기반 특징과 데이터 기반 적응을 조합함으로써 저자원 환경에서의 가사-오디오 정렬을 위한 해결책을 제공하기 위해.

제안 방법

  • 이 방법은 기존 MFCC에 더해 음성 및 음악 정보를 반영한 특징(예: 음성 존재 여부, 청각 특징, 음고 관련 특징 등)을 통합하여 다성분 왜곡 상황에서도 보다 잘 보존된 보컬 특징을 추출한다.
  • 최대 사후확률(MAP) 또는 최대우도선형회귀(MLLR)를 활용한 모델 적응을 통해 소규모 도메인 내 다성분 데이터로 사전 훈련된 DNN-HMM 음성 모델을 미세 조정한다.
  • 적응 과정은 단독 노래 훈련 데이터와 다성분 테스트 데이터 간의 도메인 불일치를 줄여 실제 음악 환경에서의 일반화 능력을 향상시킨다.
  • 시스템은 전처리 및 도메인 이동의 영향을 분리하기 위해, 보컬 추출 여부에 따라 Hansen-poly 및 Mauch-poly 두 개의 벤치마크 데이터셋에서 평가된다.
  • 음성 모델은 어휘사전과 언어 모델을 사용해 강제 정렬을 통해 훈련 및 평가되며, 정렬 정밀도 평가를 위해 단어 경계 오차가 분석된다.
  • 성능 향상을 입증하기 위해 기존 시스템(엔드 투 엔드 모델 포함)과 비교 분석이 수행된다.

실험 결과

연구 질문

  • RQ1표준 MFCC만을 사용하는 것과 비교해 음성 및 음악 정보를 반영한 특징을 통합할 경우, 다성분 음악에서 정렬 강건성이 향상되는가?
  • RQ2소규모 다성분 데이터를 사용해 단독 노래 음성 모델을 적응시킬 경우, 다성분 테스트 세트에서 정렬 오차가 유의미하게 감소하는가?
  • RQ3긴 음악 인터루드가 포함된 데이터셋(예: Mauch-poly)에서 콘텐츠 정보를 반영한 특징과 모델 적응은 어떻게 성능을 발휘하는가?
  • RQ4다성분 음악 데이터에 직접 적용할 경우, 분리된 보컬에 적용하는 것보다 도메인 적응이 더 효과적인가?
  • RQ5단어 경계 정렬 오차 감소에 기여하는 특징 설계와 모델 적응의 상대적 기여도는 어떻게 되는가?

주요 결과

  • 제안된 방법은 Mauch-poly 데이터셋에서 평균 정렬 오차 1.93초를 기록하여, MIREX 도전 대회에서 보고된 모든 시스템 중 데이터 집약적인 엔드 투 엔드 모델을 제외한 최고 성능을 달성했다.
  • MFCC만을 사용하는 것과 비교해 음성 및 음악 정보를 반영한 특징을 통합할 경우 평균 정렬 오차가 크게 감소하여 배경 음악에 대한 강건성이 뛰어나다는 것을 입증했다.
  • 소규모 다성분 데이터를 사용한 모델 적응은 단독 노래 모델에 비해 성능 향상이 뚜렷하며, 특히 긴 인터루드가 포함된 과도한 도전 과제에서 두드러진다.
  • 가장 우수한 성능을 보인 시스템(C6)은 긴 음악 인터루드 근처에서 경계 오차가著 감소하여 침묵 또는 비보컬 세그먼트를 더 잘 처리함을 시사한다.
  • 모든 경계에서 중앙값 정렬 오차가 최고 성능 시스템 기준 180ms 이하로 유지되어, 정렬 작업의 대부분에서 높은 정밀도를 확보했다.
  • 특징 설계의 성능 향상 기여도가 모델 적응만으로 이루어진 경우보다 높으며, 두 기법을 조합할 경우 가장 우수한 성능을 기록했고, 특히 Mauch-poly 데이터셋에서 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.