Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Lyrics Transcription in Polyphonic Music: Does Background Music Help?

Chitralekha Gupta, Emre Yılmaz|arXiv (Cornell University)|2019. 09. 23.
Music and Audio Processing인용 수 6
한 줄 요약

이 논문은 배경 음악 간섭으로 인한 가사 명료도 저하 문제를 해결하기 위해, 잡음 제거 대신 장르 정보를 반영한 특징을 활용하는 음악 장르 특화 음성 모델링 기법을 제안한다. 장르 특화 특징을 기반으로 모델을 훈련시음으로써, 다양한 벤치마크 데이터셋에서 기존 방법보다 뛰어난 성능을 달성하며, 자동 가사 전사 및 정렬 정확도가 크게 향상된다.

ABSTRACT

Background music affects lyrics intelligibility of singing vocals in a music piece. Automatic lyrics transcription in polyphonic music is a challenging task because the singing vocals are corrupted by the background music. In this work, we propose to learn music genre-specific characteristics to train polyphonic acoustic models. For this purpose, we firstly study and compare several automatic speech recognition pipelines for the application of lyrics transcription. Later, we present the lyrics transcription performance of these music-informed acoustic models for the best-performing pipeline, and systematically study the impact of music genre and language model on the performance. With this genre-based approach, we explicitly model the characteristics of music, instead of trying to remove the background music as noise. The proposed approach achieves a significant improvement in performance in the lyrics transcription and alignment tasks on several well-known polyphonic test datasets, outperforming all comparable existing systems.

연구 동기 및 목표

  • 배경 음악 간섭으로 인한 음악에서의 가사 명료도 저하 문제를 해결하기 위해.
  • 장르 특화 특징을 모델링할 경우 가사 전사 성능 향상 여부를 조사하기 위해.
  • 복잡한 오디오 환경에서 가사 전사에 적합한 다양한 자동 음성 인식 파이프라인을 비교하기 위해.
  • 음악 장르와 언어 모델링이 전사 정확도에 미치는 영향을 평가하기 위해.
  • 배경 음악을 노이즈로 간주하기보다는 구조적 구성 요소로 명시적으로 모델링하는 시스템을 개발하기 위해.

제안 방법

  • 복합 음악 환경에서의 가사 전사에 적합한 자동 음성 인식(ASR) 파이프라인을 적응시키기 위해.
  • 오디오에서 장르 특화 특징을 학습하는 음악 정보 기반 음성 모델을 훈련시키기 위해.
  • 배경 음악을 노이즈로 제거하는 것이 아니라 신호 구조의 일부로 간주하여 장르 기반 접근 방식을 통해 모델링하기 위해.
  • 다양한 음악 장르와 언어 모델을 적용하여 최고 성능을 보인 ASR 파이프라인을 체계적으로 평가하기 위해.
  • 가사와 해당 오디오 세그먼트를 정렬하기 위해 엔드 투 엔드 또는 하이브리드 모델링 프레임워크를 활용하기 위해.
  • 일반화 성능 향상을 위해 데이터셋 특화 데이터 증강 및 도메인 적응 기법을 활용하기 위해.

실험 결과

연구 질문

  • RQ1음악 장르 특화 특징을 통합할 경우, 복합 음악 환경에서 자동 가사 전사 성능 향상이 이루어지는가?
  • RQ2다양한 ASR 파이프라인은 복합 음성 오디오에 적용했을 때 가사 전사 정확도 측면에서 어떻게 상호 비교되는가?
  • RQ3음악 장르는 가사 전사 시스템의 성능에 어떤 영향을 미치는가?
  • RQ4언어 모델링은 음악 정보 기반 음성 모델과 어떻게 상호작용하여 전사 결과를 향상시키는가?
  • RQ5배경 음악을 구조적 구성 요소로 모델링하는 것이 노이즈 제거 전략을 초월할 수 있는가?

주요 결과

  • 제안된 장르 기반 음성 모델링 기법은 여러 유명한 복합 음악 테스트 데이터셋에서 가사 전사 성능을 크게 향상시킨다.
  • 모든 비교 가능한 기존 시스템보다 전사 및 정렬 작업 모두에서 뛰어난 성능을 보인다.
  • 명시적인 장르 특징 모델링은 다양한 음악 스타일 간 일반화 능력과 강인성을 향상시킨다.
  • 가장 뛰어난 성능을 보인 파이프라인은 장르 특화 음성 모델링과 조합될 경우 상당한 성능 향상을 보인다.
  • 언어 모델링은 음악 정보 기반 특징과 통합될 경우 성능 향상에 더 큰 기여를 한다.
  • 배경 음악 억제 기법에 의존하지 않음에도 불구하고, 최신 기술 수준의 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.