Skip to main content
QUICK REVIEW

[논문 리뷰] DurIAN-SC: Duration Informed Attention Network based Singing Voice Conversion System

Liqiang Zhang, Chengzhu Yu|arXiv (Cornell University)|2020. 08. 07.
Speech Recognition and Synthesis참고 문헌 23인용 수 13
한 줄 요약

이 논문은 단지 20초 분량의 타겟 스피커 음성 데이터만을 사용하여 고품질의 노래 음성으로 변환할 수 있는 통합된 노래 음성 변환 시스템인 DurIAN-SC를 제안한다. 음성과 노래 음성 합성 기술을 하나의 프레임워크에 통합함으로써, 사전에 학습된 스피커 d-벡터 네트워크를 활용하여 피팅 조정 없이도 한 번의 입력으로도 변환할 수 있으며, 매우 적은 타겟 데이터로도 높은 자연스러움과 유사도를 달성한다.

ABSTRACT

Singing voice conversion is converting the timbre in the source singing to the target speaker's voice while keeping singing content the same. However, singing data for target speaker is much more difficult to collect compared with normal speech data.In this paper, we introduce a singing voice conversion algorithm that is capable of generating high quality target speaker's singing using only his/her normal speech data. First, we manage to integrate the training and conversion process of speech and singing into one framework by unifying the features used in standard speech synthesis system and singing synthesis system. In this way, normal speech data can also contribute to singing voice conversion training, making the singing voice conversion system more robust especially when the singing database is small.Moreover, in order to achieve one-shot singing voice conversion, a speaker embedding module is developed using both speech and singing data, which provides target speaker identify information during conversion. Experiments indicate proposed sing conversion system can convert source singing to target speaker's high-quality singing with only 20 seconds of target speaker's enrollment speech data.

연구 동기 및 목표

  • 노래 음성 데이터가 확보되지 않은 상황에서도 최소한의 타겟 스피커 데이터를 요구하는 노래 음성 변환 시스템을 개발하는 것.
  • 음성과 노래 음성 합성 학습을 하나의 프레임워크로 통합하여 데이터 효율성을 향상시키는 것.
  • 단지 20초 분량의 음성 데이터만으로도 새로운 스피커에 대해 한 번의 입력으로 음성 변환을 가능하게 하는 것.
  • 사전에 학습된 스피커 d-벡터와 학습 가능한 LUT 임베딩 간의 성능 비교를 평가하는 것.

제안 방법

  • 모델은 음성과 노래 음성 합성 모두에 동일한 DurIAN 기반 아키텍처를 사용하여, 동일한 음성 특징 생성 프레임워크를 공유한다.
  • 입력 특징으로는 텍스트/가사, 프로소디를 반영한 문자열 순서, 프레임 단위의 f0, 그리고 지속 시간과 톤 제어를 위한 루트 평균 제곱 에너지(RMSE)가 포함된다.
  • 스피커 정체성은 타겟 스피커의 20초 분량의 음성 또는 노래 클립에서 추출한 사전에 학습된 d-벡터를 사용하여 인코딩된다.
  • 혼합된 음성 및 노래 데이터로 학습함으로써, 음성 데이터가 노래 음성 학습에 기여하도록 한다.
  • 종합적인 손실 함수를 통해 엔드 투 엔드 학습 중 자연스러움과 유사도를 동시에 최적화한다.
  • 스피커 d-벡터는 사전에 학습된 스피커 인식 모델에서 추출되며, 주 모델의 학습과 스피커 임베딩을 분리한다.

실험 결과

연구 질문

  • RQ1통합된 음성 및 노래 음성 변환 프레임워크는 음성 데이터만을 효과적으로 활용하여 고품질의 노래 음성 변환 모델을 학습시킬 수 있는가?
  • RQ2노래 음성 변환에서 사전에 학습된 스피커 d-벡터 임베딩과 학습 가능한 LUT 임베딩 간의 성능 비교 시, 변환 품질과 새로운 스피커에 대한 일반화 능력은 어떻게 다른가?
  • RQ3노래 데이터가 부족하거나 확보되지 않은 상황에서 음성 데이터가 노래 음성 변환 성능 향상에 얼마나 기여할 수 있는가?
  • RQ4사전에 학습된 스피커 임베딩 모듈을 사용할 경우, 단지 20초 분량의 타겟 스피커 데이터로도 한 번의 음성 변환을 달성할 수 있는가?

주요 결과

  • 집합 내 스피커 평가에서 제안된 d-벡터 기반 스피커 임베딩 시스템은 자연스러움(3.70 대비 3.61)과 유사도(3.61 대비 3.56) 측면에서 LUT 기반 베이스라인을 모두 초월했다.
  • 집합 외 스피커에 대해서는 d-벡터 방법이 유사도 MOS 3.10을 기록하여, 모델 피팅 조정 없이도 한 번의 입력으로의 변환이 가능함을 입증했다.
  • 단지 음성 데이터로만 학습한 결과, 유사도 MOS는 3.71, 자연스러움 MOS는 3.65를 기록했으며, 혼합 데이터(3.74 및 3.71) 및 노래 전용 데이터(3.61 및 3.70) 기반 베이스라인과 유사한 성능을 보였다.
  • 학습 과정에서 음성 데이터를 추가함으로써 발음의 명확성이 향상되었고, 생성된 노래 음성의 유사도가 향상되었다.
  • 최소한의 데이터로도 고품질의 노래 음성 변환을 달성함으로써, 음성 데이터가 노래 음성 학습에 효과적으로 기여할 수 있음을 확인했다.
  • 사전에 학습된 d-벡터 모듈은 새로운 스피커에 대해 강력한 한 번의 입력 변환을 가능하게 하여, 각 새로운 사용자에 대해 모델 재학습 또는 피팅 조정이 필요 없음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.