Skip to main content
QUICK REVIEW

[논문 리뷰] Robust One-Shot Singing Voice Conversion

Naoya Takahashi, Mayank Singh|arXiv (Cornell University)|2022. 10. 20.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 재생 환경에서 리verb와 배경 음악 간섭이 있는 상황에서도 10초 미만의 참조 오디오만으로도 어떤 새로운 가수의 음성도 고음질, 고정밀도로 변환할 수 있는 새로운 프레임워크인 Robust One-Shot Singing Voice Conversion (ROSVC)을 제안한다. 이는 GAN 기반의 원샷 SVC 모델과 피치 분포 매칭, AdaIN-skip 조건부 조건을 결합한 것으로, 왜곡에 대한 내성을 향상시키기 위해 이중 단계 학습 전략(Robustify)을 적용하고, 고해상도 음성 품질과 피치 안정성을 향상시키기 위해 계층적 확산 기반 신경 음성 합성기(신경 보이스 생성기)를 사용한다. 주관적 및 객관적 평가에서 최신 기술들을 능가한다.

ABSTRACT

Recent progress in deep generative models has improved the quality of voice conversion in the speech domain. However, high-quality singing voice conversion (SVC) of unseen singers remains challenging due to the wider variety of musical expressions in pitch, loudness, and pronunciation. Moreover, singing voices are often recorded with reverb and accompaniment music, which make SVC even more challenging. In this work, we present a robust one-shot SVC (ROSVC) that performs any-to-any SVC robustly even on such distorted singing voices. To this end, we first propose a one-shot SVC model based on generative adversarial networks that generalizes to unseen singers via partial domain conditioning and learns to accurately recover the target pitch via pitch distribution matching and AdaIN-skip conditioning. We then propose a two-stage training method called Robustify that train the one-shot SVC model in the first stage on clean data to ensure high-quality conversion, and introduces enhancement modules to the encoders of the model in the second stage to enhance the feature extraction from distorted singing voices. To further improve the voice quality and pitch reconstruction accuracy, we finally propose a hierarchical diffusion model for singing voice neural vocoders. Experimental results show that the proposed method outperforms state-of-the-art one-shot SVC baselines for both seen and unseen singers and significantly improves the robustness against distortions.

연구 동기 및 목표

  • 리verb와 배경 음악과 같은 실제 왜곡 조건에서 새로운 가수에 대해 고품질의 음성 변환(SVC)을 수행하는 데 도전하는 것.
  • 사전 처리(예: 리verb 제거 또는 소스 분離)에 의존하지 않고도 음성 변환 모델의 내성을 향상시키는 것.
  • 학습 데이터에 포함되지 않은 타겟 가수에 대해서도 정확한 피치 복원과 자연스러운 음성 품질을 달성하는 것.
  • 변환된 노래 음성의 청취 품질과 피치 안정성을 향상시키는 신경 보이스 생성기를 개발하는 것.

제안 방법

  • 새로운 가수에 일반화할 수 있도록 부분 도메인 조건부 및 피치 분포 매칭을 적용한 GAN 기반 원샷 SVC 모델을 제안한다.
  • 변환 과정에서 피치 관련 특징을 유지함으로써 피치 재구성 정확도를 향상시키기 위해 AdaIN-skip 조건부 조건을 도입한다.
  • 청정 데이터에서 사전 학습한 후 인코더에 강화 모듈을 적용하여 리verb와 음악 간섭에 대한 내성을 향상시키는 이중 단계 학습 프레임워크인 Robustify를 개발한다.
  • 다양한 샘플링 속도에서 다중 확산 모델을 사용하는 계층적 확산 모델 기반 신경 보이스 생성기(HPG)를 설계하여 고해상도의 노래 음성을 생성하고 피치 안정성을 향상시킨다.
  • 낮은 샘플링 속도의 웨이브폼을 직접 조건부로 사용하여 저주파 성분 생성을 안내하는 다중 척도 조건부 전략을 구현한다.
  • NUS48E, NHSS, MUSDB18 데이터셋에서 다섯 개의 최신 기술 기반 원샷 VC 기준 모델과의 비교를 통해 방법의 유효성을 검증한다.

실험 결과

연구 질문

  • RQ1원샷 SVC 모델은 새로운 가수에 대해 높은 품질의 음성 변환을 수행하면서도 정확한 피치와 자연스러움을 유지할 수 있는가?
  • RQ2원샷 SVC 모델은 사전 처리에 의존하지 않고 리verb와 배경 음악과 같은 실제 왜곡에 대해 강건하게 작동할 수 있는가?
  • RQ3계층적 확산 기반 신경 보이스 생성기는 자동회귀형 또는 GAN 기반 보이스 생성기와 비교해 변환된 노래 음성의 청취 품질과 피치 정확도를 향상시키는가?
  • RQ4이중 단계 학습 전략(Robustify)은 왜곡된 입력에서 특징 추출의 내성을 얼마나 향상시키는가?
  • RQ5낮은 샘플링 속도의 웨이브폼에 직접 조건부를 적용하는 것이 생성된 노래 음성의 해상도와 안정성을 향상시키는가?

주요 결과

  • 제안된 ROSVC 모델은 MOS 점수 4.07을 기록하여 PriorGrad(3.70)와 PWG(2.81)를 크게 앞서며 뛰어난 청취 품질을 입증한다.
  • 선호도 테스트에서 85.3%의 평가자가 HPG-2 모델을 PriorGrad보다 선호하여 자연스러움과 음질 향상을 확인한다.
  • 계층적 확산 보이스 생성기(HPG-2)는 PMAE 1.82를 기록하여 PriorGrad(1.80)와 PWG(3.12)보다 우수한 피치 정확도를 보여준다.
  • 3단계 계층적 모델인 HPG-3는 PMAE를 1.67으로 낮추고 MCD를 8.12로 개선하여 계산 비용이 30% 증가하는 데서도 성능 향상을 보였다.
  • 절단 실험 결과, 저주파 성분 생성에 있어 저속도 웨이브폼($x_0^2$)에 대한 조건부 적용이 필수적임을 확인하였으며, 멜 스펙트로그램만으로는 전체 주파수 대역의 해상도를 확보하기에는 부족함을 입증하였다.
  • Robustify 학습 전략은 리verb와 음악 간섭에 대한 내성을 크게 향상시켜 기존 기준 모델이 실패하는 왜곡된 입력에서도 안정적인 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.