Skip to main content
QUICK REVIEW

[논문 리뷰] Phonetic Posteriorgrams based Many-to-Many Singing Voice Conversion via Adversarial Training

Haohan Guo, Heng Lu|arXiv (Cornell University)|2020. 12. 03.
Music and Audio Processing참고 문헌 26인용 수 10
한 줄 요약

이 논문은 MelGAN 기반 생성기와 CNN-BLSTM 인코더, 그리고 적대적 훈련을 사용하여 음성 후보도(PPG), F0, 및 화자 임베딩에서 고음질의 노래 음성 웨이브폼을 생성하는 엔드 투 엔드 적대적 노래 음성 변환(EA-SVC) 시스템을 제안한다. 주요 기여 사항으로는 화자 임베딩을 톤 색채 클러스터로 분해하는 것, PPG에서 음고/톤 색채 누출을 제거하기 위한 특징 분리 판별기 도입, 이중 단계 훈련 전략을 통해 기존의 캐스케이드 및 WaveNet 기반 방법에 비해 향상된 노래 품질과 화자 유사도를 달성하는 것이다.

ABSTRACT

This paper describes an end-to-end adversarial singing voice conversion (EA-SVC) approach. It can directly generate arbitrary singing waveform by given phonetic posteriorgram (PPG) representing content, F0 representing pitch, and speaker embedding representing timbre, respectively. Proposed system is composed of three modules: generator $G$, the audio generation discriminator $D_{A}$, and the feature disentanglement discriminator $D_F$. The generator $G$ encodes the features in parallel and inversely transforms them into the target waveform. In order to make timbre conversion more stable and controllable, speaker embedding is further decomposed to the weighted sum of a group of trainable vectors representing different timbre clusters. Further, to realize more robust and accurate singing conversion, disentanglement discriminator $D_F$ is proposed to remove pitch and timbre related information that remains in the encoded PPG. Finally, a two-stage training is conducted to keep a stable and effective adversarial training process. Subjective evaluation results demonstrate the effectiveness of our proposed methods. Proposed system outperforms conventional cascade approach and the WaveNet based end-to-end approach in terms of both singing quality and singer similarity. Further objective analysis reveals that the model trained with the proposed two-stage training strategy can produce a smoother and sharper formant which leads to higher audio quality.

연구 동기 및 목표

  • 고음질과 높은 화자 유사도를 갖춘 임의의 톤 색채 이동을 가능하게 하는 엔드 투 엔드 노래 음성 변환 시스템을 개발하는 것.
  • 노래 음성 변환에서 콘텐츠, 음고, 톤 색채 표현 간의 상호의존성을 해결하기 위해 특징 분리 기반의 접근을 제공하는 것.
  • 적대적 훈련과 이중 단계 훈련 전략, 다중 해상도 STFT 손실을 통합하여 음성 품질과 안정성을 향상시키는 것.
  • 분리된 화자 임베딩 분해를 통해 제어 가능한 톤 색채 이동과 음고 조작을 가능하게 하는 것.
  • 주관적 및 객관적 평가 모두에서 기존의 캐스케이드 및 WaveNet 기반 엔드 투 엔드 방법을 뛰어넘는 성능을 달성하는 것.

제안 방법

  • PPG, F0, 및 화자 임베딩을 웨이브폼으로 매핑하는 MelGAN 기반 생성기로, PPG와 F0의 순차적 맥락을 추출하기 위해 병렬 CNN-BLSTM 인코더를 사용한다.
  • 화자 임베딩을 별개의 톤 색채/화자 클러스터를 나타내는 학습 가능한 벡터들의 가중합으로 분해하여 톤 색채 표현의 안정성과 제어 가능성 향상.
  • 두 개의 판별기 사용: $D_A$ 는 웨이브폼 생성을 위한 현실감 있는 음성 향상을 위해 사용되며, $D_F$ 는 인코딩된 PPG에서 음고 및 톤 색채 정보를 분리하기 위해 사용된다.
  • 이중 단계 훈련 전략 적용: 먼저 다중 해상도 STFT(MR-STFT) 손실을 사용한 사전 훈련을 수행하고, 이후 MR-STFT 손실과 적대적 손실을 함께 최적화하여 GAN 훈련의 안정성 향상.
  • 특징 분리 판별기 $D_F$ 는 인코딩된 PPG에서 F0와 화자 임베딩을 예측하도록 훈련되어, PPG 표현이 음고 및 톤 색채 정보를 포함하지 않도록 강제한다.
  • 적대적 손실과 재구성 손실을 함께 사용하여 엔드 투 엔드로 훈련되며, 콘텐츠, 음고, 톤 색채 특징에서 직접 웨이브폼 생성이 가능하다.

실험 결과

연구 질문

  • RQ1단일 엔드 투 엔드 모델이 고음질의 노래 음성 변환과 안정적인 음고 제어를 가능하게 하는가?
  • RQ2톤 색채 클러스터로 분해된 화자 임베딩이 톤 색채 표현 향상과 변환 제어 가능성 향상에 얼마나 효과적인가?
  • RQ3특징 분리 판별기($D_F$)의 포함 여부가 PPG 표현에서의 음고 및 톤 색채 누출을 줄이고 음성 품질을 향상시키는가?
  • RQ4이중 단계 훈련 전략이 노래 음성 변환에서 적대적 훈련의 안정성과 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 방법이 캐스케이드 및 WaveNet 기반 엔드 투 엔드 방법에 비해 노래 품질과 화자 유사도 측면에서 얼마나 뛰어나게 되는가?

주요 결과

  • 제안된 EA-SVC 모델은 노래 품질에 대해 평균 평가 점수(MOS) 3.78 ± 0.11, 화자 유사도에 대해 3.60 ± 0.13을 기록하여 캐스케이드 방법과 WaveNet 기반 엔드 투 엔드 방법을 모두 초월한다.
  • 제거 실험 결과, 화자 임베딩 분해와 $D_F$ 를 모두 제거할 경우 성능이 가장 열 劣해졌으며(MOS 3.26 ± 0.11), 이는 양 구성 요소의 필수성을 확인한다.
  • 화자 임베딩 분해만 적용한 모델은 MOS가 3.52 ± 0.12(품질) 및 3.55 ± 0.12(유사도)로 향상되어 톤 색채 표현의 강건성 향상을 확인한다.
  • 특징 분리 판별기 $D_F$ 는 음고 간섭과 형성자 흐림 현상을 크게 감소시켜 스펙트로그램에서 더 선명하고 명확한 형성자를 유도한다.
  • 이중 단계 훈련 전략은 적대적 손실만으로 훈련된 모델 대비 더 부드럽고 선명한 형성자를 생성함을 스펙트로그램 비교를 통해 입증한다.
  • 톤 색채 이동 실험 결과, 분해된 모델은 톤 색채 간 선형적이고 제어 가능한 보간이 가능하지만, 비분해 모델은 일관된 스펙트럼 경향을 유지를 하지 못함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.