[논문 리뷰] VAW-GAN for Singing Voice Conversion with Non-parallel Training Data
이 논문은 조건부 디코더를 통해 음소 내용에서 가수 신원과 F0 윤곽을 분리하는 VAW-GAN 기반의 비병렬 노래 음성 변환 프레임워크를 제안한다. 디코더를 가수 신원과 F0에 조건부로 설정함으로써, 병렬 학습 데이터가 필요 없이 고해상도 음성 변환을 달성하며, 내성적 및 이성별 설정 모두에서 스펙트럼 유사도, 음성 품질, 가수 유사도 측면에서 기준 모델을 능가한다.
Singing voice conversion aims to convert singer's voice from source to target without changing singing content. Parallel training data is typically required for the training of singing voice conversion system, that is however not practical in real-life applications. Recent encoder-decoder structures, such as variational autoencoding Wasserstein generative adversarial network (VAW-GAN), provide an effective way to learn a mapping through non-parallel training data. In this paper, we propose a singing voice conversion framework that is based on VAW-GAN. We train an encoder to disentangle singer identity and singing prosody (F0 contour) from phonetic content. By conditioning on singer identity and F0, the decoder generates output spectral features with unseen target singer identity, and improves the F0 rendering. Experimental results show that the proposed framework achieves better performance than the baseline frameworks.
연구 동기 및 목표
- 비병렬 학습 데이터가 필요한 노래 음성 변환 시스템을 개발하는 것, 이는 수집이 비용이 많이 들고 실용적이지 않다.
- 가수 신원과 F0 윤곽을 음소 내용에서 분리하여 더 나은 제어력과 변환 정확도를 확보하는 것.
- 비병렬 환경에서 F0 조건부를 사용하여 노래 음성 변환의 음성 품질과 가수 유사도를 향상시키는 것.
- 학습 파이프라인에서 시간 정렬, ASR 또는 외부 모듈에 의존하지 않도록 하는 것.
- 비병렬 노래 음성 변환에서 F0 조건부의 효과를 입증하는 것, 이는 이 분야에서의 새로운 기여이다.
제안 방법
- 프레임워크는 가수 신원, F0 윤곽, 음소 내용의 분리된 표현을 학습하기 위해 VAW-GAN 기반의 인코더-디코더 아키텍처를 사용한다.
- 인코더는 입력 노래 음성을 가수 신원과 F0에 독립적인 잠재 코드로 매핑하여, 다양한 신원 간의 변환을 가능하게 한다.
- 디코더는 잠재 코드, 대상 가수 신원, F0 윤곽에 조건부로 스펙트럼 특징(MCEPs)을 재구성하여 대상 스타일의 음성을 생성한다.
- F0 조건부는 디코더에 명시적으로 삽입되어 F0 렌더링 및 스펙트럼 정확도를 향상시킨다.
- 모델은 적대적 손실, 재구성 손실, VAE 기반의 KL 분산 항목을 사용하여 엔드 투 엔드로 학습된다.
- VAE 기반 아키텍처의 분리 성질 덕분에 병렬 데이터나 강제 정렬이 필요 없이 비병렬 학습이 가능하다.
실험 결과
연구 질문
- RQ1비병렬 노래 음성 변환 시스템은 병렬 학습 데이터가 없이도 고품질의 음성 변환을 달성할 수 있는가?
- RQ2디코더를 F0에 조건부로 설정하면 스펙트럼 정확도와 음성 품질이 향상되는가?
- RQ3가수 신원과 F0 윤곽의 분리된 표현 학습이 더 나은 제어력과 변환 성능을 이끌 수 있는가?
- RQ4제안된 F0 조건부 메커니즘은 이러한 조건부가 없는 기준 모델 대비 목적적 및 주관적 지표에서 어떻게 비교되는가?
- RQ5이 프레임워크는 내성적 및 이성별 음성 변환 작업 전반에 걸쳐 얼마나 일반화되는가?
주요 결과
- 제안된 VAW-GAN (SID+F0) 프레임워크는 남성에서 남성으로의 변환에서 평균 MCD 5.51 dB, 남성에서 여성으로의 변환에서 6.57 dB를 기록하여, 기준 VAW-GAN (SID)의 6.20 dB 및 7.39 dB를 초월한다.
- 주관적 MOS 평가에서 남성-남성 변환의 경우 평균 점수 3.03 ± 0.28, 남성-여성 변환의 경우 2.90 ± 0.31로, 음성 품질 향상이 뚜렷하게 나타난다.
- XAB 선호도 테스트에서 남성-남성 변환에서는 84.7%의 청취자가 제안 모델을 기준 모델보다 선호했으며, 남성-여성 변환에서는 56.7%로, 가수 유사도가 뛰어나다는 것을 입증한다.
- F0 조건부 메커니즘이 F0 렌더링 및 스펙트럼 정밀도를 크게 향상시켜, 낮은 MCD 및 높은 MOS 점수로 입증된다.
- 비병렬 데이터, 시간 정렬, 또는 ASR와 같은 외부 모듈이 필요 없어 학습 파이프라인이 단순화된다.
- 결과는 잠재 코드에서 가수 신원과 F0를 분리함으로써 효과적인 다대다 노래 음성 변환을 가능하게 한다는 점을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.