[논문 리뷰] VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
VoiceGrad는 병렬 데이터가 없는 임의의 원본 스피커에서 복수의 목표 스피커로의 음성 변환을 가능하게 하는 비병렬, 임의의-다수 음성 변환 방법을 제안한다. 이는 냉각된 랭그비안 역동성과 스코어 매칭을 활용하여 고해상도 음성 변환을 실현하며, 병렬 학습 데이터가 필요하지 않다. 음성 특징의 스코어를 근사하는 U-Net 기반 모델을 가중치가 부여된 노이즈 제거 스코어 매칭을 통해 학습하고, 입력 특징을 목표 스피커의 분포로 반복적으로 개선함으로써 변환을 수행한다. 이로써 개방형 시나리오에서 최신 기술 수준의 성능을 달성하며, 더 뛰어난 스피커 유사성과 음성 품질을 확보한다.
In this paper, we propose a non-parallel any-to-many voice conversion (VC) method termed VoiceGrad. Inspired by WaveGrad, a recently introduced novel waveform generation method, VoiceGrad is based upon the concepts of score matching and Langevin dynamics. It uses weighted denoising score matching to train a score approximator, a fully convolutional network with a U-Net structure designed to predict the gradient of the log density of the speech feature sequences of multiple speakers, and performs VC by using annealed Langevin dynamics to iteratively update an input feature sequence towards the nearest stationary point of the target distribution based on the trained score approximator network. Thanks to the nature of this concept, VoiceGrad enables any-to-many VC, a VC scenario in which the speaker of input speech can be arbitrary, and allows for non-parallel training, which requires no parallel utterances or transcriptions.
연구 동기 및 목표
- 병렬 음성 데이터나 스피커별 재학습이 필요 없이 비병렬 음성 변환 방법을 개발하여 임의의 원본 스피커에서 복수의 목표 스피커로의 변환을 지원한다.
- 비병렬 VC 방법이 개방형 시나리오에서 새로운 스피커에 적용되었을 때 발생하는 일반화 갭을 해결한다.
- 냉각된 랭그비안 역동성을 활용한 스코어 기반 생성 모델링을 통해 음성 변환 품질과 스피커 유사성을 향상시킨다.
- 병문자나 쌍화된 데이터가 필요 없이 다수의 스피커에서의 실제 음성 특징만을 사용하여 엔드 투 엔드 학습을 가능하게 한다.
- 학습 데이터에 포함되지 않은 원본 스피커에 대해 제로샷 설정에서의 강건성과 성능 향상을 입증한다.
제안 방법
- 다양한 스피커의 음성 특징 시퀀스의 스코어(로그 밀도의 도함수)를 근사하기 위해, 완전 컨volutional U-Net 네트워크를 가중치가 부여된 노이즈 제거 스코어 매칭을 통해 학습한다.
- 학습된 스코어 근사기 모델은 목표 스피커의 분포의 로그 밀도 도함수를 추정하여 특징 개선을 위한 가이던스를 제공한다.
- 음성 변환은 냉각된 랭그비안 역동성을 통해 수행되며, 이는 입력 특징 시퀀스를 목표 분포의 가장 가까운 정적 점으로 반복적으로 업데이트한다.
- 냉각 스케줄은 샘플링 과정에서 점차 노이즈를 감소시켜 수렴성과 음성 품질을 향상시킨다.
- 학습은 병행되지 않은 다수 스피커의 실제 음성 특징을 기반으로 엔드 투 엔드로 수행되며, 추론 시 병렬 데이터나 스피커 임bedding이 필요하지 않다.
- 모델은 재학습이나 적응 없이도 임의의 원본 스피커를 지원하며, 훈련된 목표 스피커 중 어느 한 명에게나 변환할 수 있다.

실험 결과
연구 질문
- RQ1스코어 기반 생성 모델이 병렬 훈련 데이터 없이도 고해상도 비병렬 음성 변환을 달성할 수 있는가?
- RQ2냉각된 랭그비안 역동성이 다수 스피커 환경에서 목표 스피커 분포로 향하는 특징 시퀀스의 개선을 효과적으로 이끌 수 있는가?
- RQ3제안된 방법이 새로운 원본 스피커가 포함된 개방형 시나리오에서 기존 비병렬 VC 방법보다 더 잘 일반화되는가?
- RQ4VAE 기반 및 GAN 기반 기준선 대비 음성 품질과 스피커 유사성 측면에서 성능이 어떻게 비교되는가?
- RQ5스피커별 적응 없이 단일 통합 네트워크를 사용하여 임의의-다수 변환을 달성할 수 있는가?
주요 결과
- 개방형 시나리오에서 VoiceGrad는 모든 스피커 쌍에 대해 7.55±0.05의 최저 MCD를 기록하여, 다음으로 우수한 성능을 보인 StarGAN-VC(W)를 포함한 모든 기준선을 압도했다.
- 기준선 방법 대비 개방형 평가에서 성능 저하가 현저히 적어, 새로운 스피커에 대한 일반화 능력이 뛰어나다는 것을 보여주었다.
- 주관적 MOS 테스트에서 VoiceGrad는 음성 품질 평가 점수 3.85±0.12와 스피커 유사성 점수 3.92±0.11를 기록하여 모든 기준선을 능가했으며, VAE-VC와 StarGAN-VC(C)에 비해 뚜렷한 향상을 보였다.
- 개방형 시나리오에서 7.55±0.05의 MCD를 기록하여 다음으로 좋은 방법인 StarGAN-VC(W)의 7.96±0.06보다 0.41점 향상되어 뛰어난 강건성을 입증했다.
- VoiceGrad는 다양한 스피커 조합, 특히 lnh→clb와 lnh→bdl과 같은 새로운 조합에서도 강력한 성능을 유지했으며, MCD는 각각 6.75±0.08과 7.21±0.17이었다.
- 결과는 스코어 기반 모델링과 냉각된 랭그비안 역동성을 통해 병렬 데이터나 명시적 스피커 조건 없이도 효과적이고 일반화 가능한 음성 변환을 실현할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.