[논문 리뷰] Probability density distillation with generative adversarial networks for high-quality parallel waveform generation
이 논문은 WaveNet 기반 병렬 웨이브포맷 생성을 위한 GAN 기반 확률 밀도 증류(PDD) 방법을 제안한다. 여기서 역자기회귀 흐름(IAF) 학생 모델이 기존 PDD와 함께 GAN 생성기로 훈련되어 음성 품질을 향상시킨다. 이 방법은 청취자 평가 점수(MOS) 4.186을 기록하며, 자동회귀 교사 WaveNet을 능가하는 뛰어난 청취적 품질을 달성한다.
This paper proposes an effective probability density distillation (PDD) algorithm for WaveNet-based parallel waveform generation (PWG) systems. Recently proposed teacher-student frameworks in the PWG system have successfully achieved a real-time generation of speech signals. However, the difficulties optimizing the PDD criteria without auxiliary losses result in quality degradation of synthesized speech. To generate more natural speech signals within the teacher-student framework, we propose a novel optimization criterion based on generative adversarial networks (GANs). In the proposed method, the inverse autoregressive flow-based student model is incorporated as a generator in the GAN framework, and jointly optimized by the PDD mechanism with the proposed adversarial learning method. As this process encourages the student to model the distribution of realistic speech waveform, the perceptual quality of the synthesized speech becomes much more natural. Our experimental results verify that the PWG systems with the proposed method outperform both those using conventional approaches, and also autoregressive generation systems with a well-trained teacher WaveNet.
연구 동기 및 목표
- 교사-학생 프레임워크를 사용하여 병렬 웨이브포맷 생성(PWG) 시스템의 청취적 품질을 향상시키는 것.
- 기존 PDD 방법의 한계를 해결하기 위한 것 — 즉, 쿨백-라이블러 발산(KLD) 최소화로 인해 교사의 품질을 초월할 수 없다는 점.
- 생성적 적대적 네트워크(GANs)의 분포 모델링 능력을 활용하여 합성 음성의 현실감을 향상시키는 것.
- 표본 수준의 현실감을 향상시키기 위해 PDD, 보조 손실, 그리고 적대적 훈련을 함께 최적화하는 학생 모델을 최적화하는 것.
제안 방법
- 병렬적이고 실시간인 음성 웨이브포맷 생성을 가능하게 하기 위해, 역자기회귀 흐름(IAF) 모델을 학생 네트워크로 사용한다.
- IAF 학생 모델을 GAN 프레임워크의 생성기로 통합하여 자연 음성 웨이브포맷의 분포를 모델링하기 위한 새로운 적대적 손실로 훈련한다.
- 학생 모델은 세 가지 요소를 함께 최적화한다: KLD 기반 PDD, 프레임 수준의 STFT 손실(보조 손실), 그리고 GAN 기반의 적대적 손실.
- 손실 함수는 KLD, STFT 손실, 그리고 적대적 손실을 학습 가능한 가중치 계수를 통해 조합하여 분포 일치, 스펙트럼 정밀도, 청취적 현실감을 균형 있게 유지한다.
- 훈련 과정은 전체 KLD 가이드로 시작하여 훈련이 진행됨에 따라 KLD 가중치를 점차 감소시켜 학생 모델이 교사의 분포를 초월할 수 있도록 허용한다.
- 제안된 방법은 GAN이 복잡하고 현실적인 음성 분포를 모델링할 수 있는 능력을 활용하여 학생 모델이 교사의 청취적 품질을 뛰어넘을 수 있도록 한다.
실험 결과
연구 질문
- RQ1적대적 훈련이 IAF 기반 병렬 웨이브포맷 생성의 청취적 품질을 교사 WaveNet을 초월하게 할 수 있는가?
- RQ2GAN 기반의 적대적 손실을 기존 PDD와 보조 손실과 조합하면 음성 합성 품질에 어떤 영향을 미치는가?
- RQ3비자기회귀적 IAF 학생 모델이 공동 최적화를 통해 자동회귀적 교사 WaveNet보다 더 높은 청취적 품질을 달성할 수 있는가?
- RQ4훈련 목표에서 KLD 증류, 스펙트럼 손실, 그리고 적대적 손실 간의 최적의 균형은 무엇인가?
주요 결과
- 제안된 KLAXAD 방법은 평균 평가 점수(MOS) 4.186을 기록하여 기존의 PDD 방법과 자동회귀적 교사 WaveNet을 뛰어넘는다.
- A/B/X 선호도 테스트는 가중치 최적화 버전(KLAXAD*)이 원본 KLAXAD 설정보다 더 높은 청취적 품질을 확보했다는 것을 확인했다.
- 보조 손실만으로 훈련된 IAF 학생 모델(AX)이 가장 열 劣했으며, 이는 고품질 합성에 PDD와 적대적 훈련이 필수적임을 시사한다.
- KLD 증류, STFT 손실, 그리고 적대적 손실의 조합은 청취적 품질 향상에 상당한 기여를 하였으며, 학생 모델이 MOS에서 교사를 뛰어넘는 결과를 이끌었다.
- 훈련 중 KLD 가중치 계수를 감소시킴으로써 학생 모델이 더 자연스러운 음성을 생성할 수 있었으며, 이는 교사의 분포에 과도하게 의존할 경우 품질이 제한될 수 있음을 시사한다.
- 결과적으로 GAN 기반의 적대적 훈련이 비자기회귀적 음성 생성의 현실감을 효과적으로 향상시키며, 특히 고품질 교사 모델에서 증류된 학생 모델에서도 성능 향상을 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.