Skip to main content
QUICK REVIEW

[논문 리뷰] Statistical Parametric Speech Synthesis Incorporating Generative Adversarial Networks

Yuki Saito, Shinnosuke Takamichi|arXiv (Cornell University)|2017. 09. 23.
Speech and Audio Processing인용 수 12
한 줄 요약

이 논문은 자연어와 생성된 음성 간의 분포 차이를 최소화함으로써 합성 음성 매개변수의 과도한 부드러움을 줄이는 GAN 기반 학습 프레임워크를 제안한다. 진짜와 합성 매개변수를 구분하는 판별자와 함께 음성 모델을 함께 학습시킴으로써, 텍스트-to-음성 및 음성 변환 모두에서 스펙트럼과 F0의 자연스러움이 향상되며, 워샤르슈타인 GAN이 다양한 초모수 설정에서 가장 높은 음성 품질을 달성한다.

ABSTRACT

A method for statistical parametric speech synthesis incorporating generative adversarial networks (GANs) is proposed. Although powerful deep neural networks (DNNs) techniques can be applied to artificially synthesize speech waveform, the synthetic speech quality is low compared with that of natural speech. One of the issues causing the quality degradation is an over-smoothing effect often observed in the generated speech parameters. A GAN introduced in this paper consists of two neural networks: a discriminator to distinguish natural and generated samples, and a generator to deceive the discriminator. In the proposed framework incorporating the GANs, the discriminator is trained to distinguish natural and generated speech parameters, while the acoustic models are trained to minimize the weighted sum of the conventional minimum generation loss and an adversarial loss for deceiving the discriminator. Since the objective of the GANs is to minimize the divergence (i.e., distribution difference) between the natural and generated speech parameters, the proposed method effectively alleviates the over-smoothing effect on the generated speech parameters. We evaluated the effectiveness for text-to-speech and voice conversion, and found that the proposed method can generate more natural spectral parameters and $F_0$ than conventional minimum generation error training algorithm regardless its hyper-parameter settings. Furthermore, we investigated the effect of the divergence of various GANs, and found that a Wasserstein GAN minimizing the Earth-Mover's distance works the best in terms of improving synthetic speech quality.

연구 동기 및 목표

  • 딥 뉴럴 네트워크 기반 통계적 매개변수 음성 합성에서 발생하는 과도한 부드러움 현상으로 인한 합성 음성 품질 저하 문제를 해결하기 위함.
  • 특히 스펙트럼 및 F0 특징에서 자연어와 생성된 음성 매개변수 간의 분포 유사도를 향상시키기 위함.
  • 글로벌 분산이나 조절 스펙트럼과 같은 통계적 특징의 명시적 모델링을 피하는 일반화 가능한 학습 프레임워크를 개발하기 위함.
  • 다양한 GAN 변종이 텍스트-to-음성 및 음성 변환 작업에서 음성 품질 향상에 미치는 영향을 평가하기 위함.
  • 다양한 분포 차이 측정 방법이 합성 음성 품질 최적화에 미치는 역할을 탐색하기 위함.

제안 방법

  • 판별자가 진짜와 생성된 음성 매개변수를 구분하도록 하는 GAN 프레임워크를 도입하며, 생성자(음성 모델)는 판별자를 속이도록 학습된다.
  • 생성 오차 최소화(MGE) 손실과 적대적 손실의 가중 합을 사용하여 음성 모델을 학습함으로써 생성 오차와 분포 차이를 동시에 최소화한다.
  • 판별자는 데이터셋에서 추출한 실제 음성 매개변수와 음성 모델에서 생성된 매개변수를 분류하도록 학습되며, 현실적인 매개변수 분포를 촉진한다.
  • 글로벌 분산이나 조절 스펙트럼과 같은 특징 엔지니어링 없이도 음성 매개변수 내 복잡한 통계적 의존성을 암묵적으로 모델링한다.
  • 워샤르슈타인 GAN(지구이동 거리 최소화), LS-GAN, f-GAN, JS-GAN 등의 다양한 GAN 변종을 평가하여 음성 품질에 미치는 영향을 비교한다.
  • 공통된 학습 절차와 평가 프로토콜을 사용하여 텍스트-to-음성 및 음성 변환 모두에 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1GAN 프레임워크를 활용한 적대적 학습이 합성 음성 매개변수의 과도한 부드러움을 효과적으로 줄일 수 있는가?
  • RQ2예를 들어 W-GAN과 JS-GAN 간의 분포 차이 측정 방법 선택이 합성 음성의 청취 품질에 어떤 영향을 미치는가?
  • RQ3제안된 GAN 기반 학습이 텍스트-to-음성 및 음성 변환 작업 모두에서 음성 품질 향상에 기여하는가?
  • RQ4판별자가 합성 음성을 탐지하는 '위조 방지' 메커니즘으로 기능할 수 있으며, 이는 학습에 어떤 영향을 미치는가?
  • RQ5명시적인 통계적 특징 모델링(예: GV, MS)보다 GAN 기반 방법이 음성 자연스러움 향상에 더 효과적인가?

주요 결과

  • 제안된 방법은 모든 초모수 설정에서 텍스트-to-음성 및 음성 변환 모두에서 음성 품질을 크게 향상시켰으며, MOS 점수도 높았다.
  • 지구이동 거리를 최소화하는 워샤르슈타인 GAN(W-GAN)이 지구이동 거리 최소화 외의 모든 GAN 변종보다 높은 주관적 음성 품질을 달성했다.
  • KL-GAN은 품질 향상에 기여하지 않았지만, 반전된 형태인 RKL-GAN은 향상되었으며, 이는 비대칭 분포 차이 측정 방법이 기대와 반대되는 효과를 가질 수 있음을 시사한다.
  • JS-GAN은 성능이 열악했지만, 시그모이드 활성화 함수를 사용한 근사 GAN은 더 나은 결과를 보였으며, 이는 근사 안정성이 중요하다는 것을 시사한다.
  • 이 방법은 글로벌 분산과 매개변수 간 상관관계를 효과적으로 보완하여 스펙트럼과 F0의 자연스러움을 모두 향상시켰다.
  • 선호도 테스트 결과, 제안된 방법은 음성 변환에서 전통적인 MGE 학습 대비 음성 품질과 화자 개성 측면에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.