Skip to main content
QUICK REVIEW

[논문 리뷰] A comparison of recent waveform generation and acoustic modeling methods for neural-network-based speech synthesis

Xin Wang, Jaime Lorenzo-Trueba|arXiv (Cornell University)|2018. 04. 07.
Speech Recognition and Synthesis참고 문헌 14인용 수 7
한 줄 요약

이 논문은 대규모 커스터마이즈드 평가를 통해 통합 TTS 프레임워크에서 최근의 신경망 기반 음성 모델과 보이스코더를 비교한다. 자동회귀(AR) 음성 모델이 표준 RNN과 GAN 기반 후처리 필터보다 우수하며, WaveNet 보이스코더가 전통적인 소스-필터 보이스코더보다 음성 품질을 크게 향상시키며, AR + WaveNet 조합은 거의 보이스코딩된 음성 품질에 도달한다.

ABSTRACT

Recent advances in speech synthesis suggest that limitations such as the lossy nature of the amplitude spectrum with minimum phase approximation and the over-smoothing effect in acoustic modeling can be overcome by using advanced machine learning approaches. In this paper, we build a framework in which we can fairly compare new vocoding and acoustic modeling techniques with conventional approaches by means of a large scale crowdsourced evaluation. Results on acoustic models showed that generative adversarial networks and an autoregressive (AR) model performed better than a normal recurrent network and the AR model performed best. Evaluation on vocoders by using the same AR acoustic model demonstrated that a Wavenet vocoder outperformed classical source-filter-based vocoders. Particularly, generated speech waveforms from the combination of AR acoustic model and Wavenet vocoder achieved a similar score of speech quality to vocoded speech.

연구 동기 및 목표

  • 현대 신경망 TTS 구성 요소를 공정하고 대규모 평가할 수 있는 프레임워크를 수립하기 위해.
  • 특히 자동회귀 및 GAN 기반 모델을 포함한 고급 음성 모델링 기법이 음성 품질에 미치는 영향을 조사하기 위해.
  • 특히 WaveNet을 포함한 딥러닝 기반 보이스코더가 고전적인 소스-필터 보이스코더와 비교하여 성능을 평가하기 위해.
  • 고음질 음성 합성에 가장 효과적인 음성 모델과 보이스코더의 조합을 규명하기 위해.
  • 감각적 품질에 영향을 주는 웨이브폼 단계 모델링 및 단계 복구의 역할을 분석하기 위해.

제안 방법

  • 표준 SPSS 기반 백엔드를 사용하여 공통된 프론트엔드와 지속시간 모델링을 공유하는 통합 TTS 파이프라인을 구축하였다.
  • 네 가지 음성 모델을 비교: 표준 RNN, 얕은 AR-RNN(SAR), RNN 및 SAR 출력에 적용된 두 가지 GAN 기반 후처리 필터 네트워크(SGA, RGA).
  • 네 가지 보이스코더 평가: WORLD, PML, WORLD와 함께 사용된 Griffin-Lim, WaveNet; 모든 보이스코더는 동일한 SAR 모델의 음성 특징을 사용하였다.
  • 음성 품질과 화자 유사도는 235명의 일본어 모국어 사용자 대상 대규모 커스터마이즈드 청취 테스트를 통해 평가되었다.
  • 통계 분석은 평균 점수 간 비교를 위해 무작위로 선택된 t-검정과 Holm-Bonferroni 보정을 사용하였다.
  • 감각적 차이를 설명하기 위해 전역 분산 및 조율 스펙트럼과 같은 스펙트럼 및 시간 도메인 특징을 분석하였다.

실험 결과

연구 질문

  • RQ1자동회귀 및 GAN 기반 음성 모델은 표준 RNN과 비교해 음성 품질과 자연스러움 측면에서 어떻게 다른가?
  • RQ2WaveNet 보이스코더는 WORLD 및 PML와 같은 고전적인 소스-필터 보이스코더보다 감각적 품질에서 뛰어나지 않는가?
  • RQ3고급 음성 모델과 WaveNet 보이스코더의 조합이 보이스코딩된 음성 수준의 음성 품질을 달성할 수 있는가?
  • RQ4기존 보이스코더를 사용할 경우 Griffin-Lim를 통한 단계 복구가 음성 품질에 어떤 영향을 미치는가?
  • RQ5GAN 기반 후처리 필터가 스펙트럼 세부 정보를 향상시켰음에도 불구하고 왜 AR 모델에 뒤지게 되는가?

주요 결과

  • 자동회귀(SAR) 음성 모델은 모든 음성 모델 중에서 가장 높은 음성 품질 점수(3.03)를 기록했으며, RNN(2.53), SGA(2.82), RGA(2.81)를 유의미하게 앞섰다.
  • RNN 모델은 과도하게 부드럽게 만드는 효과를 보였으며, 다른 모델들과 비교해 생성된 MGC 특징의 전역 분산이 낮게 나타났다.
  • WaveNet 보이스코더는 모든 다른 보이스코더보다 유의미하게 뛰어난 성능을 보였으며, SAR-Wa가 가장 높은 음성 품질 점수를 기록했고, 일부 경우에서 48 kHz 보이스코딩된 음성보다 더 낫다고 평가되었다.
  • SAR 음성 모델과 WaveNet 보이스코더의 조합은 보이스코딩된 음성 수준의 음성 품질을 거의 달성했으며, 이는 거의 최적의 성능임을 시사한다.
  • Griffin-Lim 알고리즘을 통한 단계 복구는 품질 향상에 기여하지 않았으며, SAR-Pr와 SAR-Wo 간 유의미한 점수 향상이 없었으며, 오히려 잡음과 같은 잡음 요소를 유발할 수 있음을 보여주었다.
  • GAN 기반 후처리 필터(SGA, RGA)는 스펙트럼 세부 정보와 전역 분산을 향상시켰지만, 더 많은 잡음 요소를 유발하여, 더 나은 스펙트럼 특징에도 불구하고 AR 모델에 비해 감각적 품질이 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.