Skip to main content
QUICK REVIEW

[논문 리뷰] WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis

Nanxin Chen, Yu Zhang|arXiv (Cornell University)|2021. 06. 17.
Speech Recognition and Synthesis참고 문헌 33인용 수 5
한 줄 요약

WaveGrad 2는 음소 시퀀스에서 직접 고음질 음성 웨이브폼을 생성하기 위해 반복적인 스코어 기반 정련을 사용하는 비자기적, 엔드 투 엔드 텍스트투스피치 모델이다. 확산 유사 샘플링을 통해 가우시안 노이즈를 제거하는 스코어 네트워크를 훈련시켜, 조정 가능한 정련 단계를 통해 속도와 품질 사이의 자연스러운 트레이드오프를 가능하게 하여 평균 평가 점수(MOS) 4.43을 달성한다. 이는 최신 기술 수준의 시스템에 근접한 성능이다.

ABSTRACT

This paper introduces WaveGrad 2, a non-autoregressive generative model for text-to-speech synthesis. WaveGrad 2 is trained to estimate the gradient of the log conditional density of the waveform given a phoneme sequence. The model takes an input phoneme sequence, and through an iterative refinement process, generates an audio waveform. This contrasts to the original WaveGrad vocoder which conditions on mel-spectrogram features, generated by a separate model. The iterative refinement process starts from Gaussian noise, and through a series of refinement steps (e.g., 50 steps), progressively recovers the audio sequence. WaveGrad 2 offers a natural way to trade-off between inference speed and sample quality, through adjusting the number of refinement steps. Experiments show that the model can generate high fidelity audio, approaching the performance of a state-of-the-art neural TTS system. We also report various ablation studies over different model configurations. Audio samples are available at https://wavegrad.github.io/v2.

연구 동기 및 목표

  • 메르-스펙트로그램과 같은 수작업으로 설계된 중간 특징을 생략하고 완전히 엔드 투 엔드 텍스트투스피치 시스템을 개발하는 것.
  • 조정 가능한 정련 단계를 통해 속도와 품질 사이의 제어 가능한 트레이드오프를 제공하는 비자기적 고음질 음성 생성을 가능하게 하는 것.
  • 보조 손실이나 적대적 훈련에 의존하지 않고 TTS의 일대다 매핑 문제를 해결하는 것.
  • 지속적인 시간에 따른 인코더 표현의 인식 및 스코어 매칭을 통한 아키텍처 혁신을 통해 강건성과 품질을 향상시키는 것.
  • 엔드 투 엔드 TTS 훈련에서 데이터 증강과 다중작업 학습의 효과를 평가하는 것.

제안 방법

  • 음성 웨이브폼의 로그우도의 기울기를 음소 시퀀스에 대해 추정하기 위해 신경망을 스코어 매칭을 통해 훈련하는 방식.
  • 초기에는 무작위 가우시안 노이즈에서 시작하여, 학습된 스코어 함수를 사용해 랭드비안 역학을 적용해 웨이브폼 추정치를 반복적으로 업데이트하는 정련 프로세스를 적용하는 방식.
  • 주의 기반 정렬을 대체하기 위해 지속시간 예측기와 함께 비자기적 인코더를 통합해 맥락 인식 표현을 생성하는 방식.
  • 노이즈 스케줄을 모델링하기 위해 재구성 기법을 적용하여, 예측된 노이즈 항목과 진짜 노이즈 항목 간의 L1 거리 최소화를 통해 훈련을 수행하는 방식.
  • 학습 가능한 노이즈 스케줄을 가진 WaveGrad 디코더를 사용해 다중 단계에 걸쳐 신호를 점진적으로 정제하는 방식.
  • 강화된 강건성을 확보하기 위해 인코더 표현에 대해 히든 특징 증강(마스킹 블록 드롭아웃)을 적용하는 방식.

실험 결과

연구 질문

  • RQ1중간 스펙트로그램 특징 없이 비자기적 TTS 모델이 고음질 음성을 생성할 수 있는가?
  • RQ2정련 단계 수가 생성 속도와 음성 품질 사이의 트레이드오프에 어떻게 영향을 미치는가?
  • RQ3메르-스펙트로그램 예측을 통한 다중작업 학습이 엔드 투 엔드 TTS 성능을 향상시키는가?
  • RQ4히든 표현 증강(예: 마스킹 블록 드롭아웃)이 모델의 강건성 향상에 얼마나 효과적인가?
  • RQ5모델 크기와 아키텍처 구성이 주관적 음성 품질에 어떤 영향을 미치는가?

주요 결과

  • WaveGrad 2는 평균 평가 점수(MOS) 4.43을 달성하여 최신 기술 수준의 신경망 TTS 시스템의 성능에 근접한다.
  • 정련 단계 수를 50에서 1000으로 늘일 경우 MOS가 4.32에서 4.37로 향상되어 속도-품질 트레이드오프가 명확히 드러난다.
  • WaveGrad 디코더 크기를 크게 하면(대규모) MOS가 4.05에서 4.37로 크게 향상되며, 인코더 크기만 크게 해도 성능 향상이 크지 않다.
  • 히든 표현에 SpecAugment 스타일의 증강을 적용하면 MOS가 4.37에서 4.40으로 약간 향상되어 강건성 향상 효과가 확인된다.
  • 메르-스펙트로그램 예측을 통한 다중작업 학습은 성능 향상에 유의미한 기여를 하지 않아 엔드 투 엔드 훈련에 유용하지 않음을 시사한다.
  • 모델 성능은 디코더 용량에 가장 민감하며, 인코더 크기의 영향은 품질 향상에 있어 더 작은 경향을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.