Skip to main content
QUICK REVIEW

[논문 리뷰] WaveTTS: Tacotron-based TTS with Joint Time-Frequency Domain Loss

Rui Liu, Berrak Şişman|arXiv (Cornell University)|2020. 02. 02.
Speech Recognition and Synthesis참고 문헌 44인용 수 4
한 줄 요약

WaveTTS는 타코트론 기반의 음성 합성 프레임워크로, 시간 도메인 파형 품질과 주파수 도메인 음향 특징을 이중 손실 함수를 통해 동시에 최적화한다: 시간 도메인 손실(SI-SDR)과 표준 멜 스펙트로그램 손실. 이 이중 학습은 음성 품질을 크게 향상시키며, MOS 및 선호도 테스트에서 기준 모델들을 능가한다. 이는 타코트론 기반 TTS에서 이러한 방식을 처음으로 구현한 것이다.

ABSTRACT

Tacotron-based text-to-speech (TTS) systems directly synthesize speech from text input. Such frameworks typically consist of a feature prediction network that maps character sequences to frequency-domain acoustic features, followed by a waveform reconstruction algorithm or a neural vocoder that generates the time-domain waveform from acoustic features. As the loss function is usually calculated only for frequency-domain acoustic features, that doesn't directly control the quality of the generated time-domain waveform. To address this problem, we propose a new training scheme for Tacotron-based TTS, referred to as WaveTTS, that has 2 loss functions: 1) time-domain loss, denoted as the waveform loss, that measures the distortion between the natural and generated waveform; and 2) frequency-domain loss, that measures the Mel-scale acoustic feature loss between the natural and generated acoustic features. WaveTTS ensures both the quality of the acoustic features and the resulting speech waveform. To our best knowledge, this is the first implementation of Tacotron with joint time-frequency domain loss. Experimental results show that the proposed framework outperforms the baselines and achieves high-quality synthesized speech.

연구 동기 및 목표

  • 타코트론 기반 TTS에서 주파수 도메인 손실 최적화와 실제 시간 도메인 파형 품질 간의 불일치를 해결한다.
  • 학습 중 시간 도메인 파형을 직접 감독함으로써 음성 합성 품질을 향상시킨다.
  • 시간 도메인 및 주파수 도메인 손실을 하나의 학습 목표에 통합하는 효과를 조사한다.
  • 비신경 음성 복원기(Waveform Synthesizer)인 Griffin-Lim을 사용할 경우에도 이중 최적화가 성능 향상에 기여함을 입증한다.
  • 다양한 음성 복원기에서 일반화 및 강건성을 향상시키는 타코트론의 새로운 학습 범주를 설정한다.

제안 방법

  • 학습 최적화 중 주파수 도메인 손실(Mel-spectrogram loss)과 시간 도메인 손실(SI-SDR)을 모두 적용하는 이중 학습 체계를 도입한다.
  • 예측된 멜 스펙트로그램에서 시간 도메인 파형을 생성하기 위해 반복적 위상 재구성 기반의 Griffin-Lim을 사용하여 시간 도메인 손실을 계산한다.
  • 스케일 불변 신호 대 잡음비(SI-SDR)를 사용하여 시간 도메인 손실을 계산하며, 이는 진폭 및 위상 불일치에 대해 강건하다.
  • 특징 예측 네트워크를 양 손실 함수를 함께 최적화하여, 고품질 파형을 생성할 수 있는 특징을 학습하도록 한다.
  • 추론 시 음성 복원기(WaveNet 또는 Griffin-Lim)에 관계없이 동일한 이중 손실을 적용하여 일관된 최적화를 보장한다.
  • 기본 타코트론 아키텍처(에코더, 어텐션 기반 디코더, 포스트넷)를 사용하지만, 파형 수준의 감독을 가능하게 하기 위해 손실 함수를 수정한다.

실험 결과

연구 질문

  • RQ1타코트론 기반 TTS에서 시간 도메인과 주파수 도메인을 동시에 최적화하면 합성 음성의 청취 품질이 향상되는가?
  • RQ2Griffin-Lim과 같은 결정적 음성 복원기를 사용할 때도 학습 중 시간 도메인 손실을 통합하면 파형 잡음이 감소하고 자연스러운 음성이 되는가?
  • RQ3Griffin-Lim에서 WaveNet과 같은 신경 음성 복원기로 변경했을 때 제안된 이중 손실의 성능은 어떻게 되는가?
  • RQ4Griffin-Lim 반복 횟수의 증가가 시간 도메인 손실과 최종 음성 품질에 어떤 영향을 미치는가?
  • RQ5재학습 없이도 이중 손실로 학습된 모델이 다양한 음성 복원기에 대해 일반화 능력을 갖출 수 있는가?

주요 결과

  • WaveTTS-GL은 평균 의견 점수(MOS) 3.30을 기록하여, 3.18을 기록한 Tacotron-GL을 뛰어넘었다.
  • WaveTTS-WN은 추론 시 WaveNet 복원기를 사용했을 때 Tacotron-WN을 능가하여, 신경 복원기 사용 시에도 이중 학습의 이점이 있음을 보여주었다.
  • 선호도 테스트에서 WaveTTS-GL은 A/B 비교 중 72%에서 Tacotron-GL을 선호했으며, 95% 신뢰구간을 확보했다.
  • WaveTTS-WN은 Tacotron-WN보다 높은 선호도 점수를 기록하여, 이중 학습이 일반화 능력 향상에 기여함을 확인했다.
  • A/B 테스트 결과, Griffin-Lim의 반복 횟수 1회가 2회보다 더 높은 음성 품질을 보였으며, 이는 학습 시 파형 복원 과정에서 최적의 트레이드오프가 존재함을 시사한다.
  • 제안된 이중 손실 프레임워크는 추론 시 사용하는 음성 복원기 유형에 관계없이 효과적이며, 다양한 파형 생성 방법에 대해 강건성과 일반화 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.