Skip to main content
QUICK REVIEW

[논문 리뷰] High-quality Speech Synthesis Using Super-resolution Mel-Spectrogram

Leyuan Sheng, Dongyan Huang|arXiv (Cornell University)|2019. 12. 03.
Speech and Audio Processing참고 문헌 20인용 수 10
한 줄 요약

이 논문은 Pix2PixHD와 ResUnet 아키텍처를 결합한 조건부 GAN 기반 프레임워크를 사용하여 저품질 TTS 생성 mel-spectrogram을 초해상도로 향상시키는 초해상도 mel-spectrogram 모델을 제안한다. mel-spectrogram을 이미지로 간주함으로써, 세밀한 음성 특징을 재구성하며, Griffin-Lim을 사용할 경우 기준 모델 대비 0.44 MOS 향상과 WaveNet을 사용할 경우 0.17 향상하여 지표값에 가까운 품질에 도달한다.

ABSTRACT

In speech synthesis and speech enhancement systems, melspectrograms need to be precise in acoustic representations. However, the generated spectrograms are over-smooth, that could not produce high quality synthesized speech. Inspired by image-to-image translation, we address this problem by using a learning-based post filter combining Pix2PixHD and ResUnet to reconstruct the mel-spectrograms together with super-resolution. From the resulting super-resolution spectrogram networks, we can generate enhanced spectrograms to produce high quality synthesized speech. Our proposed model achieves improved mean opinion scores (MOS) of 3.71 and 4.01 over baseline results of 3.29 and 3.84, while using vocoder Griffin-Lim and WaveNet, respectively.

연구 동기 및 목표

  • 생성된 mel-spectrogram에서의 과도한 부드러움 문제로 인한 합성 음성 품질 저하를 해결하기 위해.
  • Tacotron2와 같은 엔드 투 엔드 TTS 모델이 생성하는 mel-spectrogram의 정밀도를 향상시키기 위해.
  • mel-spectrogram을 이미지로 간주함으로써 이미지 간 번역 기법을 활용해 음성 신호 향상에 응용하기 위해.
  • 딥러닝을 활용해 세밀한 스펙트로그램 구조를 재구성함으로써 고품질 음성 합성 달성하기 위해.
  • 향상된 mel-spectrogram 예측을 통해 합성 음성과 지표값 음성 간 격차를 줄이기 위해.

제안 방법

  • 모델은 Pix2PixHD 기반의 조건부 GAN 프레임워크를 사용하며, 군집에서 세분화되는 생성자와 다중 척도 판별자 조합을 포함한다.
  • Pix2PixHD의 원래 생성자 대신 ResUnet 기반의 국소 향상 네트워크를 도입하여 특징 재구성 및 세부 사항 복원 성능을 향상시킨다.
  • 생성자는 스킵 연결과 잔여 블록을 활용하여 초해상도 과정에서 세밀한 스펙트로그램 특징을 유지한다.
  • 학습은 다중 척도에서의 적대적 손실 및 특징 매칭 손실을 포함하는 복합 손실 함수를 사용하여 학습 안정성을 확보한다.
  • 학습은 Adam 옵timizer를 사용하여 13,000개의 저해상도 및 원본 mel-spectrogram 쌍 데이터를 사용하며, 학습률 감소 전략 적용한다.
  • 향상된 mel-spectrogram는 평가를 위해 Griffin-Lim 및 WaveNet 보코더를 사용하여 웨이브폼으로 변환된다.

실험 결과

연구 질문

  • RQ1이미지 간 번역 모델이 저품질 TTS 출력에서 고해상도 mel-spectrogram을 효과적으로 재구성할 수 있는가?
  • RQ2Pix2PixHD와 ResUnet 기반 초해상도 모델이 기준 TTS 시스템 대비 세밀한 스펙트로그램 특징을 얼마나 잘 복원하는가?
  • RQ3향상된 mel-spectrogram가 MOS 및 객관적 지표로 측정했을 때 음성 품질 향상 정도는 어느 정도인가?
  • RQ4제안된 방법이 다양한 보코더에서 합성 음성과 지표값 음성 간 격차를 줄이는 데 기여하는가?
  • RQ5Griffin-Lim 및 WaveNet과 같은 다른 보코더에 대해 모델이 일반화되어 높은 청취 품질을 유지할 수 있는가?

주요 결과

  • 제안된 모델은 Griffin-Lim 기준 평균 평가 점수(MOS)가 3.73, WaveNet 기준 4.01을 기록하여 각각 기준 모델의 3.29 및 3.84보다 유의미하게 향상되었다.
  • 예측된 mel-spectrogram의 SSIM 값은 0.920으로 원본의 1.00에 가까워 구조적 유사도가 매우 높음을 나타낸다.
  • STOI 점수는 기준 모델의 0.791에서 Griffin-Lim 기준 0.978, WaveNet 기준 0.919로 향상되어 음성 이해도 향상이 확인되었다.
  • 시각적 확인을 통해 도식 4에 나타난 바와 같이, 저해상도 mel-spectrogram에 존재하지 않던 조화 및 일시적 구조가 효과적으로 복원되었다.
  • MOS 결과는 향상된 음성이 원본 음성에 청취적으로 매우 가까운 것으로 나타났으며, Griffin-Lim 기준 0.44 향상, WaveNet 기준 0.17 향상이 이루어졌다.
  • 모델의 성능은 다양한 보코더에서 뛰어난 일반화 능력을 보이며 음성 합성 분야에서의 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.