Skip to main content
QUICK REVIEW

[논문 리뷰] Fully-hierarchical fine-grained prosody modeling for interpretable speech synthesis

Guangzhi Sun, Yu Zhang|arXiv (Cornell University)|2020. 02. 06.
Speech Recognition and Synthesis참고 문헌 35인용 수 7
한 줄 요약

이 논문은 타코트론 2와 통합된 완전히 계층적 조건부 변분 오토인코더(VAE)를 제안하여 음성 강조 요소를 문장, 어절, 음소 수준에서 다중 수준으로 모델링한다. 이는 잠재 차원 간 계층적 조건부 설정을 통해 실현되며, F0, 에너지, 지속 시간 등의 음성 강조 특성 간 분리도 향상시킨다. 정량적 결과로는 완전히 계층적 VAE에서 11.5±2.3의 분산 비율을 기록하여 기준 모델을 능가하며, 설명 가능하고 세밀한 음성 강조 제어를 가능하게 한다.

ABSTRACT

This paper proposes a hierarchical, fine-grained and interpretable latent variable model for prosody based on the Tacotron 2 text-to-speech model. It achieves multi-resolution modeling of prosody by conditioning finer level representations on coarser level ones. Additionally, it imposes hierarchical conditioning across all latent dimensions using a conditional variational auto-encoder (VAE) with an auto-regressive structure. Evaluation of reconstruction performance illustrates that the new structure does not degrade the model while allowing better interpretability. Interpretations of prosody attributes are provided together with the comparison between word-level and phone-level prosody representations. Moreover, both qualitative and quantitative evaluations are used to demonstrate the improvement in the disentanglement of the latent dimensions.

연구 동기 및 목표

  • 문장, 어절, 음소 수준에서 다중 계층적 수준으로 음성 강조를 모델링하여 신경 음성합성 시스템에서 세밀하고 설명 가능한 음성 강조 제어를 가능하게 한다.
  • 기존 VAE 기반 음성 강조 모델에서 각 잠재 차원이 해석하기 어려운 상호 연결된 표현을 보이는 문제를 해결한다.
  • 조건부 VAE를 사용하여 잠재 차원 간 계층적 조건부 설정을 통해 음성 강조 특성(F0, 에너지, 지속 시간)의 분리도를 향상시킨다.
  • 어절 수준의 음성 강조 제어가 음소 수준의 제어보다 자연스러운 음성 강조 구조를 더 잘 유지함을 보여주며, 청각적 품질을 향상시킨다.

제안 방법

  • 타코트론 2 프레임워크에 계층적 VAE를 통합하여 문장, 어절, 음소 수준에서 별도의 잠재 표현을 갖춘다.
  • 목적 스펙트로그램과 음소 수준 표현 간의 정렬을 위해 위치에 민감한 어텐션을 사용하여 음소 수준의 음성 강조 추출을 가능하게 한다.
  • 자기회귀적 구조를 가진 조건부 VAE를 적용하여 더 세밀한 수준의 잠재 표현이 더 거시적인 수준의 특징에 조건부로 설정되도록 한다.
  • 에너지 → 지속 시간 → F0의 순서로 일관된 음성 강조 특성 학습 순서를 확보하기 위해 잠재 차원 간 학습 스케줄을 도입한다.
  • 분산 비율 분석을 통해 분리도를 정량적으로 평가하며, 한 가지 음성 강조 특성의 변동성이 어느 잠재 차원에 기인하는지 측정한다.
  • 정성적 MOS 테스트와 정량적 분산 비율 분석을 병행하여 음소 수준과 어절 수준 간의 샘플링 수준에서의 분리도 및 청각적 품질을 비교한다.

실험 결과

연구 질문

  • RQ1계층적 다중 수준 잠재 변수 모델은 신경 TTS 시스템에서 음성 강조 표현의 해석 가능성을 향상시킬 수 있는가?
  • RQ2잠재 차원 간 계층적 조건부 설정은 F0, 에너지, 지속 시간과 같은 음성 강조 특성의 분리도를 향상시키는가?
  • RQ3청각적 자연스러움과 음성 강조 구조의 유지 정도 측면에서 어절 수준의 음성 강조 제어는 음소 수준의 제어보다 어떻게 다를까?
  • RQ4학습 스케줄이 다양한 잠재 차원 간에 일관되고 해석 가능한 음성 강조 특성 학습 순서를 강제로 설정할 수 있는가?
  • RQ5제안된 완전히 계층적 VAE는 기준 VAE 및 DIP-VAE보다 분리도 품질에서 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • 완전히 계층적 VAE는 리브리티스 데이터셋에서 11.5±2.3의 분산 비율을 기록하여 기준 세밀한 VAE(7.5±1.0)와 DIP-VAE I(9.9±1.9)를 뛰어넘으며, 음성 강조 특성의 분리도가 뛰어나다는 것을 확인한다.
  • F0 잠재 차원에 대해 어절 수준에서 독립적으로 샘플링할 경우 MOS가 3.91±0.10으로 음소 수준 샘플링(3.75±0.09)보다 높게 나타나 자연스러운 음성 강조 구조의 유지 정도가 뛰어나다는 것을 입증한다.
  • 학습 스케줄은 항상 에너지 → 지속 시간 → F0의 순서로 특성 학습이 이루어지도록 하며, 청각적 및 재구성 성능와도 일치한다.
  • 첫 번째 잠재 차원이 주로 침묵 지속 시간을 포괄함을 확인하여, 모델이 의미 있고 해석 가능한 표현을 학습하고 있음을 확인한다.
  • 다양한 랜덤 시드와 데이터셋에서 일관된 분리도 향상 결과를 보이며 재구성 성능를 유지하면서도 세밀하고 해석 가능한 제어를 가능하게 함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.