Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting Expressive Speaking Style From Text In End-To-End Speech Synthesis

Daisy Stanton, Yuxuan Wang|arXiv (Cornell University)|2018. 08. 04.
Speech Recognition and Synthesis참고 문헌 23인용 수 7
한 줄 요약

이 논문은 추론 시 별도의 스타일 레이블이나 보조 입력 없이 텍스트만으로도 표현적인 발화 스타일을 예측하는 엔드투엔드 음성 합성 방법인 텍스트 예측 글로벌 스타일 토큰(TP-GST)을 소개한다. 인간 선호도 테스트를 통해 기준 모델 대비 더 자연스러운 유창성과 더 큰 음고 및 에너지 변동성을 확보하였다.

ABSTRACT

Global Style Tokens (GSTs) are a recently-proposed method to learn latent disentangled representations of high-dimensional data. GSTs can be used within Tacotron, a state-of-the-art end-to-end text-to-speech synthesis system, to uncover expressive factors of variation in speaking style. In this work, we introduce the Text-Predicted Global Style Token (TP-GST) architecture, which treats GST combination weights or style embeddings as "virtual" speaking style labels within Tacotron. TP-GST learns to predict stylistic renderings from text alone, requiring neither explicit labels during training nor auxiliary inputs for inference. We show that, when trained on a dataset of expressive speech, our system generates audio with more pitch and energy variation than two state-of-the-art baseline models. We further demonstrate that TP-GSTs can synthesize speech with background noise removed, and corroborate these analyses with positive results on human-rated listener preference audiobook tasks. Finally, we demonstrate that multi-speaker TP-GST models successfully factorize speaker identity and speaking style. We provide a website with audio samples for each of our findings.

연구 동기 및 목표

  • 추론 시 명시적인 스타일 애너테이션이나 외부 입력이 필요 없이 표현적인 발화 스타일을 생성하는 텍스트-음성 합성 시스템을 개발하는 것.
  • 원시 텍스트에서 학습된 잠재 표현을 통해 발화 스타일을 발화자 정체성과 배경 잡음으로부터 분리하는 것.
  • 표현적인 유창성이 텍스트에서 직접 예측되는 엔드투엔드 음성 합성 시스템을 구현하여 자연스러움과 청취자 선호도를 향상시키는 것.
  • 스타일 토큰이 여러 발화자 간에 공유될 수 있으며, 발화자 정체성을 유지하면서 스타일 전이가 가능하다는 것을 입증하는 것.

제안 방법

  • TP-GST 아키텍처는 타코트론을 확장하여 두 개의 경로를 도입한다: 하나는 교차 엔트로피 손실을 통해 GST 조합 가중치를 예측하고, 다른 하나는 L1 손실을 통해 스타일 임베딩을 예측한다.
  • 모델은 음고, 에너지, 발화 속도와 같은 전반적인 유창성 변동을 포착하는 공유된 학습 가능한 스타일 토큰 세트를 사용한다.
  • 학습 중에, 원래 타코트론 손실과 함께 GST 가중치 또는 스타일 임베딩 기반의 추가 스타일 예측 손실을 포함하는 병합 손실 함수를 최소화한다.
  • 추론 시 모델은 텍스트 임베딩만을 조건으로 삼아 보조 신호나 수동적 스타일 선택 없이 스타일 예측을 수행한다.
  • 다발화자 TP-GST 모델은 동일한 스타일 토큰 세트를 공유하면서 발화자 정체성 임베딩을 입력 조건자로 사용한다.
  • 공유된 학습 가능한 스타일 토큰을 통해 발화자 정체성, 발화 스타일, 배경 잡음의 분리된 모델링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1명시적인 스타일 애너테이션이나 보조 입력 없이도 텍스트만으로 표현적인 발화 스타일을 예측할 수 있는가?
  • RQ2TP-GST 모델은 공유된 잠재 공간에서 발화 스타일을 발화자 정체성과 배경 잡음으로부터 분리할 수 있는가?
  • RQ3텍스트 기반 스타일 생성이 기준 TTS 모델 대비 더 자연스러운 유창성과 더 높은 청취자 선호도를 이끌어내는가?
  • RQ4다발화자 TP-GST 모델은 발화자 정체성을 유지하면서 다양한 목소리 간의 표현적 스타일 전이가 가능한가?

주요 결과

  • TP-GST 모델은 두 개의 최신 기준 모델 대비 유의미하게 더 큰 음고 및 에너지 변동을 생성하여 더 높은 유창성 표현성을 나타낸다.
  • 주관적 선호도 평가에서 인간 청취자들이 TP-GST가 생성한 오디오북 음성의 선호도가 기준 타코트론보다 높았다.
  • 품질 분석 및 정량적 분석을 통해 모델이 합성 과정에서 배경 잡음을 성공적으로 제거하는 것으로 확인되었다.
  • 다발화자 TP-GST 모델은 발화자 정체성과 발화 스타일을 분리하여 발화자 정체성을 유지하면서도 다양한 발화자 간의 스타일 전이가 가능했다.
  • 오디오 샘플을 통해 개별 스타일 토큰에 조건을 주면 음고, 에너지, 발화 속도의 차이를 포함한 뚜렷한 유창성 변동이 생성되는 것으로 나타났다.
  • 모델은 혼합 데이터로 훈련된 후에도 표현적인 오디오북, 중립적인 뉴스, 어시스턴트 스타일 음성과 같은 다양한 발화 스타일로 일반화하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.