Skip to main content
QUICK REVIEW

[논문 리뷰] AdaSpeech 3: Adaptive Text to Speech for Spontaneous Style

Yuzi Yan, Xu Tan|arXiv (Cornell University)|2021. 07. 06.
Speech Recognition and Synthesis참고 문헌 28인용 수 9
한 줄 요약

AdaSpeech 3는 사전에 훈련된 독서 스타일 TTS 모델을 자연스러운 일상 대화 음성 합성에 맞게 적응형으로 미세조정하기 위해, 메우기 휴지(PF) 예측기와 전문가의 혼합(MoE) 지속 시간 예측기를 도입하여 자연스러운 휴지와 다양한 리듬을 모델링하는 적응형 텍스트-to-음성 시스템을 제안한다. 이는 자연스러움과 일상성 측면에서 뚜렷한 향상을 이룩하였으며, 기준 모델인 AdaSpeech 대비 0.24 높은 MOS와 0.3 높은 SMOS 점수를 기록하였다.

ABSTRACT

While recent text to speech (TTS) models perform very well in synthesizing reading-style (e.g., audiobook) speech, it is still challenging to synthesize spontaneous-style speech (e.g., podcast or conversation), mainly because of two reasons: 1) the lack of training data for spontaneous speech; 2) the difficulty in modeling the filled pauses (um and uh) and diverse rhythms in spontaneous speech. In this paper, we develop AdaSpeech 3, an adaptive TTS system that fine-tunes a well-trained reading-style TTS model for spontaneous-style speech. Specifically, 1) to insert filled pauses (FP) in the text sequence appropriately, we introduce an FP predictor to the TTS model; 2) to model the varying rhythms, we introduce a duration predictor based on mixture of experts (MoE), which contains three experts responsible for the generation of fast, medium and slow speech respectively, and fine-tune it as well as the pitch predictor for rhythm adaptation; 3) to adapt to other speaker timbre, we fine-tune some parameters in the decoder with few speech data. To address the challenge of lack of training data, we mine a spontaneous speech dataset to support our research this work and facilitate future research on spontaneous TTS. Experiments show that AdaSpeech 3 synthesizes speech with natural FP and rhythms in spontaneous styles, and achieves much better MOS and SMOS scores than previous adaptive TTS systems.

연구 동기 및 목표

  • 제한된 훈련 데이터와 이러한 특성에 대한 모델링 부족으로 자연스러운 일상 스타일 음성(예: 메우기 휴지(um, uh)와 변동성이 있는 리듬 포함)를 합성하는 데 도전하는 것.
  • 최소한의 일상 음성 데이터로 사전 훈련된 독서 스타일 TTS 모델을 일상 음성으로 데이터 효율적으로 적응시키는 것.
  • 학습 가능한 예측기와 미세조정 메커니즘을 통해 메우기 휴지 삽입과 리듬 변화에 대한 제어력을 향상시키는 것.
  • 단지 몇 개의 적응 문장만으로도 새로운 화자에게 일상 스타일을 전이할 수 있도록 하는 것.
  • 향후 연구를 지원하기 위해 새로운 일상 음성 데이터셋(SPON-FP, SPON-RHYTHM, SPON-TIMBRE)을 공개하는 것.

제안 방법

  • 각 음소를 휴지 없음, um, 또는 uh로 분류하는 PF 예측기를 도입하며, 신뢰도 점수의 임계값을 통해 삽입을 제어한다.
  • 빠른, 중간, 느린 말하기 스타일을 위한 세 전문가를 갖춘 전문가의 혼합(MoE) 지속 시간 예측기를 사용하여 다양한 말하기 리듬을 모델링한다.
  • SPON-RHYTHM 서브셋의 텍스트-피치/지속 시간 데이터 쌍을 기반으로 MoE 지속 시간 예측기와 피치 예측기를 미세조정하여 일상 리듬 패턴에 적응시킨다.
  • SPON-TIMBRE 서브셋의 소수의 음성 샘플만을 사용하여 디코더 파라미터를 미세조정하여 화자 톤을 적응시킨다.
  • 팟캐스트 오디오에서 새로운 일상 음성 데이터셋을 추출하며, 이는 텍스트-PF 쌍(SPON-FP), 텍스트-피치/지속 시간 쌍(SPON-RHYTHM), 텍스트-음성 쌍(SPON-TIMBRE)을 포함한다.
  • 강제 정렬과 PF 태깅 기반 음성 인식(ASR)을 사용하여 PF 및 지속 시간 예측기의 정렬된 훈련 데이터를 생성한다.

실험 결과

연구 질문

  • RQ1텍스트-PF 데이터 쌍만을 사용하여 적응형 TTS 시스템이 일상 음성의 메우기 휴지(um, uh)를 효과적으로 모델링할 수 있는가?
  • RQ2일반 지속 시간 예측기 대비 전문가의 혼합(MoE) 지속 시간 예측기가 일상 음성의 다양한 리듬을 포착하는 데 더 우수한가?
  • RQ3제한된 일상 음성 데이터에서 피치 및 지속 시간 예측기를 미세조정하는 것이 자연스러움과 일상성 향상에 얼마나 효과적인가?
  • RQ4단지 몇 개의 적응 문장만으로 새로운 화자에게 일상 스타일을 얼마나 효과적으로 전이할 수 있는가?
  • RQ5PF 예측과 리듬 적응이 합성 음성의 실제 일상성 향상에 어떻게 상호작용하는가?

주요 결과

  • AdaSpeech 3는 기준 모델인 AdaSpeech 대비 0.24 높은 평균 평가 점수(MOS)를 기록하여 자연스러움과 말하기 속도 측면에서 뚜렷한 음성 품질 향상을 보였다.
  • AdaSpeech 대비 0.3 높은 음성 품질 및 일상성 평가 점수(SMOS)를 확보하여 일상 음성 특성을 보다 뛰어나게 모델링하고 있음을 입증하였다.
  • 무작위 삽입 대비 PF 예측기가 0.156 CMOS 높은 PF 합리성 점수를 기록하여 맥락 인식 기반의 휴지 삽입의 효과성을 확인하였다.
  • MoE 기반 지속 시간 예측을 제거한 경우(FP 포함) 0.332 CMOS 점수 하락이 발생하여 MoE가 리듬 다양성 모델링에 핵심적인 역할을 하고 있음을 시사하였다.
  • 지속 시간 및 피치 예측기 둘 다를 적응시킬 경우, 적응 없이 대비해 0.384 CMOS 향상이 이루어져 공동 적응의 중요성을 입증하였다.
  • 화자 간 스타일 전이에서는 남성 음성에서 0.175 CMOS 향상, 여성 음성에서 0.205 CMOS 향상이 이루어져 일상 스타일의 강력한 전이 가능성과 타당성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.