Skip to main content
QUICK REVIEW

[논문 리뷰] Speaking style adaptation in Text-To-Speech synthesis using Sequence-to-sequence models with attention

Bajibabu Bollepalli, Lauri Juvela|arXiv (Cornell University)|2018. 10. 29.
Speech Recognition and Synthesis참고 문헌 27인용 수 4
한 줄 요약

이 논문은 정상 발화 데이터로 훈련된 시퀀스-투-시퀀스 텍스트-투-스피치(TTS) 모델을 전이학습을 통해 고도로 품질이 높은 로마르트 스타일의 발화를 생성할 수 있도록 적응시키는 방법을 제안한다. 제한된 로마르트 데이터(30분)를 사용하여 모델를 미세조정하고, 멜스펙트로그램에 조건부로 설정된 WaveNet 보코더를 활용함으로써, 스타일 유사성과 자연스러움 측면에서 기존 기준 모델을 뛰어넘는 성능을 기록하며, 합성 로마르트 발화 품질 분야에서 최신 기술 수준에 도달했다.

ABSTRACT

Currently, there are increasing interests in text-to-speech (TTS) synthesis to use sequence-to-sequence models with attention. These models are end-to-end meaning that they learn both co-articulation and duration properties directly from text and speech. Since these models are entirely data-driven, they need large amounts of data to generate synthetic speech with good quality. However, in challenging speaking styles, such as Lombard speech, it is difficult to record sufficiently large speech corpora. Therefore, in this study we propose a transfer learning method to adapt a sequence-to-sequence based TTS system of normal speaking style to Lombard style. Moreover, we experiment with a WaveNet vocoder in synthesis of Lombard speech. We conducted subjective evaluations to assess the performance of the adapted TTS systems. The subjective evaluation results indicated that an adaptation system with the WaveNet vocoder clearly outperformed the conventional deep neural network based TTS system in synthesis of Lombard speech.

연구 동기 및 목표

  • 엔드 투 엔드 TTS 시스템을 훈련시키기 위한 고품질의 로마르트 발화 데이터가 부족한 문제를 해결하기 위해.
  • 소음이 많은 환경에서의 발화 명료성을 향상시키기 위해 TTS 시스템이 로마르트 스타일의 발화를 합성할 수 있도록 하기 위해.
  • 전이학습이 최소한의 타겟 도메인 데이터로 정상 스타일 TTS 모델을 로마르트 스타일에 효과적으로 적응시킬 수 있는지 조사하기 위해.
  • 특히 WaveNet이 합성된 적응된 로마르트 발화의 품질과 자연스러움에 미치는 영향을 평가하기 위해 보코더의 선택이 어떻게 영향을 미치는지 조사하기 위해.

제안 방법

  • 정상 발화 데이터로 사전 훈련된 시퀀스-투-시퀀스 TTS 모델(Tacotron 기반)을 30분 분량의 로마르트 발화 데이터로만 미세조정한다.
  • 시퀀스-투-시퀀스 모델의 출력에서 추출한 멜스펙트로그램에 조건부로 설정된 WaveNet 보코더를 사용하여 원시 웨이브폼을 생성한다.
  • 전이학습을 통해 주로 주관적 특징(예: 증가된 F0와 음성 강도)을 학습할 수 있도록 모델의 어텐션 및 디코더 레이어를 적응시킨다.
  • 말하는 스타일을 적응시키는 동안도 화자 조건부 조건부를 적용하여 화자 정체성을 유지한다.
  • LSTM 및 Transformer 기반 인코더-디코더 아키텍처를 모두 사용하여 성능을 비교하기 위해 미세조정를 수행한다.
  • TTS 모델이 먼저 정상 발화 데이터로 사전 훈련된 후에 로마르트 스타일로 적응되는 다단계 훈련 파이프라인을 사용한다.

실험 결과

연구 질문

  • RQ1정상 발화 데이터로 훈련된 시퀀스-투-시퀀스 TTS 모델이 타겟 도메인 데이터가 극히 적은 상황에서도 고품질의 로마르트 스타일 발화를 효과적으로 생성할 수 있는가?
  • RQ2보코더의 선택(특히 WaveNet 대비 전통적인 World 보코더)이 합성된 로마르트 발화의 자연스러움과 스타일 정확성에 어떤 영향을 미치는가?
  • RQ3멜스펙트로그램에 조건부로 설정된 WaveNet 보코더가 엔드 투 엔드 WaveNet 훈련 대비 적응된 로마르트 발화의 품질을 향상시키는가?
  • RQ4적응된 시스템의 성능이 기존 LSTM 기반 TTS 시스템과 비교해 스타일 유사성과 자연스러움 측면에서 어떻게 다른가?
  • RQ5모델 아키텍처(LSTM 대비 Transformer)가 낮은 데이터 환경에서의 스타일 적응 효과성에 어떤 영향을 미치는가?

주요 결과

  • 멜스펙트로그램에 조건부로 설정된 WaveNet 보코더를 사용한 시스템 S5가 가장 높은 스타일 유사성 점수를 기록하여 자연스러운 로마르트 발화의 음향적 특징과 가장 유사한 결과를 도출했다.
  • 자연스러움 평가에서 CCR 테스트에서 WaveNet 기반 시스템(S5)가 기준 시스템(S1)보다 유의미하게 높은 평균 자연스러움 점수를 기록하며 통계적으로 유의미한 향상을 보였다.
  • WaveNet 보코더를 사용한 시스템는 멜스펙트로그램에 조건부로 설정된 경우, World 보코더를 사용한 시스템보다 스타일 유사성과 자연스러움 평가에서 일관되게 높은 점수를 기록했다.
  • 30분 분량의 타겟 도메인 데이터만으로도 로마르트 스타일의 발화를 효과적으로 생성할 수 있었으며, 이는 낮은 자원 환경에서 전이학습의 효과를 입증했다.
  • WaveNet 보코더를 사용한 Transformer 기반 모델(S5)가 주관적 청취 테스트에서 LSTM 기반 및 기준 시스템을 모두 앞서는 최상의 종합 성능을 기록했다.
  • 결과는 멜스펙트로그램에 조건부로 설정된 WaveNet 보코더가 제한된 훈련 데이터 조건에서도 합성된 로마르트 발화의 품질을 향상시킨다는 것을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.