Skip to main content
QUICK REVIEW

[논문 리뷰] Prosody Transfer in Neural Text to Speech Using Global Pitch and Loudness Features

Siddharth Gururani, Kilol Gupta|arXiv (Cornell University)|2019. 11. 21.
Speech Recognition and Synthesis참고 문헌 22인용 수 12
한 줄 요약

이 논문은 참조 음성 클립에서 추출한 전역 주파수 및 음량 특징에 조건을 부여함으로써 신경 음성합성에서 운율 전이를 위한 단순하면서도 효과적인 방법을 제안한다. 이 방법은 운율 전이에 단지 일곱 가지 요약 통계치(로그F0 및 RMS 에너지)만을 사용하여 자연스러운 음성과 참조 음성과 유사한 운율을 달성하며, 기준 TC2 대비 객관적 지표에서 뚜렷한 향상을 보였다.

ABSTRACT

This paper presents a simple yet effective method to achieve prosody transfer from a reference speech signal to synthesized speech. The main idea is to incorporate well-known acoustic correlates of prosody such as pitch and loudness contours of the reference speech into a modern neural text-to-speech (TTS) synthesizer such as Tacotron2 (TC2). More specifically, a small set of acoustic features are extracted from reference audio and then used to condition a TC2 synthesizer. The trained model is evaluated using subjective listening tests and a novel objective evaluation of prosody transfer is proposed. Listening tests show that the synthesized speech is rated as highly natural and that prosody is successfully transferred from the reference speech signal to the synthesized signal.

연구 동기 및 목표

  • 인간과 유사한 표현력을 갖춘 제어 가능한 운율을 가진 표현적 텍스트-음성 합성(TTS)을 가능하게 하기 위해.
  • 기본 TTS 모델이 훈련 데이터에서 중립적인 운율만 학습한다는 한계를 해결하기 위해.
  • 참조 음성 신호에서 합성 음성으로의 운율 전이를 위한 저자원, 사용이 용이한 방법을 개발하기 위해.
  • 신경 TTS에서 운율 전이 성능을 평가하기 위한 새로운 객관적 지표를 도입하기 위해.
  • 소규모 전역 음성 특징 집합이 표현적 음성합성에 효과적으로 신경 TTS 모델을 조절하는 데 사용될 수 있음을 보여주기 위해.

제안 방법

  • 참조 음성 신호에서 전역 운율 특징—로그F0(주파수) 및 RMS(음량) 에너지—를 단순한 학습되지 않은 요약 통계 인코더를 사용해 추출한다.
  • 텍스트 인코더의 은닉 상태에 이러한 특징을 요소별로 덧셈하여 Tacotron2(TC2) TTS 모델을 조건화한다.
  • 참조 음성의 운율 특징을 7차원 전역 요약 벡터(7개 시간 단위에서의 로그F0 및 RMS)로 매핑하기 위해 경량 선형 변환을 사용한다.
  • 훈련 시 참조 음성의 진짜 데이터를 사용하고 추출된 특징을 추론 시 사용함으로써 표준 TTS 손실을 사용해 GS-TC2 모델을 엔드 투 엔드로 훈련한다.
  • 생성된 로그-멜스펙트로그램에서 고해상도 웨이브폼을 생성하기 위해 WaveRNN 보코더를 적용한다.
  • 두 가지 새로운 객관적 지표를 제안한다: 참조 음성과 합성 음성의 주파수 및 RMS 곡선 간 코사인 거리와 동적 시간 왜곡(DTW) 거리.

실험 결과

연구 질문

  • RQ1소규모 전역 운율 특징 집합(주파수 및 음량)이 참조 음성에서 합성 음성으로 운율을 효과적으로 전이할 수 있는가?
  • RQ2전역 통계를 사용한 운율 전이 성능이 객관적 및 주관적 평가 모두에서 표준 Tacotron2와 비교해 어떻게 되는가?
  • RQ3제안된 객관적 지표가 운율 전이 품질에 대한 인간의 인지와 얼마나 상관이 있는가?
  • RQ4다른 화자나 비음성 소스의 참조 자료가 운율 통계가 유사하다면, 이 방법이 일반화될 수 있는가?
  • RQ5복잡한 잠재 모델에서 관찰되는 엉키는 문제를 피하기 위해, 압축된 학습되지 않은 参照 인코더를 사용하는 것이 효과적인가?

주요 결과

  • GS-TC2 모델은 기준 TC2 대비 참조 음성과 합성 음성의 주파수 곡선 간 코사인 거리와 DTW 거리가 유의미하게 낮아졌으며, 주파수 코사인 거리가 45% 감소했다(0.052 대 0.029).
  • RMS 특징 전이 성능는 GS-TC2와 TC2 간 유사했으며, 둘 다 유사한 DTW 거리(0.019)를 보여, 음량 에너지의 강력한 전이를 확인했다.
  • 주관적 听음 테스트 결과, GS-TC2를 사용한 합성 음성은 자연스럽고 참조 음성의 운율이 효과적으로 전이된 것으로 평가되었다.
  • 7차원 운율 특징의 t-SNE 시각화 결과, 무작위로 선택한 16개 사례 중 14개에서 GS-TC2 합성 샘플이 참조에 더 가까웠다.
  • 이 방법은 단지 일곱 가지 전역 특징만을 사용하여 최소한의 계산 오버헤드로 효과적인 운율 전이를 달성했으며, 복잡한 학습된 인코더를 피했다.
  • 초기 실험 결과, 참조 음성이 다른 화자나 비음성 소스에서 올 수 있으며, 조건이 타겟 화자와 유사한 운율 통계를 갖춘 경우에도 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.