Skip to main content
QUICK REVIEW

[논문 리뷰] Robust and fine-grained prosody control of end-to-end speech synthesis

Younggun Lee, Taesu Kim|arXiv (Cornell University)|2018. 11. 06.
Speech Recognition and Synthesis참고 문헌 12인용 수 4
한 줄 요약

이 논문은 엔드 투 엔드 음성 합성에서 주파수와 진폭의 미세 조절, 프레임 수준 및 음소 수준 제어를 가능하게 하는 시간적 구조화된 프로소디 임베딩 네트워크를 제안한다. 음성 또는 텍스트에서 가변 길이의 프로소디 임베딩을 학습하고 시간 정규화를 적용함으로써, 노래 음성 변환을 포함한 다양한 환경에서 강인한 인사 간 프로소디 전이를 달성하였으며, GST Tacotron 대비 MCD에서 29.4%의 상대적 향상을 이룩하였다.

ABSTRACT

We propose prosody embeddings for emotional and expressive speech synthesis networks. The proposed methods introduce temporal structures in the embedding networks, thus enabling fine-grained control of the speaking style of the synthesized speech. The temporal structures can be designed either on the speech side or the text side, leading to different control resolutions in time. The prosody embedding networks are plugged into end-to-end speech synthesis networks and trained without any other supervision except for the target speech for synthesizing. It is demonstrated that the prosody embedding networks learned to extract prosodic features. By adjusting the learned prosody features, we could change the pitch and amplitude of the synthesized speech both at the frame level and the phoneme level. We also introduce the temporal normalization of prosody embeddings, which shows better robustness against speaker perturbations during prosody transfer tasks.

연구 동기 및 목표

  • 고정 길이 프로소디 임베딩의 한계를 극복하고 엔드 투 엔드 음성 합성에서 미세 조절이 가능하고, 프레임 수준 및 음소 수준의 프로소디 제어를 가능하게 하기 위해.
  • 원본 및 대상 화자 간 주파수 범위가 크게 다를 경우 인사 간 프로소디 전이의 강인성 문제를 해결하기 위해.
  • 프로소디 임베딩 내 시간적 구조를 학습함으로써 프로소디 제어의 일관성과 명시성 향상을 위해.
  • 주파수와 시간이 매우 민감한 환경에서 노래 음성에 대한 효과적인 프로소디 전이를 보여주기 위해.
  • 프로소디 임베딩의 시간 정규화가 프로소디 전이 작업 중 강인성을 향상시킨다는 것을 보여주기 위해.

제안 방법

  • 입력의 시퀀스 길이와 동일한 길이를 가지는 가변 길이 프로소디 임베딩 두 종류를 도입: 음성 신호에서 유도된 것(음성 측)과 텍스트 입력에서 유도된 것(텍스트 측).
  • GRU 기반 네트워크를 사용하여 시간에 따라 순차적인 프로소디 정보를 유지하는 시간적 프로소디 임베딩을 생성한다.
  • 학습 중 프로소디 임베딩에 시간 정규화를 적용하여 화자별 주파수 변동에 대한 민감도를 감소시킨다.
  • 추가적인 지도 신호 없이도 목표 음성만을 이용하여 엔드 투 엔드 TTS 모델(simplified Tacotron)에 프로소디 임베딩 네트워크를 통합한다.
  • 콘텐츠 기반 어텐션 메커니즘을 사용하여 스타일 토큰 기여도를 계산함으로써, 임베딩 조작을 통한 명시적 프로소디 제어를 가능하게 한다.
  • 프로소디 재구성 및 전이 품질 평가의 주요 지표로 13개의 MFCC를 사용한 평균 체프스트랄 거리(MCD)를 사용한다.

실험 결과

연구 질문

  • RQ1가변 길이 프로소디 임베딩이 합성 음성에서 주파수와 진폭의 미세 조절, 프레임 수준 제어를 가능하게 하는가?
  • RQ2프로소디 임베딩의 시간 정규화가 주파수 범위가 다를 경우에도 인사 간 프로소디 전이의 강인성을 향상시키는가?
  • RQ3제안된 방법이 음악의 멜로디와 리듬을 유지하면서 노래 음성에서 다른 화자로 프로소디를 성공적으로 전이할 수 있는가?
  • RQ4프로소디 재구성 정확도 측면에서 제안된 프로소디 임베딩 방법이 GST Tacotron에 비해 성능이 뛰어나게 되는가?
  • RQ5음소 수준 또는 프레임 수준에서 프로소디 임베딩 값을 조작함으로써 명시적 프로소디 제어를 달성할 수 있는가?

주요 결과

  • 음성 측 프로소디 제어 방법은 MCD 0.294를 기록하여 GST Tacotron의 MCD 0.413보다 유의미하게 떨어지지 않았다.
  • 시간 정규화로 여성에서 남성으로의 프로소디 전이에 대한 MCD가 0.531에서 0.518로 감소하여 강인성이 향상됨을 입증하였다.
  • 모든 프레임에 동일한 프로소디 임베딩을 적용한 결과 평탄하고 일관된 음성이 생성되어 명시적이고 제어 가능한 프로소디 조작이 가능함을 확인하였다.
  • 제안된 방법은 미리 보지 않은 가수의 프로소디 임베딩을 추출하여 곡의 멜로디를 성공적으로 재구성하였고, GST Tacotron은 이를 수행하지 못하였다.
  • 음성 측 프로소디 제어는 원본 곡과 거의 동일한 음성을 생성하여 가수 작업에서 고해상도 프로소디 전이가 가능함을 시사하였다.
  • 프레임 수준 및 음소 수준에서 일관된 프로소디 제어가 가능했으며, 동일한 음소 간에 의도하지 않은 프로소디 변동이 발생하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.