[논문 리뷰] Effective parameter estimation methods for an ExcitNet model in generative text-to-speech systems
이 논문은 Tacotron 2 기반의 순서-순서 음성 모델과 ExcitNet 보이스코더를 조합하여 스펙트럼 및 자극 파rameter 추정을 향상시킨 고품질의 생성형 텍스트-음성 합성 시스템을 제안한다. 이 방법은 표현성 있는 음성에서 각각 4.67(기쁨) 및 4.43(슬픔)의 MOS 점수를 기록하여 WaveNet 기반 및 이전의 파arametric TTS 시스템을 크게 능가하는 뛰어난 청각적 품질을 달성한다.
In this paper, we propose a high-quality generative text-to-speech (TTS) system using an effective spectrum and excitation estimation method. Our previous research verified the effectiveness of the ExcitNet-based speech generation model in a parametric TTS framework. However, the challenge remains to build a high-quality speech synthesis system because auxiliary conditional features estimated by a simple deep neural network often contain large prediction errors, and the errors are inevitably propagated throughout the autoregressive generation process of the ExcitNet vocoder. To generate more natural speech signals, we exploited a sequence-to-sequence (seq2seq) acoustic model with an attention-based generative network (e.g., Tacotron 2) to estimate the condition parameters of the ExcitNet vocoder. Because the seq2seq acoustic model accurately estimates spectral parameters, and because the ExcitNet model effectively generates the corresponding time-domain excitation signals, combining these two models can synthesize natural speech signals. Furthermore, we verified the merit of the proposed method in producing expressive speech segments by adopting a global style token-based emotion embedding method. The experimental results confirmed that the proposed system significantly outperforms the systems with a similarly configured conventional WaveNet vocoder and our best prior parametric TTS counterpart.
연구 동기 및 목표
- 기존의 딥 네트워크에서 스펙트럼 및 자극 파rameter 추정의 정확도가 떨어질 경우 발생하는 오차 전파 문제를 해결하기 위해.
- 보다 정확한 음성 특징 예측을 위해 어텐션 기반 순서-순서 모델을 활용하여 생성형 텍스트-음성 합성의 청각적 품질을 향상시키기 위해.
- 감정 인식형 프로소디 모델링을 위한 글로벌 스타일 토큰(GST)을 통합하여 표현성 있는 음성 합성을 가능하게 하기 위해.
- ExcitNet가 강력한 음성 추정기와 조합될 경우 기존의 WaveNet 보이스코더 및 이전의 파arametric TTS 시스템을 능가하는지 입증하기 위해.
제안 방법
- 지역에 민감한 어텐션을 갖춘 순서-순서 Tacotron 2 스타일 모델을 사용하여 ExcitNet 보이스코더의 스펙트럼 및 자극 파rameter를 추정한다.
- 음성 모델은 텍스트 시퀀스를 임베딩으로 인코딩하고, 자동회귀적 디코딩 중 타겟 음성 특징과 정렬하기 위해 어텐션을 사용한다.
- ExcitNet는 WaveNet 기반 아키텍처를 사용하여 선형 예측(LP) 필터링된 음성 신호의 잔차를 모델링함으로써 시간 도메인 자극 신호를 생성한다.
- LP 필터는 추정된 스펙트럼 파ram터를 사용하여 생성된 자극으로부터 음성 신호를 재구성한다.
- 디코더를 조절하기 위해 글로벌 스타일 토큰(GST) 네트워크를 통합하여 감정 특화 프로소디 임베딩을 학습한다. 이는 텍스트 임베딩과 연결된다.
- GST 네트워크는 6층의 2차원 컨볼루션 신경망과 GRU를 사용하며, 10개의 스타일 토큰과 4헤드 어텐션을 활용하여 고차원 감정 임베딩을 추출한다.
실험 결과
연구 질문
- RQ1어떤 어텐션 기반 순서-순서 음성 모델이 기존의 DNN보다 ExcitNet의 스펙트럼 및 자극 파ram터 추정 정확도를 향상시킬 수 있는가?
- RQ2Tacotron 2와 ExcitNet를 조합하면 동일한 음성 모델을 사용한 WaveNet 보이스코더보다 더 높은 청각적 품질을 달성할 수 있는가?
- RQ3글로벌 스타일 토큰의 통합이 ExcitNet 프레임워크 내에서 표현성 있는 음성 합성에 얼마나 기여하는가?
- RQ4제안된 시스템은 자연스러움과 표현성 측면에서 감정 음성 합성에서 어떻게 성능을 발휘하는가?
주요 결과
- 제안된 시스템은 기쁨 감정 음성에서 평균 평가 점수(MOS)가 4.67 ± 0.05, 슬픔 감정 음성에서 4.43 ± 0.09를 기록하여 WaveNet 기반 베이스라인을 크게 능가했다.
- ExcitNet 기반 시스템의 MOS는 기쁨에서 4.67, 슬픔에서 4.43이었으며, 이는 기존의 WaveNet 보이스코더(각각 4.27 및 4.09)에 비해 뛰어난 청각적 품질을 보였다.
- ExcitNet 보이스코더와 GST 기반 감정 모델링을 통합한 시스템은 프로소디 및 감정의 자연스러움 측면에서 표현성 있는 음성 합성에서 뚜렷한 향상을 보였다.
- 제안된 방법은 최고의 이전 파arametric TTS 시스템을 크게 능가하여 정확한 파rameter 추정과 신경 보이스코더의 조합이 효과적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.