[논문 리뷰] Neural Sequence-to-Sequence Speech Synthesis Using a Hidden Semi-Markov Model Based Structured Attention Mechanism
이 논문은 변분 자동encoder(VAE) 프레임워크 내에서 구조화된 어텐션 메커니즘에 은닉 반정형 마르코프 모델(HSMM)을 통합한 새로운 순서-순서 음성 합성 모델을 제안한다. 정렬을 잠재 변수로 모델링하고 명시적인 지속 시간 모델링을 통해 단조성 있고 지속 시간을 고려한 어텐션을 구현함으로써, 작은 훈련 데이터셋에서도 더 높은 자연스러움과 강건성을 달성하며, 주관적 평가에서 타코트론 2(Tacotron 2)를 능가하는 평균 의견 점수(Mean Opinion Score, MOS)를 기록한다.
This paper proposes a novel Sequence-to-Sequence (Seq2Seq) model integrating the structure of Hidden Semi-Markov Models (HSMMs) into its attention mechanism. In speech synthesis, it has been shown that methods based on Seq2Seq models using deep neural networks can synthesize high quality speech under the appropriate conditions. However, several essential problems still have remained, i.e., requiring large amounts of training data due to an excessive degree for freedom in alignment (mapping function between two sequences), and the difficulty in handling duration due to the lack of explicit duration modeling. The proposed method defines a generative models to realize the simultaneous optimization of alignments and model parameters based on the Variational Auto-Encoder (VAE) framework, and provides monotonic alignments and explicit duration modeling based on the structure of HSMM. The proposed method can be regarded as an integration of Hidden Markov Model (HMM) based speech synthesis and deep learning based speech synthesis using Seq2Seq models, incorporating both the benefits. Subjective evaluation experiments showed that the proposed method obtained higher mean opinion scores than Tacotron 2 on relatively small amount of training data.
연구 동기 및 목표
- 표준 Seq2Seq 모델이 과도한 어텐션 자유도로 인해 신경 음성 텍스트 합성(Neural TTS)에서 높은 데이터 요구량과 정렬 강건성 부족 문제를 해결한다.
- 신경 순서-순서 음성 합성에 명시적인 지속 시간 모델링을 통합하여 제어력과 품질을 향상시킨다.
- HMM 기반 음성 합성의 강점(구조화된 정렬 및 지속 시간 모델링)을 딥 러닝 기반 Seq2Seq 모델과 융합한다.
- VAE 프레임워크를 통해 정렬과 모델 파라미터를 동시에 최적화하여 일반화 능력을 향상시키며, 특히 제한된 훈련 데이터에서 유의미한 성능 향상을 이룬다.
제안 방법
- 정렬을 잠재 변수로 표현하는 생성 모델을 변분 자동encoder(VAE) 기반으로 설정하며, HSMM 구조를 사용하여 텍스트와 음성 시퀀스 간의 정렬을 모델링한다.
- 지속 시간을 명시적으로 모델링하기 위해 $ p(d_k \mid \xi_k, \eta_k^2) $ 분포를 사용하며, 여기서 $ \xi_k $와 $ \eta_k^2 $ 는 인코더에 의해 예측된다.
- 구조화된 어텐션 메커니즘을 적용하여 디코더가 인코더 상태를 상태 시퀀스 $ \hat{\bm{z}} $ 를 통해 주시하며, 이는 사전 분포와 인코더 출력에 기반한 가장 가능성이 높은 상태 시퀀스로 계산된다.
- 이중 단계 훈련 절차를 적용한다: 먼저 DNN-HSMM를 사용해 인코더를 사전 훈련한 후, VAE 목적함수를 통해 전체 모델을 공동으로 미세조정한다.
- 훈련 중 지도된 어텐션 손실(g=0.2)을 적용하여 단조성 있는 정렬을 유도하고 어텐션 과적합을 줄인다.
- VAE 프레임워크 내에서 공유된 사전 분포와 지속 시간 인코더를 사용하여 정렬과 음향 생성을 동시에 최적화할 수 있도록 한다.
실험 결과
연구 질문
- RQ1Seq2Seq 모델의 어텐션 메커니즘에 HSMM 구조를 통합함으로써 정렬 강건성 향상과 데이터 의존도 감소를 달성할 수 있는가?
- RQ2신경 TTS 시스템에 명시적인 지속 시간 모델링을 도입하면 합성 음성의 자연스러움과 제어력 향상에 기여하는가?
- RQ3VAE 기반 프레임워크를 통해 정렬과 모델 파라미터를 동시에 최적화함으로써 제한된 훈련 데이터셋에서 일반화 능력을 향상시킬 수 있는가?
- RQ4제한된 데이터 조건 하에서 제안된 방법이 타코트론 2와 DNN-HSMM에 비해 주관적 음성 품질 측면에서 어떻게 성능을 내는가?
- RQ5HSMM 기반의 구조화된 어텐션은 정렬의 단조성 향상과 어텐션 과적합 감소에 얼마나 기여하는가?
주요 결과
- 주관적 평가에서 제안된 방법은 자연스러움 측면에서 가장 높은 평균 의견 점수(Mean Opinion Score, MOS)를 기록하여 타코트론 2와 DNN-HSMM를 모두 능가했다.
- 450개 문장의 작은 훈련 세트에서 제안된 모델은 타코트론 2보다 더 뛰어난 정렬 품질을 달성했으며, 과도한 어텐션 자유도로 인한 어텐션 과적합 문제를 야기한 타코트론 2와는 대비된다.
- 구조화된 어텐션과 명시적인 지속 시간 모델링을 활용함으로써 데이터 부족 상황에서도 강건성을 확보하여 적은 데이터로도 고품질의 음성 합성을 가능하게 했다.
- 동일한 디코더 아키텍처를 사용하는 FRAME보다 제안된 모델이 뛰어난 성능을 보였으며, 이는 VAE를 통한 정렬과 파라미터의 공동 최적화가 효과적임을 시사한다.
- HSMM 기반의 구조화된 어텐션 통합으로 전체 시퀀스에 걸쳐 단조롭고 일관된 정렬이 달성되어 훈련 안정성과 일반화 능력 향상에 기여했다.
- VAE 프레임워크 내에서 공유된 사전 분포와 지속 시간 인코더를 사용함으로써 개선된 정렬과 음향 모델링을 확보한 효과적인 엔드 투 엔드 훈련이 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.