[논문 리뷰] LP-WaveNet: Linear Prediction-based WaveNet Speech Synthesis
이 논문은 음성 흥분과 선형 예측(LP) 필터 응답을 혼합 밀도 네트워크 내에서 동시에 모델링하는 WaveNet 기반 신경 음성합성기인 LP-WaveNet을 제안한다. 이는 음성 합성 품질을 햖스르기 위해 제안된다. 잔여 흥분을 모델링하면서 LP 합성 제약 조건을 통합함으로써 스펙트럼 불일치와 잡음 아티팩트를 감소시키며, TTS 평가에서 4.47 MOS를 달성하여 기존의 전통적 WaveNet 음성합성기보다 뚜렷이 뛰어나다.
We propose a linear prediction (LP)-based waveform generation method via WaveNet vocoding framework. A WaveNet-based neural vocoder has significantly improved the quality of parametric text-to-speech (TTS) systems. However, it is challenging to effectively train the neural vocoder when the target database contains massive amount of acoustical information such as prosody, style or expressiveness. As a solution, the approaches that only generate the vocal source component by a neural vocoder have been proposed. However, they tend to generate synthetic noise because the vocal source component is independently handled without considering the entire speech production process; where it is inevitable to come up with a mismatch between vocal source and vocal tract filter. To address this problem, we propose an LP-WaveNet vocoder, where the complicated interactions between vocal source and vocal tract components are jointly trained within a mixture density network-based WaveNet model. The experimental results verify that the proposed system outperforms the conventional WaveNet vocoders both objectively and subjectively. In particular, the proposed method achieves 4.47 MOS within the TTS framework.
연구 동기 및 목표
- 대규모이고 다양한 음성 데이터베이스에서 고도로 다양한 Prosodic 및 표현적 변동성을 가진 음성합성 모델을 훈련시키는 데 도전하는 것.
- 독립적인 흥분 모델링으로 인해 발생하는 WaveNet 기반 음성합성에서의 스펙트럼 불일치와 잡음 아티팩트를 줄이는 것.
- 특히, 음성 생성 소스와 후두관 간의 상호작용을 고려한 신체적 음성 생성 과정을 WaveNet 훈련 목표에 통합함으로써 청각적 품질을 향상시키는 것.
- 생성 모델에 LP 합성 필터링을 통합함으로써 더 안정적이고 고해상도의 웨이브폼 생성을 가능하게 하는 것.
제안 방법
- LP-WaveNet은 과거 음성 샘플의 LP 근사와 예측된 흥분 평균을 조합하는 혼합 밀도 네트워크(MDN)를 사용하여 음성 신호 분포를 모델링한다.
- 모델은 과거 음성 샘플과 LP 계수를 조건으로 삼아, 생성된 신호가 LP 합성 필터 다이내믹스를 존중하도록 보장한다.
- 흥분 성분은 WaveNet에 의해 자동적으로 회귀적으로 모델링되며, LP 근사는 과거 샘플의 선형 조합으로서 LP 계수에 의해 가중된 것으로 계산된다.
- 목표 분포는 MDN 평균과 LP 근사의 합으로 정의되며, 이는 흥분과 스펙트럼 은하의 공동 학습을 가능하게 한다.
- 표준 WaveNet에서 흔히 발생하는 거친 양자화를 피하기 위해 잔여 신호를 모델링함으로써, 일반 WaveNet에서 흔한 잡음 아티팩트를 감소시킨다.
- 이 프레임워크는 스펙트럼 모델링의 복잡성을 LP 근사에 위임함으로써 효율적인 훈련을 가능하게 하며, WaveNet은 주로 흥분 예측에 집중한다.
실험 결과
연구 질문
- RQ1흥분과 LP 합성 필터의 공동 모델링이 독립적인 흥분 모델링보다 음성합성 품질을 향상시킬 수 있는가?
- RQ2WaveNet 훈련 목표에 LP 합성 과정을 통합함으로써 스펙트럼 불일치와 잡음 아티팩트가 감소하는가?
- RQ3표준 WaveNet과 흥분 전용 WaveNet 음성합성기와 비교했을 때, LP-WaveNet의 목적적 지표와 주관적 MOS 평가에서의 성능은 어떠한가?
- RQ4음성특성 예측 오류가 있는 TTS 시스템에서도 제안된 방법이 높은 품질을 유지할 수 있는가?
- RQ5A-B 선호도 테스트에서 LP-WaveNet의 청각적 품질이 기준 WaveNet 음성합성기보다 뚜렷이 뛰어나게 되는가?
주요 결과
- LP-WaveNet은 TTS 프레임워크에서 평균의견점수(MOS) 4.47을 기록하여, 다음으로 우수한 시스템(4.04)을 크게 앞서며 자연어 음성(4.75 MOS)에 가까워졌다.
- A/S 시스템에서 LP-WaveNet은 자연어 음성보다 0.17점 떨어진 4.58 MOS를 기록하여 근사 자연어 수준의 품질을 입증했다.
- A-B 선호도 테스트 결과, 모든 테스트 조건에서 LP-WaveNet은 WN_S와 WN_E를 뚜렷이 선호받았으며(p < 10^-4), 여러 비교에서 선호도 비율이 80%를 초과했다.
- 목적적 지표 분석 결과, LP-WaveNet은 VUV 오차, F0 RMSE, LSD, F-LSD 등 모든 측정 기준에서 기존의 WaveNet 음성합성기보다 뛰어난 성능을 보였다.
- TTS 시스템에서 음성특성 예측 오차가 발생하더라도 LP-WaveNet은 뛰어난 성능을 유지하여 특성 열악화에 대한 강건성을 입증했다.
- MDN 프레임워크 내에서 흥분과 LP 필터 상호작용을 공동으로 모델링함으로써, 잡음 아티팩트와 스펙트럼 불일치를 효과적으로 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.