Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task WaveNet: A Multi-task Generative Model for Statistical Parametric Speech Synthesis without Fundamental Frequency Conditions

Yu Gu, Yongguo Kang|arXiv (Cornell University)|2018. 06. 22.
Speech Recognition and Synthesis참고 문헌 19인용 수 5
한 줄 요약

이 논문은 통계적 매개변수 음성 합성(SPSS)을 위한 다중 작업 생성 모델인 Multi-task WaveNet을 제안한다. 이 모델은 프레임 단위 음성 특징 예측을 보조 작업으로 공동 학습함으로써 외부 기본 주파수(F0) 예측 모델이 필요 없도록 한다. 이 방법은 음성 자연스러움을 향상시키고 추론 복잡도를 감소시켜 원본 WaveNet보다 목적적 및 주관적 평가에서 모두 뛰어난 성능을 발휘한다.

ABSTRACT

This paper introduces an improved generative model for statistical parametric speech synthesis (SPSS) based on WaveNet under a multi-task learning framework. Different from the original WaveNet model, the proposed Multi-task WaveNet employs the frame-level acoustic feature prediction as the secondary task and the external fundamental frequency prediction model for the original WaveNet can be removed. Therefore the improved WaveNet can generate high-quality speech waveforms only conditioned on linguistic features. Multi-task WaveNet can produce more natural and expressive speech by addressing the pitch prediction error accumulation issue and possesses more succinct inference procedures than the original WaveNet. Experimental results prove that the SPSS method proposed in this paper can achieve better performance than the state-of-the-art approach utilizing the original WaveNet in both objective and subjective preference tests.

연구 동기 및 목표

  • 원본 WaveNet의 통계적 매개변수 음성 합성(SPSS)에서의 한계, 특히 외부 F0 예측 모델에 대한 의존성 해결.
  • WaveNet 기반 TTS 시스템에서 주파수 예측의 오차 누적과 추론 복잡도 감소.
  • 통합된 모델 내에서 F0 예측을 보조 작업으로 통합함으로써 음성 자연스러움과 표현력 향상.
  • 기본 주파수 조건부 처리가 필요 없이 언어적 특징만을 입력으로 사용하여 더 높은 품질의 음성 합성 달성.
  • 별도의 F0 추정이 필요 없어지면서 모델의 효율성과 견고성 향상, TTS 파이프라인 단순화.

제안 방법

  • 주 작업은 자동회귀적 파형 생성, 보조 작업은 프레임 단위 음성 특징 예측인 다중 작업 학습 프레임워크 도입.
  • 공유된 인코더 레이어를 갖는 WaveNet 모델을 엔드 투 엔드로 훈련하여 음성 특징에서 주파수 관련 패턴을 암묵적으로 학습.
  • 확장된 인과적 컨벌루션 네트워크를 사용해 원시 음성 파형의 장거리 시간적 의존성 모델링.
  • 파형 생성은 언어적 특징에만 조건부로 설정하고, F0 정보는 보조 음성 특징 예측 작업을 통해 암묵적으로 유도.
  • 원본 WaveNet의 명시적 로그 F0 조건부 처리 요구 사항을 통합 최적화를 통한 학습된 F0 표현으로 대체.
  • 파형 생성 손실과 음성 특징 예측 손실을 모두 포함하는 복합 손실 함수를 사용해 모델 최적화.

실험 결과

연구 질문

  • RQ1WaveNet 기반 SPSS에서 외부 F0 예측 모델이 필요 없이 다중 작업 학습 프레임워크가 음성 품질을 떨어뜨리지 않고 구현 가능한가?
  • RQ2음성 특징과 파형 생성을 공동으로 예측함으로써 음성 자연스러움과 억양에 어떤 영향을 미치는가?
  • RQ3제안된 방법이 원본 WaveNet 대비 F0 예측 오차 누적 정도를 어느 정도 감소시키는가?
  • RQ4별도의 F0 예측 단계를 제거함으로써 추론 효율성이 향상되는가?
  • RQ5모델이 원본 WaveNet 및 기준 시스템보다 더 뛰어난 주관적 선호도와 목적적 지표를 달성하는가?

주요 결과

  • Multi-task WaveNet은 목적적 및 주관적 평가에서 원본 WaveNet을 능가하며, 통계적으로 유의미한 선호도 향상(각각 Corpus A 및 B에서 p < 0.001)을 보였다.
  • 원본 WaveNet 대비 더 낮은 목적적 왜곡(MCD 및 PESQ 등이 낮음)을 기록하여 파형 정밀도 향상을 시사.
  • 주관적 선호도 테스트 결과, 두 데이터셋 모두에서 MTL-WaveNet이 95%의 이변수 비교에서 선호되었으며, p-값은 각각 8.8×10⁻⁷(Corpus A) 및 5.6×10⁻⁹(Corpus B).
  • 음성 특징 예측을 통한 암묵적 F0 학습으로 주파수 예측 오차 누적이 감소하여 억양 정확도 향상.
  • 추론 과정이 단순화되고 더 효율적이며, 별도의 F0 예측 모델이 더 이상 필요 없어짐.
  • 특히 음성 세부 사항과 억양에서 향상가능성이 뚜렷하며, 전체 선호도에서는 항상 감지되지 않더라도 미세한 품질 향상이 있음을 시사.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.