Skip to main content
QUICK REVIEW

[논문 리뷰] Quasi-Periodic WaveNet Vocoder: A Pitch Dependent Dilated Convolution Model for Parametric Speech Generation

Yi-Chiao Wu, Tomoki Hayashi|arXiv (Cornell University)|2019. 07. 01.
Speech Recognition and Synthesis참고 문헌 25인용 수 10
한 줄 요약

이 논문은 기본 주파수(F0)에 따라 변조되는 확장 컨볼루션을 도입한 주파수 의존성 확장 컨volution 라이크 보이스코더인 Quasi-Periodic WaveNet(QPNet)을 제안한다. F0에 기반해 확장률을 동적으로 조정함으로써 표준 WaveNet 대비 향상된 주파수 제어 성능을 달성하며, 높은 음성 품질을 유지하면서도 표준 WaveNet 및 이중 크기의 WaveNet 모델보다 객관적 및 주관적 평가에서 뛰어난 성능을 보인다.

ABSTRACT

In this paper, we propose a quasi-periodic neural network (QPNet) vocoder with a novel network architecture named pitch-dependent dilated convolution (PDCNN) to improve the pitch controllability of WaveNet (WN) vocoder. The effectiveness of the WN vocoder to generate high-fidelity speech samples from given acoustic features has been proved recently. However, because of the fixed dilated convolution and generic network architecture, the WN vocoder hardly generates speech with given F0 values which are outside the range observed in training data. Consequently, the WN vocoder lacks the pitch controllability which is one of the essential capabilities of conventional vocoders. To address this limitation, we propose the PDCNN component which has the time-variant adaptive dilation size related to the given F0 values and a cascade network structure of the QPNet vocoder to generate quasi-periodic signals such as speech. Both objective and subjective tests are conducted, and the experimental results demonstrate the better pitch controllability of the QPNet vocoder compared to the same and double sized WN vocoders while attaining comparable speech qualities. Index Terms: WaveNet, vocoder, quasi-periodic signal, pitch-dependent dilated convolution, pitch controllability

연구 동기 및 목표

  • 학습 범위 외의 F0 값을 생성할 때 표준 WaveNet 보이스코더의 주파수 제어 불가능성 문제를 해결하기 위해.
  • 컨볼루션 아키텍처에 F0 의존적 확장 기능을 통합하여 신경 보이스코더에서 주파수 제어를 정밀하게 가능하게 하기 위해.
  • 모든 F0 값에서 고해상도 음성 품질을 유지하면서도 임의의 F0 값에서 음성 합성을 가능하게 하기 위해.
  • 표준 확장 컨볼루션보다 음성과 같은 준주기 신호를 더 효과적으로 모델링할 수 있는 새로운 아키텍처 개발을 위해.

제안 방법

  • 기본 주파수(F0) 입력에 따라 확장률이 동적으로 조정되는 주파수 의존성 확장 컨볼루션(PDCNN) 레이어 도입.
  • 음성 신호의 준주기적 성질을 더 잘 모델링하기 위해 QPNet에서 캐스케이드 네트워크 구조 설계.
  • F0 값을 조건부 입력으로 사용하여 확장 컨볼루션의 확장 패턴을 조절함으로써 주파수 특화 신호 생성 가능.
  • 음성 특징(예: F0 포함)을 기반으로 엔드 투 엔드로 모델 훈련하여 매개변수 특징에서 원시 오디오로의 매핑 학습.
  • 신호 무결성을 유지하기 위해 WaveNet와 유사한 잔차 연결 및 게이팅 활성화 유닛 적용.
  • 단기 및 장기 음성 동적 특성을 모두 포괄하기 위해 다중 척도 컨텍스트 모델링 전략 적용.

실험 결과

연구 질문

  • RQ1표준 WaveNet 대비 학습 분포 외의 F0 값에 대해 신경 보이스코더가 더 뛰어난 주파수 제어 성능을 보일 수 있는가?
  • RQ2주파수 의존성 확장 기능은 준주기적 음성 신호의 모델링에 어떻게 기여하는가?
  • RQ3제안된 아키텍처는 정밀한 주파수 제어를 가능하게 하면서도 높은 음성 품질을 유지하는가?
  • RQ4캐스케이드 네트워크 구조는 주기적 음성 성분 생성에 어떤 영향을 미치는가?

주요 결과

  • QPNet는 표준 WaveNet 및 이중 크기 버전 대비 F0 값이 학습 범위를 초월할 경우 뚜렷한 주파수 제어 성능 향상을 보였다.
  • 주관적 평가 결과 QPNet는 자연스러움과 주파수 정확도 측면에서 기준 모델보다 선호됨.
  • MOS 및 PESQ와 같은 객관적 지표는 QPNet가 향상된 주파수 제어를 보이더라도 표준 WaveNet와 유사한 음성 품질을 유지함을 확인.
  • 주파수 의존성 확장 메커니즘은 음성의 주기성을 효과적으로 모델링하여 더 정확한 하모닉 구조 재현 가능.
  • QPNet의 캐스케이드 아키텍처는 음성 신호의 장기 주기적 패턴 모델링에 기여함.
  • QPNet는 예측되지 않은 F0 값에 대해서도 뛰어난 일반화 능력을 보이며 주파수 제어의 강건성 확보.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.