Skip to main content
QUICK REVIEW

[논문 리뷰] VocGAN: A High-Fidelity Real-time Vocoder with a Hierarchically-nested Adversarial Network

Jinhyeok Yang, Junmo Lee|arXiv (Cornell University)|2020. 07. 30.
Generative Adversarial Networks and Image Synthesis참고 문헌 18인용 수 5
한 줄 요약

VocGAN은 고해상도, 실시간 신경 음성합성기로, MelGAN을 개선하기 위해 계층적 중첩 이상성 손실과 동시 조건부 및 비조건부(이하 JCU) 학습, 다중 해상도 웨이브폼 생성, 다중 해상도 STFT 손실을 도입하였다. GPU에서는 실시간 대비 416.7배 빠른 추론 속도를 달성했고, CPU에서는 3.24배 빠르며, 객관적 지표(MCD, F0 RMSE, PESQ)와 주관적 MOS 점수 모두에서 MelGAN 및 Parallel WaveGAN을 뛰어넘었다.

ABSTRACT

We present a novel high-fidelity real-time neural vocoder called VocGAN. A recently developed GAN-based vocoder, MelGAN, produces speech waveforms in real-time. However, it often produces a waveform that is insufficient in quality or inconsistent with acoustic characteristics of the input mel spectrogram. VocGAN is nearly as fast as MelGAN, but it significantly improves the quality and consistency of the output waveform. VocGAN applies a multi-scale waveform generator and a hierarchically-nested discriminator to learn multiple levels of acoustic properties in a balanced way. It also applies the joint conditional and unconditional objective, which has shown successful results in high-resolution image synthesis. In experiments, VocGAN synthesizes speech waveforms 416.7x faster on a GTX 1080Ti GPU and 3.24x faster on a CPU than real-time. Compared with MelGAN, it also exhibits significantly improved quality in multiple evaluation metrics including mean opinion score (MOS) with minimal additional overhead. Additionally, compared with Parallel WaveGAN, another recently developed high-fidelity vocoder, VocGAN is 6.98x faster on a CPU and exhibits higher MOS.

연구 동기 및 목표

  • 기존 GAN 기반 음성합성기의 성능을 따라하거나 초월하면서도 낮은 추론 지연을 유지하는 고해상도, 실시간 신경 음성합성기를 개발하는 것.
  • MelGAN의 품질 한계, 즉 저주파 및 고주파 성분의 열악한 품질과 입력 멜 스펙트로그램과의 일관성 부족 문제를 해결하는 것.
  • 동시 조건부 및 비조건부(JCU) 손실과 같은 고급 학습 목표를 통합하여 웨이브폼 일관성과 음향 정밀도를 향상시키는 것.
  • 복잡한 아키텍처나 복잡한 학습 절차에 의존하지 않고도 GPU 및 CPU에서 모두 실시간 성능을 달성하는 것.
  • 고품질 출력과 최소한의 계산 오버헤드를 제공하는 엔드 투 엔드, 생산용 텍스트-투-스피치 시스템을 가능하게 하는 것.

제안 방법

  • 생성자는 다중 시간 해상도에서 웨이브폼을 생성하는 다중 해상도 아키텍처를 사용하여 세밀한 구조적 특징과 전반적인 음향 특징을 더 잘 포착할 수 있도록 한다.
  • 다양한 해상도에서의 이상성 학습을 강화하기 위해 해상도별 분기 구조를 가진 계층적 중첩 디스크림너를 사용한다. 이는 다수준 음향 특성 학습을 향상시킨다.
  • 동시 조건부 및 비조건부(JCU) 손실은 생성자와 디스크림너 양쪽에 적용되어 학습 안정성을 향상시키고 웨이브폼의 현실감을 향상시킨다.
  • 스펙트럼 세부 사항을 유지하고 웨이브폼 정밀도를 향상시키기 위해 보조 목표로 다중 해상도 단기 푸리에 변환(STFT) 손실을 사용한다.
  • 이질성 손실, 특징 매칭 손실, STFT 손실의 조합을 사용하여 학습을 수행하며, 체크리스트 아티팩트를 방지하기 위해 철저한 아키텍처 설계를 한다.
  • 생성자는 고해상도 시간 해상도를 확보하고 아티팩트를 방지하기 위해 적절히 선택된 커널 크기와 스트라이드를 가진 스트라이드 전치 컨볼루션을 사용한다.

실험 결과

연구 질문

  • RQ1GAN 기반 음성합성기가 GPU 및 CPU에서 모두 실시간 추론 속도를 달성하면서도 고해상도 음성 합성을 이룰 수 있는가?
  • RQ2계층적 중첩 이상성 학습 목표는 웨이브폼 품질과 입력 멜 스펙트로그램에 대한 일관성에 어떻게 기여하는가?
  • RQ3JCU 손실과 다중 해상도 STFT 손실을 조합했을 때 청각적 및 객관적 음성 품질 지표는 어느 정도 향상되는가?
  • RQ4특히 CPU 추론 환경에서 VocGAN은 MelGAN 및 Parallel WaveGAN과 비교해 성능 및 속도 면에서 어떻게 다른가?
  • RQ5제안된 아키텍처는 밀도 정규화나 복잡한 사전학습 절차 없이도 높은 성능을 유지할 수 있는가?

주요 결과

  • VocGAN은 평균 의견 점수(MOS) 4.202 ± 0.081을 기록하여 MelGAN(3.898 ± 0.091)과 Parallel WaveGAN(4.098 ± 0.085)을 뚜렷이 앞섰다.
  • GTX 1080Ti GPU에서 VocGAN은 실시간 대비 416.7배 빠른 속도로 음성 합성을 수행했으며, 이는 실시간을 훨씬 뛰어넘고 MelGAN보다도 효율적인 성능을 보였다.
  • 단일 CPU 코어에서 VocGAN은 실시간 대비 3.24배 빠른 추론 속도를 달성했으며, MelGAN을 초월했고 Parallel WaveGAN보다 6.98배 더 빠르게 작동했다.
  • 제거 실험 결과, 계층적 중첩 JCU 목표와 다중 해상도 STFT 손실을 조합했을 때 MCD 및 F0 RMSE 지표에서 가장 큰 향상이 이루어졌다.
  • VocGAN이 생성한 F0 트레이젝터리는 MelGAN보다 지표값에 훨씬 가까웠으며, 이는 더 나은 주파수 보존 능력을 의미한다.
  • VocGAN은 MelGAN보다 멜 셰프트럼 거리(MCD)와 F0 제곱근 평균 제곱 오차(RMSE)를 더 효과적으로 감소시켜 스펙트럼 및 주파수 정확도 향상을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.