Skip to main content
QUICK REVIEW

[논문 리뷰] UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation

Won Jang, Dan Lim|arXiv (Cornell University)|2021. 06. 15.
Speech and Audio Processing참고 문헌 29인용 수 4
한 줄 요약

UnivNet는 전체 대역 메르스펙트로그램과 다중 해상도 스펙트로그램 판별기(MRSD)를 사용하는 실시간 신경 음성합성기로, 전체 대역 모델에서 흔히 발생하는 과도한 부드러움 문제를 효과적으로 완화한다. 이는 본문에서 언급된 바와 같이, 볼륨이 있는 화자와 볼륨이 없는 화자 모두에서 최신 기술 수준의 주관적 및 객관적 성능을 달성하며, 경량 버전은 실시간보다 227배 빠른 음성 생성을 구현한다.

ABSTRACT

Most neural vocoders employ band-limited mel-spectrograms to generate waveforms. If full-band spectral features are used as the input, the vocoder can be provided with as much acoustic information as possible. However, in some models employing full-band mel-spectrograms, an over-smoothing problem occurs as part of which non-sharp spectrograms are generated. To address this problem, we propose UnivNet, a neural vocoder that synthesizes high-fidelity waveforms in real time. Inspired by works in the field of voice activity detection, we added a multi-resolution spectrogram discriminator that employs multiple linear spectrogram magnitudes computed using various parameter sets. Using full-band mel-spectrograms as input, we expect to generate high-resolution signals by adding a discriminator that employs spectrograms of multiple resolutions as the input. In an evaluation on a dataset containing information on hundreds of speakers, UnivNet obtained the best objective and subjective results among competing models for both seen and unseen speakers. These results, including the best subjective score for text-to-speech, demonstrate the potential for fast adaptation to new speakers without a need for training from scratch.

연구 동기 및 목표

  • 전체 대역 메르스펙트로그램을 사용하는 신경 음성합성기에서 발생하는 과도한 부드러움 문제를 해결함으로써 고주파 성분 손실과 청취 가능한 잡음이 발생하는 문제를 방지한다.
  • 다중 해상도 스펙트로그램 판별기(MRSD)를 도입하여 다양한 스펙트로그램 해상도를 분석함으로써 스펙트럼 해상도와 음성 웨이브폼의 정밀도를 향상시킨다.
  • 재학습 없이도 새로운 화자에 빠르게 적응할 수 있도록 유니버설 음성합성기 아키텍처를 활용함으로써 일반화 능력을 향상시킨다.
  • 최소한의 계산 비용으로 고음질의 실시간 추론 성능을 달성하고, 다양한 화자에 대해 강력한 일반화 능력을 확보한다.

제안 방법

  • 생성기는 MelGAN에 영감을 얻은 비자기적 아키텍처를 사용하며, 효율적인 국소적 특징 모델링을 위해 위치 기반 가변 컨볼루션(LVC) 레이어를 통합한다.
  • 생성기는 전체 대역 메르스펙트로그램에 조건을 두고, 잔여 블록을 사용하는 역합성 컨볼루션을 통해 웨이브폼을 생성한다.
  • 다중 해상도 스펙트로그램 판별기(MRSD)는 다양한 STFT 파rameter를 사용해 계산된 다중 선형 스펙트로그램 크기값을 처리하여 스펙트럼 해상도를 향상시킨다.
  • 모델은 시간 주기성과 스펙트럼 세부 정보를 모두 모델링하기 위해 다중 주기 웨이브폼 판별기(MPWD)와 MRSD를 결합한다.
  • 생성기는 적대적 손실과 다중 스케일 STFT 손실을 사용해 훈련되며, MRSD는 고주파 성분 해상도 피드백을 제공한다.
  • 추론 속도 최적화를 위해 설계되었으며, 경량 버전인 UnivNet-c16는 실시간 생성 속도의 227배를 달성한다.

실험 결과

연구 질문

  • RQ1전체 대역 메르스펙트로그램을 사용하는 신경 음성합성기가 과도한 부드러움 문제 없이 고음질의 웨이브폼 생성을 달성할 수 있는가?
  • RQ2다중 해상도 스펙트로그램 판별기는 생성된 웨이브폼의 스펙트럼 해상도를 향상시키고 잡음을 줄이는 데 기여하는가?
  • RQ3재학습 없이도 단일 음성합성 모델이 볼륨이 없는 화자에게 효과적으로 일반화될 수 있는가?
  • RQ4다중 주기 및 다중 해상도 판별기의 조합이 웨이브폼 품질과 시간-스펙트럼 정밀도를 향상시키는 데 어떻게 기여하는가?
  • RQ5전체 대역 신경 음성합성기에서 모델 복잡도, 추론 속도, 주관적 품질 간의 상충 관계는 어떠한가?

주요 결과

  • UnivNet-c16는 볼륨이 있는 화자에게서 평균 평가 점수(MOS) 3.92를 기록했고, 볼륨이 없는 화자에게서도 3.79를 기록하여 MelGAN, Parallel WaveGAN, HiFi-GAN을 모두 앞섰다.
  • 텍스트-음성 합성 평가에서 UnivNet-c32는 MOS 4.07을 기록하여 새로운 화자에 대한 강력한 제로샷 일반화 능력을 입증했다.
  • 추론 실험 결과, MRSD를 제거할 경우 심각한 과도한 부드러움과 청취 가능한 금속성 잡음이 발생하여 MOS가 0.5점 이상 감소함을 확인했다.
  • UnivNet-c16는 실시간 생성 속도의 227.27배로 음성 웨이브폼을 생성하여, HiFi-GAN(135.14배)과 MelGAN(294.11배)보다 빠르면서도 높은 품질을 유지했다.
  • UnivNet-c32는 볼륨이 없는 화자에 대해 PESQ 3.70과 RMSE 0.294로 가장 높은 객관적 점수를 기록하여 모든 기준 모델을 압도했다.
  • MPWD와 MRSD의 조합(MSWD)은 MOS 3.90을 기록하여 다중 스케일 시간 및 스펙트럼 식별의 상호 보완적 이점이 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.