Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Vocoder is All You Need for Speech Super-resolution

Haohe Liu, Woosung Choi|arXiv (Cornell University)|2022. 03. 28.
Speech and Audio Processing인용 수 7
한 줄 요약

이 논문은 사전 훈련된 음성합성기 사전 지식을 활용하여 다양한 입력 해상도와 업샘플링 비율에서 최신 기술 수준의 성능을 달성하는 신경 음성합성기 기반 음성 슈퍼레졸루션 방법인 NVSR를 제안한다. 단순한 복제 팯딩 메르 범위 확장 방식을 사용함에도 불구하고, 44.1 kHz에서 로그스펙트럼 거리(LSD) 기준으로 WSRGlow와 Nu-wave를 각각 8%와 37% 향상시키며, 음성합성기의 인도크티브 바이어스가 매우 중요한 역할을 한다는 것을 입증한다.

ABSTRACT

Speech super-resolution (SR) is a task to increase speech sampling rate by generating high-frequency components. Existing speech SR methods are trained in constrained experimental settings, such as a fixed upsampling ratio. These strong constraints can potentially lead to poor generalization ability in mismatched real-world cases. In this paper, we propose a neural vocoder based speech super-resolution method (NVSR) that can handle a variety of input resolution and upsampling ratios. NVSR consists of a mel-bandwidth extension module, a neural vocoder module, and a post-processing module. Our proposed system achieves state-of-the-art results on the VCTK multi-speaker benchmark. On 44.1 kHz target resolution, NVSR outperforms WSRGlow and Nu-wave by 8% and 37% respectively on log spectral distance and achieves a significantly better perceptual quality. We also demonstrate that prior knowledge in the pre-trained vocoder is crucial for speech SR by performing mel-bandwidth extension with a simple replication-padding method. Samples can be found in https://haoheliu.github.io/nvsr.

연구 동기 및 목표

  • 기존 음성 슈퍼레졸루션 방법이 고정된 입력 해상도와 업샘플링 비율에 제한되어 있는 점을 해결하기 위해.
  • 입력 및 타겟 샘플링 주파수가 서로 다를 수 있는 실제 환경에서의 일반화 능력을 향상시키기 위해.
  • 사전 훈련된 신경 음성합성기가 음성 슈퍼레졸루션에 강력한 인도크티브 바이어스로 기능할 수 있는지 조사하기 위해.
  • 재훈련 없이도 다중 화자, 다중 해상도 음성 슈퍼레졸루션을 처리할 수 있는 통합적이고 유연한 시스템을 개발하기 위해.

제안 방법

  • NVSR는 두 단계의 파이프라인을 사용한다: 먼저 저해상도 입력에서 고해상도 메르 스펙트로그램을 예측하고, 그 다음 신경 음성합성기를 통해 웨이브폼을 합성한다.
  • 메르 대역폭 확장은 단순한 복제 패딩 방법을 사용하며, 놀랍게도 이는 학습된 방법보다 우수한 성능을 보인다.
  • 고주파 노이즈를 감소시키기 위해 저통과 필터(LFR)를 적용한 후처리 모듈이 웨이브폼을 정제하는 데 사용된다.
  • TFGAN 등 사전 훈련된 신경 음성합성기를 활용하여, 자음 구조나 조화 패턴과 같은 강력한 음성 사전 지식을 주입한다.
  • 선형 주파수 예측보다 고업샘플링 비율에서 더 다루기 쉬운 멜 주파수 영역에서 작동한다.
  • 동일한 모델이 여러 입력 해상도(2–32 kHz)와 타겟 주파수(16–44.1 kHz)에서 평가되어 시스템의 유연성을 입증한다.

실험 결과

연구 질문

  • RQ1신경 음성합성기 기반 접근법이 음성 슈퍼레졸루션에서 다양한 입력 샘플링 주파수와 업샘플링 비율에 일반화될 수 있는가?
  • RQ2학습된 신경망과 비교해 복제 패딩 방식이 메르 대역폭 확장에 얼마나 효과적인가?
  • RQ3사전 훈련된 음성합성기 사전 지식이 음성 슈퍼레졸루션 성능 향상에 얼마나 기여하는가?
  • RQ4단일 통합 모델이 고정된 입력-타겟 구성에서 훈련된 작업별 특화 모델을 능가할 수 있는가?
  • RQ5후처리가 신경 음성합성기 기반 슈퍼레졸루션에서 웨이브폼 품질 향상에 실제로 기여하는가?

주요 결과

  • NVSR는 44.1 kHz 타겟 벤치마크에서 최신 기술 수준의 평균 로그스펙트럼 거리(LSD) 0.86을 달성하며, WSRGlow(0.94)와 Nu-wave(1.37)를 각각 0.08과 0.51 향상시켰다.
  • NVSR-Pad는 메르 대역폭 확장을 위한 복제 패딩만 사용했지만, 12 kHz 및 24 kHz 입력에서 Nu-wave를 초월하는 LSD 1.27을 기록했다.
  • 2 kHz에서 16 kHz 슈퍼레졸루션에서 NVSR는 LSD 1.07을 달성했으며, 이는 매우 높은 업샘플링 비율(Upr = 8)에서 이 기록을 달성한 최초의 방법이다.
  • 후처리 없이도 NVSR의 성능은 LSD 0.84에서 0.96으로 악화되며, 후처리가 노이즈 감소에 매우 중요한 역할을 한다는 것을 보여준다.
  • 메르 스펙트로그램 예측 헤드 없이도 음성합성기 자체만으로도 LSD가 원시 입력의 4.65에서 1.89로 향상되며, 음성합성기의 본질적 음질 향상 능력을 입증한다.
  • 정답 메르 스펙트로그램을 사용할 경우 이론적 최고 성능(LSD = 0.76)에 매우 가까운 성능을 달성하며, 메르 예측 모듈의 뛰어난 효능을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.