[논문 리뷰] Hierarchical Diffusion Models for Singing Voice Neural Vocoder
이 논문은 다양한 샘플링 속도에서 별도의 디퓨전 모델을 사용하고, 낮은 속도의 웨이브폼과 음향 특징에 조건을 부여하는 계층적 디퓨전 모델을 제안한다. 이 방법은 유사한 계산 비용으로 PriorGrad와 Parallel WaveGAN을 능가하는 최신 기술 수준의 청각적 품질을 달성하며, 특히 레이어링된 음색과 함께 떨림이 있는 노래 목소리의 톤 정확도와 자연스러움에서 뛰어난 성능을 발휘한다.
Recent progress in deep generative models has improved the quality of neural vocoders in speech domain. However, generating a high-quality singing voice remains challenging due to a wider variety of musical expressions in pitch, loudness, and pronunciations. In this work, we propose a hierarchical diffusion model for singing voice neural vocoders. The proposed method consists of multiple diffusion models operating in different sampling rates; the model at the lowest sampling rate focuses on generating accurate low-frequency components such as pitch, and other models progressively generate the waveform at higher sampling rates on the basis of the data at the lower sampling rate and acoustic features. Experimental results show that the proposed method produces high-quality singing voices for multiple singers, outperforming state-of-the-art neural vocoders with a similar range of computational costs.
연구 동기 및 목표
- 노래 목소리의 복잡한 음악적 표현(음정, 음량, 발음)으로 인해 고품질의 노래 목소리를 생성하는 데 도전하는 것.
- 기존 신경 음성합성기의 한계를 극복하여, 종종 비자연스러운 음정 조절이나 낮은 청각적 품질을 유발하는 문제를 해결하는 것.
- 낮은 속도에서 높은 속도로 점진적으로 웨이브폼을 생성하는 계층적 디퓨전 프레임워크를 개발하여, 노래 목소리 특성의 더 나은 모델링을 가능하게 하는 것.
- 낮은 속도에서 생성된 웨이브폼과 음향 특징에 조건을 붙여 더 높은 속도의 디퓨전 모델을 조건화함으로써 샘플 품질과 추론 효율성을 향상시키는 것.
- PriorGrad와 Parallel WaveGAN과 같은 최신 기술 수준의 음성합성기들과 비교하여, 본 방법의 청각적 품질과 목적적 지표에서의 우수성을 검증하는 것.
제안 방법
- 모델은 낮은 속도에서 높은 속도로 이르기까지 각기 다른 샘플링 속도에서 독립적으로 훈련된 다수의 디퓨전 모델을 사용하며, 계층적 캐스케이드를 형성한다.
- 속도 $f_s^i$에서 작동하는 각 디퓨전 모델은 음향 특징 $c$와 다음으로 낮은 속도의 모델에서 생성된 다운샘플링된 출력 $x_0^{i+1}$에 조건을 붙인다.
- 추론 과정에서 각 낮은 속도의 모델 출력은 이후 높은 속도의 모델에 조건을 제공하기 전에 앤티앨리어싱 필터 $H^i$를 통과시킨다.
- 전진 과정은 원본 웨이브폼에 점차적으로 노이즈를 추가하는 방식이며, 역방향 과정은 학습된 디노이징 네트워크 $\mu_\theta(x_t, t)$를 사용해 단계적으로 노이즈를 제거하는 방식이다.
- 기존 PriorGrad와 유사하게, 홀수 단위 에너지와 스펙트럼 은폐를 포함한 데이터 의존적 사전 분포를 사용하여 수렴 속도를 가속화하고 샘플 품질을 향상시킨다.
- 계층적 아키텍처는 최저 속도 모델이 음정과 기본 주파수에 집중할 수 있도록 하며, 높은 속도의 모델들은 스펙트럼 및 시간적 세부 정보를 더욱 정교하게 보정한다.
실험 결과
연구 질문
- RQ1다양한 속도에서 조건을 붙인 계층적 디퓨전 모델이 단일 속도 디퓨전 모델에 비해 노래 목소리 합성의 청각적 품질을 향상시킬 수 있는가?
- RQ2낮은 속도에서 생성된 웨이브폼에 조건을 붙인 높은 속도의 디퓨전 모델이 노래 목소리의 톤 정확도와 자연스러움을 향상시키는가?
- RQ3노래 목소리 생성에서 계층적 설계는 자동회귀적 또는 GAN 기반 음성합성기와 비교해 품질과 추론 속도 측면에서 어떻게 비교되는가?
- RQ4데이터 의존적 사전 분포의 사용이 계층적 디퓨전 프레임워크 내에서 수렴과 샘플 품질 향상에 얼마나 기여하는가?
- RQ5기본 디퓨전 모델인 PriorGrad와 비교해 깊이를 늘리는 것보다 계층적 접근이 더 효율적으로 확장 가능한가?
주요 결과
- 제안된 HPG-2 모델은 평균 평가 점수(MOS)를 3.95 ± 0.13로 기록하여, PriorGrad(3.60 ± 0.12)와 Parallel WaveGAN(2.15 ± 0.13)을 뛰어넘는다.
- 선호도 테스트에서 85.3%의 평가자가 HPG-2를 PriorGrad보다 선호하여 청각적 우월성이 뚜렷하게 나타났다.
- HPG-2는 톤 평균 절대 오차(PMAE)를 1.82로 기록하여, PriorGrad(1.80)와 비교해 유의미하게 높고, PWG(3.12)에 비해 훨씬 낮아진다. 이는 향상된 음정 추적 능력을 의미한다.
- 모델은 발성 결정 오차(VDE)를 3.47로 줄여, PWG(5.61)를 능가하며 더 나은 발음 명확성을 보였다.
- 3단계로 구성된 HPG-3 모델은 계산 비용이 30% 증가하는 데 그치나, 지표를 더욱 향상시켰다(PMAE: 1.67, VDE: 3.32, MR-STFT: 1.07, MCD: 8.12).
- 제거 실험 결과, 낮은 속도의 웨이브폼 $x_0^2$가 저주파 성분 생성에 필수적이며, 멜 스펙트로그램 $c$는 주로 고주파 세부 정보를 조건화하는 데 기여함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.