Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Diffusion Models for Singing Voice Neural Vocoder

Naoya Takahashi, Mayank Kumar|arXiv (Cornell University)|Oct 14, 2022
Music and Audio Processing被引用 4
一句话总结

该论文提出了一种用于歌唱语音神经声码器的分层扩散模型,该模型在不同采样率下使用多个扩散模型,条件依赖于低采样率波形和声学特征。该方法在计算成本相近的情况下,实现了最先进的感知质量,优于PriorGrad和Parallel WaveGAN,尤其在具有震颤音的歌唱语音的音高准确性和自然度方面表现突出。

ABSTRACT

Recent progress in deep generative models has improved the quality of neural vocoders in speech domain. However, generating a high-quality singing voice remains challenging due to a wider variety of musical expressions in pitch, loudness, and pronunciations. In this work, we propose a hierarchical diffusion model for singing voice neural vocoders. The proposed method consists of multiple diffusion models operating in different sampling rates; the model at the lowest sampling rate focuses on generating accurate low-frequency components such as pitch, and other models progressively generate the waveform at higher sampling rates on the basis of the data at the lower sampling rate and acoustic features. Experimental results show that the proposed method produces high-quality singing voices for multiple singers, outperforming state-of-the-art neural vocoders with a similar range of computational costs.

研究动机与目标

  • 为解决由于音高、音量和发音中的复杂音乐表现导致的高质量歌唱语音生成挑战。
  • 克服现有神经声码器的局限性,这些声码器通常在歌唱语音合成中产生不自然的音高调制或较差的感知质量。
  • 开发一种分层扩散框架,从低到高采样率逐步生成波形,以更好地建模歌唱语音特征。
  • 通过将高采样率扩散模型条件化于低采样率生成的波形和声学特征,提升样本质量和推理效率。
  • 通过与PriorGrad和Parallel WaveGAN等最先进声码器的对比,验证该方法在感知质量和客观指标上的优越性。

提出的方法

  • 该模型在不同采样率下独立训练多个扩散模型,从低到高形成分层级联结构。
  • 在采样率 $f_s^i$ 下的每个扩散模型均以声学特征 $c$ 和下一低采样率模型的下采样输出 $x_0^{i+1}$ 作为条件。
  • 在推理过程中,每个低采样率模型的输出在用作高采样率模型条件之前,先通过一个去混叠滤波器 $H^i$。
  • 前向过程逐步向原始波形添加噪声,而反向过程则通过学习到的去噪网络 $\mu_\theta(x_t, t)$ 逐步去除噪声。
  • 该方法采用类似于PriorGrad的数据相关先验,结合帧能量和谱包络,以加速收敛并提升样本质量。
  • 分层结构使最低采样率模型能够专注于音高和基频,而高采样率模型则用于细化频谱和时间细节。

实验结果

研究问题

  • RQ1与单采样率扩散模型相比,采用多采样率条件的分层扩散模型是否能提升歌唱语音合成的感知质量?
  • RQ2将高采样率扩散模型条件化于低采样率生成的波形,是否能增强歌唱语音的音高准确性和自然度?
  • RQ3在歌唱语音生成中,与自回归或基于GAN的声码器相比,该分层设计在质量与推理速度方面表现如何?
  • RQ4在分层扩散框架中,使用数据相关先验在多大程度上能改善收敛性和样本质量?
  • RQ5与增加基线扩散模型(如PriorGrad)的深度相比,该分层方法是否能更高效地扩展?

主要发现

  • 所提出的HPG-2模型取得了3.95 ± 0.13的平均意见得分(MOS),显著优于PriorGrad(3.60 ± 0.12)和Parallel WaveGAN(2.15 ± 0.13)。
  • 在偏好测试中,85.3%的评分者更倾向于HPG-2而非PriorGrad,表明其具有显著的感知优势。
  • HPG-2实现了1.82的音高平均绝对误差(PMAE),低于PriorGrad(1.80),且显著优于PWG(3.12),表明音高追踪能力得到提升。
  • 该模型将语音活动决策误差(VDE)降低至3.47,优于PWG(5.61),显示出更好的语音清晰度。
  • 三阶段HPG-3模型在仅增加30%计算成本的情况下,进一步提升了指标(PMAE: 1.67,VDE: 3.32,MR-STFT: 1.07,MCD: 8.12)。
  • 消融研究证实,低采样率波形 $x_0^2$ 对低频分量的生成至关重要,而梅尔频谱图 $c$ 主要用于条件化高频细节。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。