Skip to main content
QUICK REVIEW

[论文解读] Quasi-Periodic WaveNet Vocoder: A Pitch Dependent Dilated Convolution Model for Parametric Speech Generation

Yi-Chiao Wu, Tomoki Hayashi|arXiv (Cornell University)|Jul 1, 2019
Speech Recognition and Synthesis参考文献 25被引用 10
一句话总结

本文提出准周期WaveNet(QPNet),一种依赖音高的扩张卷积声码器,通过引入音高自适应扩张机制,提升了神经声码器中的音高可控性。QPNet通过根据基频(F0)动态调整扩张率,在保持高语音质量的同时,实现了优于标准WaveNet的音高控制性能,在客观与主观评估中均优于标准及双倍尺寸的WaveNet模型。

ABSTRACT

In this paper, we propose a quasi-periodic neural network (QPNet) vocoder with a novel network architecture named pitch-dependent dilated convolution (PDCNN) to improve the pitch controllability of WaveNet (WN) vocoder. The effectiveness of the WN vocoder to generate high-fidelity speech samples from given acoustic features has been proved recently. However, because of the fixed dilated convolution and generic network architecture, the WN vocoder hardly generates speech with given F0 values which are outside the range observed in training data. Consequently, the WN vocoder lacks the pitch controllability which is one of the essential capabilities of conventional vocoders. To address this limitation, we propose the PDCNN component which has the time-variant adaptive dilation size related to the given F0 values and a cascade network structure of the QPNet vocoder to generate quasi-periodic signals such as speech. Both objective and subjective tests are conducted, and the experimental results demonstrate the better pitch controllability of the QPNet vocoder compared to the same and double sized WN vocoders while attaining comparable speech qualities. Index Terms: WaveNet, vocoder, quasi-periodic signal, pitch-dependent dilated convolution, pitch controllability

研究动机与目标

  • 解决标准WaveNet声码器在训练范围外生成F0值时缺乏音高可控性的问题。
  • 通过在卷积架构中集成F0依赖的扩张机制,实现在神经声码器中对音高的精确控制。
  • 在提升任意F0值语音合成能力的同时,保持高语音质量。
  • 开发一种新型架构,使其比标准扩张卷积更有效地建模类似语音的准周期信号。

提出的方法

  • 提出一种依赖音高的扩张卷积(PDCNN)层,其扩张率根据输入的基频(F0)动态调整。
  • 在QPNet中设计级联网络结构,以更好地建模语音信号的准周期特性。
  • 将F0值作为条件输入,调节扩张卷积中的扩张模式,实现音高特定的信号生成。
  • 在包含F0的声学特征上端到端训练模型,学习从参数化特征到原始音频的映射。
  • 采用残差连接和门控激活单元,与WaveNet类似,以保持信号保真度。
  • 应用多尺度上下文建模策略,以捕捉语音的短时与长时动态特性。

实验结果

研究问题

  • RQ1与标准WaveNet相比,神经声码器是否能在训练分布之外的F0值上实现更好的音高可控性?
  • RQ2依赖音高的扩张机制如何改善对准周期语音信号的建模?
  • RQ3所提出的架构是否在实现精细音高控制的同时保持了高语音质量?
  • RQ4级联网络结构对周期性语音分量生成的影响如何?

主要发现

  • QPNet在训练范围外的F0值上,相比标准WaveNet及其双倍尺寸变体,表现出显著更优的音高可控性。
  • 主观评估显示,QPNet在自然度与音高准确性方面优于基线模型。
  • 客观指标如MOS与PESQ表明,尽管增强了音高控制能力,QPNet的语音质量仍与WaveNet相当。
  • 依赖音高的扩张机制有效建模了语音的周期性,从而更准确地再现谐波结构。
  • QPNet中的级联架构提升了对语音信号中长期周期模式的建模能力。
  • QPNet对未见F0值表现出鲁棒性,表明其在音高控制方面具备更强的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。