Skip to main content
QUICK REVIEW

[论文解读] Neural Harmonic-plus-Noise Waveform Model with Trainable Maximum Voice Frequency for Text-to-Speech Synthesis

Xin Wang, Junichi Yamagishi|arXiv (Cornell University)|Aug 27, 2019
Speech Recognition and Synthesis参考文献 21被引用 8
一句话总结

该论文提出了一种可训练的最大语音频率(MVF)机制,应用于神经谐波加噪声波形模型(sinc-h-NSF),实现了谐波与准周期分量之间随时间变化的频带分离。通过将低通和高通滤波器参数化为窗函数sinc滤波器,并从语音特征预测MVF,该模型在保持实时生成速度的同时,提升了基线h-NSF的语音质量,其MOS评分与WaveNet相当。

ABSTRACT

Neural source-filter (NSF) models are deep neural networks that produce waveforms given input acoustic features. They use dilated-convolution-based neural filter modules to filter sine-based excitation for waveform generation, which is different from WaveNet and flow-based models. One of the NSF models, called harmonic-plus-noise NSF (h-NSF) model, uses separate pairs of source and neural filters to generate harmonic and noise waveform components. It is close to WaveNet in terms of speech quality while being superior in generation speed. The h-NSF model can be improved even further. While h-NSF merges the harmonic and noise components using pre-defined digital low- and high-pass filters, it is well known that the maximum voice frequency (MVF) that separates the periodic and aperiodic spectral bands are time-variant. Therefore, we propose a new h-NSF model with time-variant and trainable MVF. We parameterize the digital low- and high-pass filters as windowed-sinc filters and predict their cut-off frequency (i.e., MVF) from the input acoustic features. Our experiments demonstrated that the new model can predict a good trajectory of the MVF and produce high-quality speech for a text-to-speech synthesis system.

研究动机与目标

  • 解决谐波加噪声NSF模型中固定MVF的局限性,该局限性假设周期与准周期分量之间的频谱分离恒定。
  • 通过建模随时间变化的最大语音频率(MVF),实现谐波与噪声分量在语音中的分离,从而提升语音质量。
  • 实现从输入语音特征端到端可训练的MVF预测,无需依赖预定义的滤波器截止频率。
  • 在提升感知质量的同时,保持NSF模型的高生成速度。

提出的方法

  • 将低通和高通FIR滤波器参数化为窗函数sinc滤波器,以实现可微分的MVF控制。
  • 通过结合清音/浊音(U/V)状态和残差信号的可学习函数,从输入语音特征预测MVF截止频率。
  • 使用条件模块将F0和梅尔频谱图特征上采样至波形速率,供声源和滤波模块使用。
  • 通过最小化生成波形与自然波形之间的频谱振幅距离来训练模型。
  • 提出三种变体:sinc1-h-NSF(U/V + 残差信号)、sinc2-h-NSF(从零开始预测MVF)和sinc3-h-NSF(仅使用U/V预测MVF),以评估MVF预测策略。
  • 在推理阶段应用内存节省模式,降低GPU内存占用,同时不牺牲生成速度。

实验结果

研究问题

  • RQ1神经波形模型能否从输入语音特征预测随时间变化的最大语音频率(MVF),从而提升语音质量?
  • RQ2在感知质量和频谱准确性方面,可训练MVF与谐波加噪声NSF模型中的固定MVF相比表现如何?
  • RQ3哪种MVF预测策略——使用U/V作为先验、残差信号或直接预测——能产生最稳定和准确的MVF轨迹?
  • RQ4所提出的模型是否在提升语音质量的同时,仍保持NSF模型的高生成速度?
  • RQ5该模型能否在无需自回归生成的情况下,实现与WaveNet相当的MOS评分?

主要发现

  • sinc1-h-NSF变体(结合U/V状态与可学习残差信号)产生了最稳定且准确的MVF预测,其频谱模式与自然语谱图高度一致。
  • sinc1-h-NSF的平均MOS得分为4.48,与基线h-NSF(4.47)和WaveNet(4.49)无统计学差异,表明其具有极高的感知质量。
  • sinc2-h-NSF在浊音区域低估了MVF,导致准周期成分过强,谐波结构受损,MOS评分下降。
  • sinc3-h-NSF使Sigmoid函数饱和,导致所有帧的MVF = 1.0,造成准周期性丢失,产生不自然的清音如[s]。
  • 所有基于NSF的模型(包括sinc1-h-NSF)在单张P100 GPU上每秒生成超过335,000个波形样本,显著优于WaveNet的0.19k样本/秒。
  • 该模型保持了120万参数的紧凑参数量,与基线h-NSF相近,证实模型复杂度无显著增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。