Skip to main content
QUICK REVIEW

[论文解读] Singing Voice Synthesis Using Deep Autoregressive Neural Networks for Acoustic Modeling

Yuanhao Yi, Yang Ai|arXiv (Cornell University)|Jun 21, 2019
Music and Audio Processing参考文献 21被引用 8
一句话总结

本文提出一种深度自回归(DAR)神经网络用于语音合成(SVS),以改进对F0和谱特征的建模,提升时间依赖性。通过采用离散化F0预测与后处理策略,并结合自注意力增强的Prenet进行谱特征建模,该方法在中文歌唱语料上的客观与主观评估中均优于基于RNN的基线模型,实现了更自然的震音效果和更优的音乐音符对齐。

ABSTRACT

This paper presents a method of using autoregressive neural networks for the acoustic modeling of singing voice synthesis (SVS). Singing voice differs from speech and it contains more local dynamic movements of acoustic features, e.g., vibratos. Therefore, our method adopts deep autoregressive (DAR) models to predict the F0 and spectral features of singing voice in order to better describe the dependencies among the acoustic features of consecutive frames. For F0 modeling, discretized F0 values are used and the influences of the history length in DAR are analyzed by experiments. An F0 post-processing strategy is also designed to alleviate the inconsistency between the predicted F0 contours and the F0 values determined by music notes. Furthermore, we extend the DAR model to deal with continuous spectral features, and a prenet module with self-attention layers is introduced to process historical frames. Experiments on a Chinese singing voice corpus demonstrate that our method using DARs can produce F0 contours with vibratos effectively, and can achieve better objective and subjective performance than the conventional method using recurrent neural networks (RNNs).

研究动机与目标

  • 为解决基于RNN的声学建模在捕捉歌唱语音中细微时间动态(如震音)方面的局限性。
  • 通过减少与音符决定的音高值的偏差,改善F0包络与乐谱记号的一致性。
  • 通过基于自注意力的Prenet模块,建模谱特征中的长程依赖关系。
  • 相比传统基于RNN的方法,实现更高的自然度与感知质量。
  • 评估DAR模型在统一SVS框架中联合建模F0与谱特征的有效性。

提出的方法

  • F0通过深度自回归网络建模,将离散化F0值映射到梅尔尺度并量化为N个等级,表示为独热向量。
  • 通过反馈链接机制将前K个预测输出引入循环单元,以建模帧间的时间依赖性。
  • 采用F0后处理策略,应用移动平均滤波器,使预测的F0包络与乐谱音符决定的音高值对齐,从而减少偏差。
  • 谱特征建模采用包含多层自注意力机制的Prenet模块,处理历史帧,提升对动态谱变化的表征能力。
  • 谱模型使用残差连接与最终全连接层,预测梅尔倒谱系数,训练目标为均方误差(MSE)。
  • 使用WaveRNN声码器从预测的F0与谱特征合成波形。

实验结果

研究问题

  • RQ1深度自回归模型能否有效建模歌唱语音中F0的局部动态变化(如震音)?
  • RQ2DAR模型中历史长度(K)对F0预测性能与自然度有何影响?
  • RQ3所提出的F0后处理策略是否能显著提升预测F0包络与乐谱音符音高的对齐程度?
  • RQ4与标准RNN相比,自注意力增强的Prenet模块能否提升谱特征建模效果?
  • RQ5所提出的基于DAR的SVS系统在客观与主观评估中,相较于基于RNN的基线模型表现如何?

主要发现

  • DAR-based F0模型在自然F0包络上的F0 RMSE为35.09 Hz,在乐谱决定的F0上为19.14 Hz,显著优于RNN基线(分别为35.09 Hz与34.42 Hz)。
  • 经过F0后处理后,乐谱决定的F0上的RMSE降至8.45 Hz,表明对齐性能显著提升。
  • 当以乐谱决定的F0作为参考时,预测与参考F0包络之间的相关系数达到0.99,表明高保真度。
  • 采用自注意力的谱模型实现了3.51 dB的梅尔倒谱失真(MCD),优于基线,显示谱特征精度提升。
  • 主观听音测试显示,DAR模型相比RNN基线获得显著偏好(p < 0.001),而DAR+P变体的偏好程度进一步提升(p < 0.01)。
  • 该方法成功生成具有自然震音的F0包络,而RNN基线由于过度平滑化,难以有效再现此类特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。