Skip to main content
QUICK REVIEW

[论文解读] Recurrent Neural Network Postfilters for Statistical Parametric Speech Synthesis

Prasanna Kumar Muthukumar, Alan W. Black|arXiv (Cornell University)|Jan 26, 2016
Speech Recognition and Synthesis参考文献 15被引用 4
一句话总结

本文提出一种循环神经网络(RNN)后处理滤波器,用于统计参数化语音合成,以校正分类与回归树(CART)预测的梅尔倒谱系数(MCEP)中的误差。该RNN利用语音信号中的时序依赖性,可轻松集成新特征(如词法信息),通过辅助坐标法(MAC)进行联合训练,MCD指标略有提升,但总体增益有限。

ABSTRACT

In the last two years, there have been numerous papers that have looked into using Deep Neural Networks to replace the acoustic model in traditional statistical parametric speech synthesis. However, far less attention has been paid to approaches like DNN-based postfiltering where DNNs work in conjunction with traditional acoustic models. In this paper, we investigate the use of Recurrent Neural Networks as a potential postfilter for synthesis. We explore the possibility of replacing existing postfilters, as well as highlight the ease with which arbitrary new features can be added as input to the postfilter. We also tried a novel approach of jointly training the Classification And Regression Tree and the postfilter, rather than the traditional approach of training them independently.

研究动机与目标

  • 研究基于RNN的后处理滤波器,以校正统计参数化语音合成中CART预测的MCEP误差。
  • 实现将任意新特征(如小波、词法特征)灵活集成到后处理流程中。
  • 探索通过辅助坐标法(MAC)联合训练CART与RNN后处理滤波器,而非独立训练。
  • 评估RNN后处理滤波器是否能优于或补充传统后处理滤波器(如MLPG)。

提出的方法

  • 训练标准的Clustergen系统,在训练数据上生成MCEP预测结果,并将其作为RNN后处理滤波器的输入。
  • 设计一种RNN架构,处理MCEP的均值与倒谱差分,利用循环连接建模时序依赖性。
  • 将词法特征(如音素与状态信息)作为RNN后处理滤波器的附加输入,以提升上下文感知的校正能力。
  • 应用辅助坐标法(MAC)通过引入中间表示Z作为辅助变量,联合优化CART与RNN后处理滤波器。
  • 将目标函数表述为联合损失:E(W,Z;μ) = ||f₂(Z;W) - Y||² + μ||f₁(X;W) - Z||²,通过交替优化W与Z实现最小化。
  • 使用交替优化与随机梯度下降进行训练,逐步将μ增加至无穷大,以强制满足约束条件。

实验结果

研究问题

  • RQ1RNN后处理滤波器能否有效降低CART预测MCEP在统计参数化合成中的谱失真?
  • RQ2在RNN后处理滤波器中引入词法特征是否能带来可测量的合成质量提升?
  • RQ3通过MAC联合训练CART与RNN后处理滤波器是否优于独立训练?
  • RQ4RNN后处理滤波器在性能上与传统后处理滤波器(如MLPG)相比如何?
  • RQ5RNN在多大程度上学习了现有后处理滤波器(如MLPG)的冗余功能?

主要发现

  • 仅使用RNN后处理滤波器即可显著降低MCD,相较于基线CART,证明其在纠正谱误差方面的有效性。
  • 与MLPG结合使用时,RNN后处理滤波器仅带来微小改进,表明可能存在功能重叠或交互不理想。
  • 通过MAC进行联合训练后,MCD仅实现极小程度降低——SLT为4.89,RMS为4.91(经两次迭代),表明在此设置下增益有限。
  • MAC算法收敛缓慢,首次迭代后无显著改进,提示可能存在过拟合或超参数选择不当。
  • RNN后处理滤波器可无需架构重构即成功集成如词法信息等新特征,凸显其灵活性。
  • 初步结果表明,MAC在此框架中可能无效,原因或为过拟合或最优参数搜索空间过大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。