Skip to main content
QUICK REVIEW

[论文解读] Automatic Prosody Prediction for Chinese Speech Synthesis using BLSTM-RNN and Embedding Features

Chuang Ding, Lei Xie|arXiv (Cornell University)|Nov 2, 2015
Natural Language Processing Techniques参考文献 15被引用 5
一句话总结

本文提出一种基于堆叠前馈神经网络与双向LSTM(BLSTM)层的神经网络方法,直接从字符预测中文语调边界(PW、PPH、IPH),无需特征工程。该方法在性能上优于基于CRF的方法,且通过利用大规模原始文本学习到的字符嵌入特征,进一步提升了语音合成的自然度,主观测试结果显著改善。

ABSTRACT

Prosody affects the naturalness and intelligibility of speech. However, automatic prosody prediction from text for Chinese speech synthesis is still a great challenge and the traditional conditional random fields (CRF) based method always heavily relies on feature engineering. In this paper, we propose to use neural networks to predict prosodic boundary labels directly from Chinese characters without any feature engineering. Experimental results show that stacking feed-forward and bidirectional long short-term memory (BLSTM) recurrent network layers achieves superior performance over the CRF-based method. The embedding features learned from raw text further enhance the performance.

研究动机与目标

  • 解决在文本到语音合成中自动预测中文语调边界而不依赖人工特征工程的挑战。
  • 克服基于CRF的模型对精确分词和词性标注的依赖,这些步骤易导致误差传播。
  • 探究深度神经网络(特别是BLSTM-RNN)在建模序列化语调结构方面的有效性。
  • 探究从原始文本中学习到的字符级嵌入特征是否能提升语调预测性能。
  • 通过主观听音测试评估所提方法对合成语音自然度的影响。

提出的方法

  • 使用一种神经网络架构,以原始中文字符作为输入,将其映射为分布式嵌入向量,而非独热表示。
  • 采用前馈神经网络(FFNN)与双向长短期记忆(BLSTM)层的堆叠结构,从字符序列中学习分层上下文表征。
  • 应用Viterbi算法进行序列标注以实现语调边界预测,为每个字符分配标签(B、NB、O)。
  • 利用大规模原始文本语料,通过无监督预训练目标学习字符嵌入特征,随后在主模型中进行微调。
  • 使用带动量的随机梯度下降进行网络训练,并基于验证集表现采用早停策略。
  • 将预测的语调标签作为基于HMM的TTS系统输入,进行语音合成,并开展A/B偏好测试以评估自然度。

实验结果

研究问题

  • RQ1深度神经网络架构能否在无需人工特征工程的情况下,直接从字符预测中文文本的语调边界?
  • RQ2与基于CRF的模型相比,堆叠前馈神经网络与BLSTM层是否能提升语调预测性能?
  • RQ3从原始文本中学习到的字符嵌入特征在多大程度上能提升语调预测准确率?
  • RQ4与基于CRF的方法相比,使用基于神经网络的语调预测对合成语音自然度有何影响?
  • RQ5在中文TTS中,语调边界预测的最优网络拓扑结构与嵌入维度是什么?

主要发现

  • 所提出的BLSTM-RNN模型采用FBB拓扑结构,在语调词(PW)预测上达到96.35%的F1分数,优于CRF基线的96.03%。
  • 在语调短语(PPH)预测中,模型达到84.57%的F1分数,显著优于CRF基线的83.06%。
  • 在语调短语(IPH)预测中,采用FBB拓扑结构的模型达到81.63%的F1分数,超过CRF基线的78.71%。
  • 使用字符嵌入特征后性能进一步提升,在最优嵌入尺寸下,PW达到96.59%的F1,PPH达到84.96%,IPH达到82.27%。
  • 主观A/B测试显示,使用神经网络结合嵌入特征合成的语音在65%的时间内优于基于CRF的合成语音,70%的时间内优于独热表示,表明自然度显著提升。
  • 表现最佳的模型架构始终为FBB(前馈、双向LSTM、双向LSTM),无论语调层级如何。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。