Skip to main content
QUICK REVIEW

[论文解读] Mandarin tone modeling using recurrent neural networks

Hao Huang, Ying Hu|arXiv (Cornell University)|Nov 6, 2017
Music and Audio Processing参考文献 22被引用 4
一句话总结

本文提出了一种基于RNN的编码器-分类器框架,用于普通话声调分类,该框架将帧级基频特征编码为固定维的声调嵌入,再通过Softmax层进行分类。通过整合上下文音节嵌入和时长特征,模型将准确率提升,测试准确率达到79.7%,相比仅使用当前音节嵌入的模型提高了2.4个百分点绝对值,表现出优于GMM-HMM基线模型的优越性能。

ABSTRACT

We propose an Encoder-Classifier framework to model the Mandarin tones using recurrent neural networks (RNN). In this framework, extracted frames of features for tone classification are fed in to the RNN and casted into a fixed dimensional vector (tone embedding) and then classified into tone types using a softmax layer along with other auxiliary inputs. We investigate various configurations that help to improve the model, including pooling, feature splicing and utilization of syllable-level tone embeddings. Besides, tone embeddings and durations of the contextual syllables are exploited to facilitate tone classification. Experimental results on Mandarin tone classification show the proposed network setups improve tone classification accuracy. The results indicate that the RNN encoder-classifier based tone model flexibly accommodates heterogeneous inputs (sequential and segmental) and hence has the advantages from both the sequential classification tone models and segmental classification tone models.

研究动机与目标

  • 开发一种统一的深度学习框架,结合序列输入与片段输入,用于普通话声调分类。
  • 克服传统声调模型的局限性,这些模型要么忽略上下文信息,要么需要人工特征工程。
  • 探索RNN在从原始帧级基频特征中学习声调嵌入方面的有效性。
  • 将上下文声调信息与时长特征整合到一个端到端可训练的声调分类系统中。
  • 将所提出的基于RNN的模型与传统的GMM-HMM和DNN基线模型进行比较。

提出的方法

  • RNN编码器将帧级基频特征(如F0)处理为每个音节的固定维声调嵌入。
  • 通过特征拼接,将声调嵌入与辅助输入(如时长特征和上下文音节嵌入)相结合。
  • 对RNN隐藏状态应用平均池化,为每个音节生成紧凑表示。
  • Softmax分类器使用融合输入(声调嵌入 + 时长 + 上下文)预测五个普通话声调之一。
  • 时长特征经过归一化处理,并通过一个Sigmoid层后,再与声调嵌入拼接。
  • 模型通过最小化交叉熵损失进行训练,实现声调表征的端到端学习。

实验结果

研究问题

  • RQ1基于RNN的编码器-分类器框架能否有效利用序列基频特征与片段输入对普通话声调进行建模?
  • RQ2整合上下文音节嵌入与时长特征如何提升声调分类准确率?
  • RQ3所提出的模型在多大程度上优于传统的GMM-HMM和DNN基线模型?
  • RQ4RNN框架能否在无需人工基频追踪的情况下自动学习声调基频核心与超音段特征?
  • RQ5特征拼接与池化操作在多大程度上影响模型在不同声调上下文中的泛化能力?

主要发现

  • 当仅使用当前音节的声调嵌入时,基于RNN的编码器-分类器框架在测试中达到79.7%的准确率。
  • 通过引入前一个和后一个音节的声调嵌入,准确率提升了2.4个百分点绝对值,达到82.1%。
  • 通过10个神经元的Sigmoid层引入时长特征,额外带来0.8%的准确率提升,达到82.9%。
  • 该模型优于ML训练的GMM-HMM(70.4%准确率)和MMI训练的GMM-HMM(75.7%准确率),表现出明显优势。
  • 该框架成功地在一个统一架构中整合了自动学习的序列特征与人工设计的片段特征(如时长)。
  • 结果表明,RNN编码器-分类器模型能够灵活适应异构输入,并有效利用超音段声调信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。