Skip to main content
QUICK REVIEW

[论文解读] Discriminative Segmental Cascades for Feature-Rich Phone Recognition

Hao Tang, Weiran Wang|arXiv (Cornell University)|Jul 22, 2015
Speech Recognition and Synthesis参考文献 15被引用 12
一句话总结

本文提出判别性分段级联(DSC),一种用于音素识别的粗到细解码与训练框架,利用最大边际剪枝高效整合高阶、计算成本高的特征(如分段神经网络、二阶语言模型和音素边界特征)到判别性分段模型中。该方法在TIMIT数据集上实现了19.9%的音素错误率,创下分段模型的新SOTA记录。

ABSTRACT

Discriminative segmental models, such as segmental conditional random fields (SCRFs) and segmental structured support vector machines (SSVMs), have had success in speech recognition via both lattice rescoring and first-pass decoding. However, such models suffer from slow decoding, hampering the use of computationally expensive features, such as segment neural networks or other high-order features. A typical solution is to use approximate decoding, either by beam pruning in a single pass or by beam pruning to generate a lattice followed by a second pass. In this work, we study discriminative segmental models trained with a hinge loss (i.e., segmental structured SVMs). We show that beam search is not suitable for learning rescoring models in this approach, though it gives good approximate decoding performance when the model is already well-trained. Instead, we consider an approach inspired by structured prediction cascades, which use max-marginal pruning to generate lattices. We obtain a high-accuracy phonetic recognition system with several expensive feature types: a segment neural network, a second-order language model, and second-order phone boundary features.

研究动机与目标

  • 解决使用高阶或昂贵特征(如分段神经网络和二阶特征)的判别性分段模型在解码时的计算瓶颈问题。
  • 通过有效实现多轮解码并整合复杂特征,提升音素识别准确率,超越首次通过模型。
  • 探究在分段结构SVM中,由于其近似和学习能力的已知局限,束搜索是否适用于训练重打分模型。
  • 开发一种级联解码框架,在通过合理剪枝减少假设空间的同时保持高准确率。

提出的方法

  • 该方法采用逐步增加特征复杂度的模型级联,每一阶段利用最大边际得分剪枝假设空间,以保证保留高分路径。
  • 采用结构化预测级联与最大边际剪枝,确保所有得分高于阈值的路径均被保留,与束搜索不同。
  • 该框架应用于使用合页损失训练的分段结构SVM,实现在复杂特征空间中的判别性学习。
  • 整合了昂贵特征,如通过知识蒸馏得到的分段神经网络输出、二阶语言模型和二阶音素边界特征。
  • 解码过程包括假设图与语言模型的有限状态组合,以及图重打分,每级级联均执行剪枝以控制计算成本。
  • 训练过程采用大间隔目标函数与合页损失,第二轮模型在第一轮剪枝后的图上进行训练,以最大边际得分作为监督信号。

实验结果

研究问题

  • RQ1尽管束搜索在近似解码中广受欢迎,它是否能有效用于训练分段结构SVM中的重打分模型?
  • RQ2在级联框架中,最大边际剪枝是否在学习分段模型的复杂高阶特征方面优于束搜索?
  • RQ3当整合如分段神经网络和二阶特征等昂贵特征时,判别性分段模型能否实现最先进的音素识别准确率?
  • RQ4在首次通过或级联设置中,整合二阶语言模型和音素边界特征对识别性能有何影响?

主要发现

  • 判别性分段级联(DSC)框架在TIMIT数据集上实现了19.9%的音素错误率,创下迄今分段模型的最佳成绩。
  • 首次通过系统仅使用一元语言模型即达到21.4%的错误率,优于以往的分段模型,并与HMM-DNN系统保持竞争力。
  • DSC第二轮通过引入二元语言模型、分段神经网络特征和二阶音素边界特征,相较首次通过模型实现了1.8%的绝对错误率降低。
  • 分段神经网络集成在TIMIT分段分类任务上达到15.0%的错误率,是该任务迄今的最佳结果。
  • 将深层分段分类器的知识蒸馏到浅层网络中,实现了高效推理,蒸馏后的特征被用作最终模型的输入。
  • 束搜索被发现不适用于第二轮模型的训练,因其在路径过早剪枝和非负边权重等问题下无法提供有效的梯度更新。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。