Skip to main content
QUICK REVIEW

[论文解读] The Microsoft 2016 Conversational Speech Recognition System

Wayne Xiong, Jasha Droppo|arXiv (Cornell University)|Sep 12, 2016
Speech Recognition and Synthesis参考文献 29被引用 16
一句话总结

本文介绍了微软2016年对话式语音识别系统,该系统结合了深度卷积神经网络(CNN)、双向LSTM、i-vector自适应、无网格最大互信息(LFMMI)训练以及集成方法与双向RNN语言模型。该系统在NIST 2000 Switchboard测试集上实现了6.2%的词错误率,是当时通过模型组合和先进神经架构(包括ResNet和带注意力机制的LACE)实现的最先进结果。

ABSTRACT

We describe the 2017 version of Microsoft's conversational speech recognition system, in which we update our 2016 system with recent developments in neural-network-based acoustic and language modeling to further advance the state of the art on the Switchboard speech recognition task. The system adds a CNN-BLSTM acoustic model to the set of model architectures we combined previously, and includes character-based and dialog session aware LSTM language models in rescoring. For system combination we adopt a two-stage approach, whereby subsets of acoustic models are first combined at the senone/frame level, followed by a word-level voting via confusion networks. We also added a confusion network rescoring step after system combination. The resulting system yields a 5.1\% word error rate on the 2000 Switchboard evaluation set.

研究动机与目标

  • 通过整合深度神经网络和集成技术,推动对话式语音识别技术的最先进水平。
  • 通过先进的CNN架构(如ResNet)和带注意力机制的LACE,改进声学建模。
  • 通过双向RNNLM和基于词后验的概率系统组合,增强语言建模。
  • 通过端到端训练和重打分技术,在Switchboard基准上降低词错误率(WER)。
  • 展示无网格MMI训练和i-vector自适应在神经声学模型中的有效性。

提出的方法

  • 采用混合系统,使用多种CNN和LSTM声学模型架构,包括VGG、ResNet以及带逐层上下文扩展和注意力机制的LACE。
  • 通过可学习权重矩阵将说话人特定嵌入注入CNN层,并将它们附加到LSTM输入中,实现i-vector说话人自适应。
  • 利用无网格最大互信息(LFMMI)训练,联合优化声学模型与上下文相关的音素状态及后验概率。
  • 实施双向RNN语言模型(RNNLM),在正向和反向方向上进行训练,以提升n-gram泛化能力。
  • 应用混淆网络组合并进行搜索,以选择最优的系统子集组合多个模型,利用词后验提高鲁棒性。
  • 采用两阶段RNNLM训练方案,有效整合域外数据,增强泛化能力和性能。

实验结果

研究问题

  • RQ1带有残差连接和注意力机制的深度CNN是否能在对话式语音识别中超越标准DNN和LSTM?
  • RQ2与传统的交叉熵训练和基于网格的方法相比,无网格MMI训练在提升声学模型性能方面有多有效?
  • RQ3i-vector自适应在多种声学模型架构(包括CNN和LSTM)中能多大程度上提升性能?
  • RQ4双向RNNLM和多系统组合对Switchboard任务中词错误率降低有何影响?
  • RQ5结合多个声学模型和语言模型的集成方法能否在NIST 2000 Switchboard基准上实现最先进性能?

主要发现

  • 最佳单系统(基于ResNet的声学模型配合RNNLM重打分)在NIST 2000 Switchboard测试集上实现了6.9%的词错误率(WER)。
  • 最终组合系统(整合多个声学和语言模型)实现了6.2%的WER,相比最佳单系统相对误差降低20%。
  • i-vector自适应在所有声学模型类型中均带来5–8%的相对WER改进,包括CNN和LSTM。
  • LFMMI训练在所有模型中均实现7–10%的相对WER降低,证明其在标准交叉熵训练中的有效性。
  • 使用正向和反向模型的RNNLM重打分使最佳单系统实现20%的相对误差降低,凸显双向语言建模的价值。
  • 系统组合过程(采用混淆网络组合和子集搜索)相比最佳单系统实现16%的相对WER改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。