Skip to main content
QUICK REVIEW

[论文解读] Multi-head Monotonic Chunkwise Attention For Online Speech Recognition

Baiji Liu, Songjun Cao|arXiv (Cornell University)|May 1, 2020
Speech Recognition and Synthesis参考文献 22被引用 13
一句话总结

本文提出多头单调分块注意力(MTH-MoChA),一种在线语音识别模型,通过在固定大小的输入分块上应用多头注意力机制,对MoChA进行改进,实现了高效的流式推理。结合LSTM池化、SpecAugment和最小词错误率(MWER)训练等额外训练策略,MTH-MoChA在18,000小时车载数据集上的字符错误率(CER)降低至7.28%,优于最先进的混合系统。

ABSTRACT

The attention mechanism of the Listen, Attend and Spell (LAS) model requires the whole input sequence to calculate the attention context and thus is not suitable for online speech recognition. To deal with this problem, we propose multi-head monotonic chunk-wise attention (MTH-MoChA), an improved version of MoChA. MTH-MoChA splits the input sequence into small chunks and computes multi-head attentions over the chunks. We also explore useful training strategies such as LSTM pooling, minimum world error rate training and SpecAugment to further improve the performance of MTH-MoChA. Experiments on AISHELL-1 data show that the proposed model, along with the training strategies, improve the character error rate (CER) of MoChA from 8.96% to 7.68% on test set. On another 18000 hours in-car speech data set, MTH-MoChA obtains 7.28% CER, which is significantly better than a state-of-the-art hybrid system.

研究动机与目标

  • 为解决标准注意力机制在在线语音识别中的局限性,即必须等待完整输入序列后才能生成输出。
  • 提升单调分块注意力(MoChA)的表达能力与性能,该机制受限于单头注意力及每分块的有限上下文。
  • 开发一种流式端到端自动语音识别(ASR)模型,在不使用外部语言模型的情况下实现具有竞争力的性能。
  • 评估MTH-MoChA及其互补训练策略在低资源(AISHELL-1)和大规模(InCar)数据集上的有效性。

提出的方法

  • MTH-MoChA将编码器的隐藏状态序列划分为固定大小的分块,并在这些分块上应用多头注意力,使模型能够同时关注多个相关区域。
  • 通过在注意力头之间共享参数,提升模型鲁棒性并减少过拟合,同时保持计算效率。
  • 在编码器层之间应用LSTM池化,以减少序列长度,降低推理阶段的计算成本。
  • 在训练过程中使用SpecAugment增强频谱图特征,提升泛化能力。
  • 应用标签平滑和最小词错误率(MWER)训练,以增强模型鲁棒性,并使优化目标与词级错误指标对齐。
  • 模型使用Lingvo工具包进行训练,并在AISHELL-1和两个车载数据集(InCar2000和InCar18000)上进行评估。

实验结果

研究问题

  • RQ1在固定分块上应用多头注意力是否能提升单调分块注意力(MoChA)在在线语音识别中的性能?
  • RQ2在注意力头之间共享参数是否能增强流式ASR中模型的鲁棒性与泛化能力?
  • RQ3像SpecAugment、标签平滑和MWER训练这样的训练策略在多大程度上提升了MTH-MoChA的性能?
  • RQ4MTH-MoChA是否能在不使用外部语言模型的情况下,超越强大的混合系统(如TDNN-OPGRU)?
  • RQ5MTH-MoChA在具有短语音和复杂词汇的大型真实车载语音数据上表现如何?

主要发现

  • 在AISHELL-1测试集上,经过优化训练的MTH-MoChA将CER从基线MoChA的8.96%降低至7.68%,显著优于基线模型。
  • 在18,000小时车载数据集上,MTH-MoChA实现了7.28%的CER,优于使用LF-MMIE准则训练的最先进混合系统。
  • 在InCar18000数据集上,LSTM池化与MWER训练的结合使CER相比基础MTH-MoChA模型相对降低9.09%。
  • 在InCar2000数据集上,MTH-MoChA相比MoChA将CER相对降低21.62%,在短语音上表现出显著优势。
  • 该模型在不依赖外部语言模型的情况下实现具有竞争力的性能,表明其在端到端流式ASR中具备强大的内在建模能力。
  • 结果表明,MTH-MoChA在低资源和真实车载环境中尤为有效,这些环境通常具有短语音和多样化词汇。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。