Skip to main content
QUICK REVIEW

[论文解读] An Online Attention-based Model for Speech Recognition

Ruchao Fan, Pan Zhou|arXiv (Cornell University)|Nov 13, 2018
Speech Recognition and Synthesis参考文献 29被引用 6
一句话总结

本文提出 LC-AMoChA,一种在线注意力机制语音识别模型,用延迟可控的双向LSTM和自适应单调分块注意力取代LAS中的双向编码器和全局软注意力机制,在普通话语料库上仅造成3.5%的相对WER退化,相比离线基线模型。

ABSTRACT

Attention-based end-to-end models such as Listen, Attend and Spell (LAS), simplify the whole pipeline of traditional automatic speech recognition (ASR) systems and become popular in the field of speech recognition. In previous work, researchers have shown that such architectures can acquire comparable results to state-of-the-art ASR systems, especially when using a bidirectional encoder and global soft attention (GSA) mechanism. However, bidirectional encoder and GSA are two obstacles for real-time speech recognition. In this work, we aim to stream LAS baseline by removing the above two obstacles. On the encoder side, we use a latency-controlled (LC) bidirectional structure to reduce the delay of forward computation. Meanwhile, an adaptive monotonic chunk-wise attention (AMoChA) mechanism is proposed to replace GSA for the calculation of attention weight distribution. Furthermore, we propose two methods to alleviate the huge performance degradation when combining LC and AMoChA. Finally, we successfully acquire an online LAS model, LC-AMoChA, which has only 3.5% relative performance reduction to LAS baseline on our internal Mandarin corpus.

研究动机与目标

  • 在端到端注意力机制语音识别模型(如LAS)中实现实时流式推理。
  • 克服双向编码器和全局软注意力机制带来的延迟瓶颈。
  • 开发一种能根据语音特性动态调整分块大小的注意力机制,以提升流式性能。
  • 在将延迟可控编码与自适应注意力结合时,最小化性能退化。

提出的方法

  • 用延迟可控(LC)双向LSTM替换LAS中的标准双向LSTM编码器,以减少前向计算延迟。
  • 引入自适应单调分块注意力(AMoChA),利用前馈网络预测可变分块长度,而非固定大小。
  • 应用两种补偿技术:(1) 对未来监听器特征进行平均;(2) 对未来注意力概率进行平均,以稳定对齐边界。
  • 使用预训练模型作为初始化,以在LC-BLSTM与AMoChA结合时提升收敛速度和性能。
  • 通过在自适应分块上计算能量得分,并在每个分块内应用软注意力,实现AMoChA机制。
  • 将修改后的编码器和注意力机制集成到具有单向拼写器的流式LAS框架中。

实验结果

研究问题

  • RQ1延迟可控的双向LSTM是否能在保持自动语音识别性能的同时减少编码器延迟?
  • RQ2自适应分块注意力(AMoChA)是否在流式注意力机制语音识别中优于固定大小分块?
  • RQ3在将LC-BLSTM与AMoChA结合时,导致显著性能退化的原因是什么?如何缓解?
  • RQ4在线LAS模型的性能相对于其离线对应模型能保留到何种程度?

主要发现

  • LC-AMoChA模型在普通话语音语料库上仅造成3.5%的相对词错误率(WER)退化,相比离线LAS基线模型。
  • 在未使用补偿方法的情况下,LC-BLSTM与AMoChA结合导致13.1%的相对WER退化,原因是注意力边界错位。
  • 应用第二种补偿方法——对10个时间步的未来注意力概率进行平均——将LC-MoChA模型的退化降低至5%的相对值。
  • 在LC-AMoChA模型中使用相同的补偿方法,实现了最佳结果,仅造成3.5%的相对退化,证实了所提方法的有效性。
  • 在使用未来概率平均时,LC-AMoChA中的注意力权重分布成功重新对齐至更早、更相关的编码器状态。
  • 该模型表明,通过学习长度预测实现的自适应分块可提升流式自动语音识别中的对齐稳定性和性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。