Skip to main content
QUICK REVIEW

[论文解读] Streaming Chunk-Aware Multihead Attention for Online End-to-End Speech Recognition

Shiliang Zhang, Zhifu Gao|arXiv (Cornell University)|May 21, 2020
Speech Recognition and Synthesis参考文献 31被引用 13
一句话总结

本文提出Streaming Chunk-Aware Multihead Attention (SCAMA) 以及一种延迟可控的带记忆自注意力网络(LC-SAN-M),用于在线端到端语音识别。通过使用联合训练的预测器,根据块级编码器状态控制解码器输出,SCAMA 实现了低延迟、流式推理,且性能下降最小,在不使用外部语言模型的情况下,于 AISHELL-1 数据集上实现了最先进的 7.39% CER。

ABSTRACT

Recently, streaming end-to-end automatic speech recognition (E2E-ASR) has gained more and more attention. Many efforts have been paid to turn the non-streaming attention-based E2E-ASR system into streaming architecture. In this work, we propose a novel online E2E-ASR system by using Streaming Chunk-Aware Multihead Attention(SCAMA) and a latency control memory equipped self-attention network (LC-SAN-M). LC-SAN-M uses chunk-level input to control the latency of encoder. As to SCAMA, a jointly trained predictor is used to control the output of encoder when feeding to decoder, which enables decoder to generate output in streaming manner. Experimental results on the open 170-hour AISHELL-1 and an industrial-level 20000-hour Mandarin speech recognition tasks show that our approach can significantly outperform the MoChA-based baseline system under comparable setup. On the AISHELL-1 task, our proposed method achieves a character error rate (CER) of 7.39%, to the best of our knowledge, which is the best published performance for online ASR.

研究动机与目标

  • 为解决在流式端到端语音识别中应用完整注意力机制的挑战,其中完整序列注意力是非流式的且不切实际。
  • 减少因固定超参数(如窗口大小或阈值)导致的在线注意力机制性能下降,这些参数在真实场景中缺乏鲁棒性。
  • 开发一种流式注意力机制,在保持强大上下文建模能力的同时,通过基于块的动态可学习控制实现低延迟推理。
  • 在不依赖外部语言模型的前提下,实现在大规模工业数据集上的最先进性能,尤其针对在线语音识别任务。

提出的方法

  • 提出 LC-SAN-M,即带记忆自注意力(SAN-M)的延迟可控变体,其中编码器输出受块级输入约束,以控制延迟。
  • 引入 SCAMA,一种流式多头注意力机制,利用联合训练的预测器估算每个输入块的 token 数量,从而实现解码器的动态激活。
  • 预测器采用交叉熵损失进行训练,而非 CTC 损失,与基于 CTC 的触发方法相比,减少了训练与推理之间的不匹配。
  • SCAMA 通过仅关注相关编码器块来限制未来上下文,从而在保持流式能力的同时保留长距离依赖关系。
  • 该模型采用标准的 Transformer 编码器-解码器架构,结合多头注意力机制,但在解码过程中应用基于块的掩码和动态注意力控制。
  • 系统通过端到端联合优化编码器、解码器和 token 预测头进行训练,无需外部监督即可实现对齐与上下文建模。

实验结果

研究问题

  • RQ1与固定阈值或基于窗口的注意力相比,可学习的、基于块感知的注意力机制是否能减少在线语音识别中的性能下降?
  • RQ2将基于 CTC 的触发机制替换为经交叉熵损失训练的预测器,是否能提升流式语音识别中的推理鲁棒性与性能?
  • RQ3SCAMA 是否能在保持低延迟的同时,实现在在线设置下的接近非流式性能?
  • RQ4在大规模工业语音识别任务中,SCAMA 与 MoChA 及其他在线注意力机制相比表现如何?

主要发现

  • 在 170 小时的 AISHELL-1 数据集上,所提出的基于 SCAMA 的系统实现了 7.39% 的字符错误率(CER),据作者所知,这是目前无需外部语言模型的在线端到端语音识别的最先进结果。
  • LC-SAN-M 编码器在块大小为 10 时,相比完整序列注意力基线,性能下降了 7%,表明延迟控制引入了虽小但可测量的代价。
  • 将完整序列注意力替换为 SCAMA 后,性能相对下降 6.8%,显著低于 MoChA 系统所见的下降幅度。
  • 在 20,000 小时的工业级普通话语音识别任务中,基于 SCAMA 的系统在相同延迟约束下优于 CTC 和 MoChA 基线系统。
  • 当使用 32 块 V100 GPU 时,SCAMA 模型的训练速度比 MoChA 快 3 倍,表明训练效率得到提升。
  • 可视化结果表明,完整注意力机制不仅执行对齐,还进行上下文建模,这解释了为何需要像 SCAMA 这类机制,以在支持流式处理的同时保留长距离上下文。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。