[论文解读] Synchronous Transformers for End-to-End Speech Recognition
本文提出了一种新型端到端语音识别模型——同步变压器(Synchronous Transformer,Sync-Transformer),通过将输入按固定长度分块并同步解码,实现了在线流式推理。通过强制编码器中的自注意力机制仅关注左侧上下文,并在训练过程中使用前向后向算法优化所有对齐路径,该模型在AISHELL-1普通话数据集上实现了8.91%的字符错误率(CER),性能与当前最先进Transformer模型相当,同时支持实时部署。
For most of the attention-based sequence-to-sequence models, the decoder predicts the output sequence conditioned on the entire input sequence processed by the encoder. The asynchronous problem between the encoding and decoding makes these models difficult to be applied for online speech recognition. In this paper, we propose a model named synchronous transformer to address this problem, which can predict the output sequence chunk by chunk. Once a fixed-length chunk of the input sequence is processed by the encoder, the decoder begins to predict symbols immediately. During training, a forward-backward algorithm is introduced to optimize all the possible alignment paths. Our model is evaluated on a Mandarin dataset AISHELL-1. The experiments show that the synchronous transformer is able to perform encoding and decoding synchronously, and achieves a character error rate of 8.91% on the test set.
研究动机与目标
- 解决标准基于注意力的序列到序列模型中存在的编码-解码异步问题,该问题阻碍了在线语音识别的实现。
- 通过允许解码器在每个固定长度输入块处理完成后立即生成输出,实现低延迟、流式推理。
- 在支持在线部署的同时,保持与非流式Transformer模型相当的高识别准确率。
- 开发一种训练方法,利用前向后向算法优化所有可能的对齐路径,避免依赖强制对齐或复杂的注意力机制。
提出的方法
- 编码器使用因果自注意力机制,限制每个标记仅能关注其左侧上下文,从而消除对后续标记的依赖。
- 将输入序列分割为固定长度W的重叠块,相邻块之间重叠长度为B,以确保信息流动的平滑性。
- 解码器逐块生成输出符号,从每个编码器块处理完成后立即开始。
- 在训练过程中,应用前向后向算法对所有可能的对齐路径求和,计算类似RNN-Transducer和SA-T的负对数似然损失。
- 使用二维卷积前端对输入特征序列进行下采样,并将其映射到更高维空间后再送入编码器处理。
- 该模型结合了Transformer与自注意力转换器(SA-T)架构的优势,实现了端到端、流式且高精度的语音识别。
实验结果
研究问题
- RQ1基于Transformer的模型能否实现同步编码与解码,以支持在线语音识别?
- RQ2将自注意力机制限制在左侧上下文会对模型性能和流式处理能力产生何种影响?
- RQ3在不依赖RNN或强制对齐的情况下,前向后向算法能否有效优化基于自注意力机制模型中的对齐路径?
- RQ4在流式设置中,如何在保持识别准确率的前提下,找到块长度与重叠长度之间的最佳平衡?
- RQ5与现有端到端模型(如LAS、RNN-T和标准Transformer)相比,所提模型在准确率和推理效率方面表现如何?
主要发现
- Sync-Transformer在AISHELL-1测试集上实现了8.91%的字符错误率(CER),性能与非流式Transformer模型相当。
- 当块长度为10、重叠长度为3时,模型性能最佳,优于重叠长度为0、1、2或4的配置。
- 该模型优于先前的无RNN转换器模型(如Chunk-Flow SA-T),后者CER更高(9.80% vs. 8.91%),且需要更多解码步骤。
- Sync-Transformer实现了在线流式推理,仅带来与全注意力Transformer(测试集CER为8.64%)相比微小的性能下降。
- 与RNN-T和SA-T相比,该模型在推理过程中需要的解码步骤更少,从而降低了内存和时间开销。
- 模型在删除错误和音似词混淆方面略有增加,表明其鲁棒性仍有提升空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。