[论文解读] Improving the Performance of Online Neural Transducer Models
本文通过扩展注意窗口以引入回望和前瞻机制、从预训练的LAS模型进行初始化,并通过子词单元和外部语言模型融合集成更强的语言模型,改进了用于流式语音识别的在线神经转导器(NT)模型。这些改进使300ms延迟(块大小为5)的NT模型在性能上仅比非流式LAS模型低1%相对WER,达到与之相当的准确率,同时仍适用于实时应用。
Having a sequence-to-sequence model which can operate in an online fashion is important for streaming applications such as Voice Search. Neural transducer is a streaming sequence-to-sequence model, but has shown a significant degradation in performance compared to non-streaming models such as Listen, Attend and Spell (LAS). In this paper, we present various improvements to NT. Specifically, we look at increasing the window over which NT computes attention, mainly by looking backwards in time so the model still remains online. In addition, we explore initializing a NT model from a LAS-trained model so that it is guided with a better alignment. Finally, we explore including stronger language models such as using wordpiece models, and applying an external LM during the beam search. On a Voice Search task, we find with these improvements we can get NT to match the performance of LAS.
研究动机与目标
- 缩小流式神经转导器(NT)模型与非流式全序列模型(如LAS)在流式语音识别中的性能差距。
- 探究架构与训练改进方法,使NT在保持低延迟的同时达到LAS级别的准确率。
- 评估更强语言建模(包括子词单元和外部语言模型)对NT性能的影响。
- 确定从LAS模型进行预训练是否能提升NT的收敛速度与最终性能。
- 分析NT相比LAS性能下降的根本原因,特别是语言建模错误。
提出的方法
- 在NT中扩展注意窗口,引入对前序块的回望和向前5帧的前瞻,两者均不增加额外延迟。
- 从预训练的LAS模型初始化NT模型权重,以提供更好的对齐监督并加快收敛速度。
- 将子词单元替换为子词单元(WPM),以增强解码器中的语言建模能力。
- 通过浅层融合将外部n-gram FST语言模型与NT系统结合,以提升语言建模效果。
- 在LAS和NT模型中均使用多头注意力机制,以改善表征学习与注意力动态。
- 在12,500小时语音搜索数据集上训练并评估模型,使用块大小为5(300ms)和10(450ms)以评估延迟-性能权衡。
实验结果
研究问题
- RQ1在NT中引入回望与前瞻机制是否能减少与LAS相比的性能下降?
- RQ2从预训练的LAS模型对NT进行预训练是否能显著提升其最终性能?
- RQ3基于子词单元(WPM)的子词表示在低块大小下对NT语言建模的提升程度如何,尤其在低延迟场景?
- RQ4外部语言模型融合是否能进一步缩小NT与LAS之间的性能差距?
- RQ5NT相比LAS的主要错误类型是什么?这些错误能否通过架构与训练改进得到缓解?
主要发现
- 在块大小为10(450ms延迟)时,引入回望与前瞻注意机制的NT模型相比LAS的相对WER下降超过20%,表明仍有显著改进空间。
- 从LAS模型进行预训练可有效缩小性能差距,使块大小为10的NT模型达到与LAS相当的性能。
- 使用子词单元(WPM)显著提升了NT中的语言建模能力,使块大小为5和10时的WER均降至8.6,显著缩小了与LAS的差距。
- 在NT中使用多头注意力并未提升性能,而单头注意力已足够,与LAS中多头注意力的增益形成对比,表明在流式设置中注意力机制的使用存在局限。
- 在结合WPM的基础上,外部FST语言模型融合未带来额外增益,可能是因为解码器本身已具备RNN-LM的建模能力。
- 性能最佳的NT系统在块大小为5(300ms延迟)时,仅比LAS模型有1%的相对WER下降,证明其在实时约束下已实现近乎对齐的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。