[论文解读] Language model fusion for streaming end to end speech recognition
本文提出了一种新颖的语言模型融合技术——扩展了浅层融合与冷融合,并引入了早期融合变体——用于使用循环神经网络转换器(RNNT)的流式端到端自动语音识别。实验表明,冷融合显著提升了流式RNNT的性能,通过利用预训练语言模型整合未配对的文本数据,实现了高达8.5%的相对WER降低,尤其在低资源语言和长尾语言现象方面表现突出。
Streaming processing of speech audio is required for many contemporary practical speech recognition tasks. Even with the large corpora of manually transcribed speech data available today, it is impossible for such corpora to cover adequately the long tail of linguistic content that's important for tasks such as open-ended dictation and voice search. We seek to address both the streaming and the tail recognition challenges by using a language model (LM) trained on unpaired text data to enhance the end-to-end (E2E) model. We extend shallow fusion and cold fusion approaches to streaming Recurrent Neural Network Transducer (RNNT), and also propose two new competitive fusion approaches that further enhance the RNNT architecture. Our results on multiple languages with varying training set sizes show that these fusion methods improve streaming RNNT performance through introducing extra linguistic features. Cold fusion works consistently better on streaming RNNT with up to a 8.5% WER improvement.
研究动机与目标
- 为解决流式端到端自动语音识别系统中识别罕见或未登录词语言现象(如专有名词、数字)的挑战。
- 将原本为非流式模型开发的语言模型融合技术扩展至流式RNNT设置。
- 探究非流式注意力机制模型(如LAS)中观察到的融合增益是否可在流式RNNT模型中复现。
- 评估融合位置(在联合网络之前或之后)以及模型容量对多种低资源和中等资源语言性能的影响。
提出的方法
- 通过在推理阶段使用对数概率的加权和,将RNNT得分与语言模型得分进行浅层融合。
- 通过联合微调RNNT与语言模型并使用共享损失,实现冷融合,从而实现参数的协同适应。
- 提出早期浅层融合与早期冷融合,即在联合网络之前融合语言模型,以实现更早的语境信息整合。
- 在融合过程中,将语言模型对空白符号的概率定义为与RNNT的空白概率相等,以保持解码过程的一致性。
- 使用仅在未配对文本数据上训练的RNN语言模型,提供语言先验,而无需配对的语音-文本数据。
- 采用wordpiece分词,并在解码过程中优化空白符号惩罚,以改善对齐效果和输出质量。
实验结果
研究问题
- RQ1为非流式自动语音识别模型开发的语言模型融合技术能否有效适配至流式RNNT架构?
- RQ2在流式RNNT设置中,冷融合是否优于浅层融合,尤其是在低资源场景下?
- RQ3融合位置(在联合网络之前或之后)如何影响识别性能与模型灵活性?
- RQ4训练数据规模在多大程度上影响流式RNNT系统中语言模型融合的有效性?
- RQ5与未配对文本数据融合能否提升流式自动语音识别中对罕见或长尾语言现象(如专有名词和数字)的识别能力?
主要发现
- 冷融合在挪威语上实现了高达8.5%的相对WER降低,显著优于浅层融合与基线模型。
- 冷融合在所有三种测试语言(挪威语、希腊语、僧伽罗语)中均一致提升了性能,而浅层融合在希腊语和僧伽罗语上未见改善。
- 冷融合带来的最大WER增益出现在低资源设置中(如挪威语),表明当自动语音识别模型受数据限制时,融合技术最为有效。
- 早期融合变体(早期浅层融合与早期冷融合)的性能与标准融合相当,表明融合点可灵活设置在联合网络之前或之后。
- 案例分析显示,冷融合正确识别了训练数据中不存在但出现在语言模型语料库中的未登录词,如“Range Rover”和“Andrianopolis”。
- 模型性能差距主要归因于低资源语言的数据稀缺性,因为僧伽罗语因语言模型存在过拟合与领域不匹配问题,增益极小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。