[论文解读] Transfer learning of language-independent end-to-end ASR with language model fusion
本文提出LM融合迁移(LM fusion transfer)方法,该方法在微调阶段将外部语言模型(LM)整合到预训练的、与语言无关的端到端自动语音识别(ASR)系统解码器中,以适应低资源语言。通过在微调过程中利用冷融合(cold fusion)技术引入外部文本数据,该方法显著提升了ASR性能——在低资源数据上(例如约50小时)相较先前的迁移学习方法实现最高达21.6%的相对性能提升,并缩小了与最先进混合系统之间的性能差距。
This work explores better adaptation methods to low-resource languages using an external language model (LM) under the framework of transfer learning. We first build a language-independent ASR system in a unified sequence-to-sequence (S2S) architecture with a shared vocabulary among all languages. During adaptation, we perform LM fusion transfer, where an external LM is integrated into the decoder network of the attention-based S2S model in the whole adaptation stage, to effectively incorporate linguistic context of the target language. We also investigate various seed models for transfer learning. Experimental evaluations using the IARPA BABEL data set show that LM fusion transfer improves performances on all target five languages compared with simple transfer learning when the external text data is available. Our final system drastically reduces the performance gap from the hybrid systems.
研究动机与目标
- 通过在仅有少量转录数据的新语言上改进适应能力,解决低资源自动语音识别(ASR)的挑战。
- 探究外部语言模型(LM)提供的语言上下文是否能增强端到端ASR系统中的迁移学习性能。
- 探索在多语言序列到序列(S2S)模型的适应阶段,不同LM融合策略(浅层融合、深层融合和冷融合)的有效性。
- 评估模型初始容量和多语言训练数据多样性对低资源适应性能的影响。
- 证明:通过冷融合迁移整合外部文本数据,可在低资源设置下实现或超越传统混合ASR系统的性能。
提出的方法
- 使用统一的序列到序列(S2S)架构训练一个与语言无关的端到端ASR系统,该架构在多种语言间共享词汇表。
- 通过仅使用语音数据对预训练的S2S模型进行微调,完成初始迁移学习步骤,实现目标低资源语言的迁移。
- 提出LM融合迁移:在适应阶段通过冷融合将外部RNNLM集成到解码器网络中,其中LM在整个适应训练阶段持续融合。
- 利用外部文本数据(例如IARPA BABEL数据)预训练RNNLM,随后将其与S2S解码器融合,以在推理和训练过程中提升语言建模能力。
- 通过在五种低资源语言上评估性能,比较多种融合策略(浅层融合、深层融合和冷融合)的差异。
- 评估模型容量和多语言训练数据规模(600–2200小时)对适应性能的影响,尤其在结合外部文本数据时。

实验结果
研究问题
- RQ1外部语言模型提供的语言上下文能否提升低资源端到端ASR中迁移学习的性能?
- RQ2在低资源语言上,LM融合迁移相较于仅使用浅层融合的简单迁移学习,在词错误率(WER)降低方面表现如何?
- RQ3LM融合的有效性是否依赖于外部文本数据的可用性及其规模?
- RQ4初始模型的选择(在不同数量和类型的多语言数据上训练)如何影响适应性能?
- RQ5当在适应阶段可访问外部文本数据时,冷融合迁移是否能超越其他融合方法(浅层融合、深层融合)?
主要发现
- 当有外部文本数据可用时,与仅使用浅层融合的简单迁移学习相比,LM融合迁移在全部五种低资源语言(阿萨姆语、斯瓦希里语、老挝语、他加禄语、祖鲁语)上均显著提升了ASR性能。
- 在FLP(约50小时)数据集上,冷融合迁移(CF-transfer)相较先前的迁移学习方法平均实现了21.6%的相对WER降低,且在无LM融合的迁移学习基础上最高提升了6.8%。
- 在LLP(约10小时)数据集上,当使用较大规模的外部文本数据(FLP)时,CF-transfer相较浅层融合平均相对提升了10.4%,证明了语言上下文对适应过程的价值。
- 所提出的端到端系统与最先进BLSTM-HMM混合系统之间的性能差距被显著缩小,尤其在使用外部文本数据时更为明显。
- 即使仅有10小时语音数据,当使用在50小时文本上预训练的RNNLM时,WER也显著下降,表明在低资源设置下语言上下文具有高度益处。
- 该方法高效且实用:仅在适应阶段集成外部LM,计算开销极小,适合在新语言中实现快速部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。