[论文解读] Transfer Learning Approaches for Streaming End-to-End Speech Recognition System
本论文提出并评估了在流式端到端语音识别中使用RNN-T模型的迁移学习(TL)策略,尤其针对印地语(hi-IN)等低资源语言。通过使用预训练的英语(en-US)模型初始化编码器和预测网络——特别是采用两阶段TL方法并使用音素目标——相比随机初始化,该方法实现了高达17.4%的相对词错误率(WER)降低,并显著加快了训练收敛速度。
Transfer learning (TL) is widely used in conventional hybrid automatic speech recognition (ASR) system, to transfer the knowledge from source to target language. TL can be applied to end-to-end (E2E) ASR system such as recurrent neural network transducer (RNN-T) models, by initializing the encoder and/or prediction network of the target language with the pre-trained models from source language. In the hybrid ASR system, transfer learning is typically done by initializing the target language acoustic model (AM) with source language AM. Several transfer learning strategies exist in the case of the RNN-T framework, depending upon the choice of the initialization model for encoder and prediction networks. This paper presents a comparative study of four different TL methods for RNN-T framework. We show 17% relative word error rate reduction with different TL methods over randomly initialized RNN-T model. We also study the impact of TL with varying amount of training data ranging from 50 hours to 1000 hours and show the efficacy of TL for languages with small amount of training data.
研究动机与目标
- 解决在转录数据有限的低资源语言上训练鲁棒端到端自动语音识别(ASR)模型的挑战。
- 研究迁移学习作为稳定训练并提升低资源RNN-T系统性能的手段。
- 评估多种TL策略,包括直接初始化与两阶段微调,以确定最有效的方法。
- 在不同数据规模下(50至1000小时)验证TL的有效性。
- 将TL性能与随机初始化及混合ASR模型进行比较,以验证其在准确率和收敛速度上的提升。
提出的方法
- 通过使用源语言(en-US)模型的预训练权重初始化目标语言(hi-IN)RNN-T模型的编码器和/或预测网络,应用迁移学习。
- 实施两阶段迁移学习:首先使用预训练的en-US模型作为主干,对目标语言模型(hi-IN)进行预训练;然后使用目标数据对完整RNN-T模型进行微调。
- 在两阶段预训练阶段使用音素级目标,以改善对齐与表征学习。
- 比较四种TL策略:en-US编码器仅初始化、en-US RNN-T联合模型初始化、使用音素与音素目标的两阶段TL,以及使用hi-IN语言模型的混合初始化。
- 使用相同的超参数(学习率、批量大小)训练模型,以确保对收敛速度与性能的公平比较。
- 解码时使用80维对数梅尔滤波器组特征(帧跳因子为2)和5-gram语言模型。
实验结果
研究问题
- RQ1与随机初始化相比,迁移学习在降低低资源RNN-T模型词错误率(WER)方面的有效性如何?
- RQ2直接初始化与两阶段微调哪种TL策略能带来更低的WER和更快的训练收敛?
- RQ3当训练数据量减少时,尤其是50至1000小时范围内,迁移学习的性能如何变化?
- RQ4为何en-US编码器(CE)初始化优于en-US RNN-T联合模型初始化,尽管后者经过联合训练?
- RQ5使用预训练模型的迁移学习能否弥合端到端与混合ASR系统在低资源语言上的性能差距?
主要发现
- 采用音素目标的两阶段迁移学习方法在相对随机初始化下实现了最高的WER降低(17.4%),优于所有其他方法。
- 在仅50小时训练数据下,en-US CE初始化相比随机初始化将WER降低了42.7%,展现出强大的数据效率。
- 与随机初始化相比,迁移学习方法的训练损失收敛显著更快——尤其是两阶段TL方法,其首个训练周期的损失已明显更低。
- 两阶段TL方法的收敛速度优于en-US CE初始化和随机初始化,表明其模型初始化质量更优。
- 采用迁移学习的最佳RNN-T模型的WER(21.89%)与混合ASR模型(22.32%)相当,表现出具有竞争力的性能。
- 出人意料的是,en-US CE + hi-IN LM初始化的表现劣于仅使用en-US CE初始化,表明不匹配的语言模型适配可能引入负面干扰。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。