[论文解读] Improved training for online end-to-end speech recognition systems
本文提出一种教师-学生蒸馏方法,用于在不依赖发音词典或绑定三音素系统的情况下,初始化在线端到端语音识别模型。通过最小化KL散度,将大型预训练离线BLSTM模型的知识迁移至单向LSTM模型,并结合课程学习与标签平滑技术,该方法实现了19%的相对WER降低——几乎完全弥合了与绑定三音素初始化模型之间的性能差距。
Achieving high accuracy with end-to-end speech recognizers requires careful parameter initialization prior to training. Otherwise, the networks may fail to find a good local optimum. This is particularly true for online networks, such as unidirectional LSTMs. Currently, the best strategy to train such systems is to bootstrap the training from a tied-triphone system. However, this is time consuming, and more importantly, is impossible for languages without a high-quality pronunciation lexicon. In this work, we propose an initialization strategy that uses teacher-student learning to transfer knowledge from a large, well-trained, offline end-to-end speech recognition model to an online end-to-end model, eliminating the need for a lexicon or any other linguistic resources. We also explore curriculum learning and label smoothing and show how they can be combined with the proposed teacher-student learning for further improvements. We evaluate our methods on a Microsoft Cortana personal assistant task and show that the proposed method results in a 19 % relative improvement in word error rate compared to a randomly-initialized baseline system.
研究动机与目标
- 解决从随机初始化训练的在线端到端语音识别模型性能较差的挑战。
- 消除对发音词典、绑定三音素系统或其他传统语音识别组件在模型初始化中的依赖。
- 开发一种完全端到端的训练策略,在简化训练流程的同时保持高精度。
- 证明来自离线模型的知识蒸馏可有效启动在线模型,即使在低资源语言环境下亦然。
提出的方法
- 通过最小化输出分布之间的KL散度,利用知识蒸馏将预训练离线BLSTM模型的标签分布知识迁移至在线单向LSTM模型。
- 采用课程学习策略,初期在较短语音片段上进行训练,以稳定早期学习并改善收敛性。
- 通过均匀分布正则化实施标签平滑,防止输出概率出现过度自信。
- 将教师-学生蒸馏与标签平滑和课程学习相结合,进一步提升模型的泛化能力与鲁棒性。
- 使用CTC损失训练在线模型,结合蒸馏知识与正则化输出,完全避免对音素或语言学标注的依赖。
- 采用两阶段训练流程:首先通过知识蒸馏预训练学生模型,随后使用CTC损失与标签平滑进行微调。
实验结果
研究问题
- RQ1能否从一个大型离线BLSTM模型中通过知识蒸馏,有效初始化一个在线单向LSTM模型,实现端到端语音识别,且无需语言学资源?
- RQ2将教师-学生学习与课程学习及标签平滑相结合,对在线端到端模型的词错误率(WER)有何影响?
- RQ3完全端到端的训练流程(无需绑定三音素或词典依赖)在多大程度上可达到传统声学模型初始化系统的性能水平?
- RQ4标签平滑是否能提升在线端到端模型的泛化能力,尤其是在与蒸馏结合时?
- RQ5以短语音片段为重点的课程学习能否增强在线语音识别训练的稳定性与最终模型的准确性?
主要发现
- 所提方法相较于随机初始化的在线LSTM模型,实现了19%的相对WER降低,在Microsoft Cortana任务上达到33.2%的WER。
- 仅使用教师-学生蒸馏即带来12.2%的相对WER改进,标签平滑贡献13.7%,课程学习贡献7.8%。
- 将三种技术——蒸馏、标签平滑与课程学习——结合后,性能最佳,将与绑定三音素初始化模型之间的WER差距从10.2%绝对值降低至仅2.4%。
- 采用教师-学生蒸馏与标签平滑训练的模型,在正确字符预测上表现出更高的置信度,优于随机初始化基线。
- 即使离线BLSTM模型也从标签平滑中受益,达到25.5%的WER,证明正则化在不同架构中均具有效性。
- 该方法成功消除了对发音词典或绑定三音素系统的需求,使其适用于缺乏此类资源的低资源语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。