[论文解读] Learn Spelling from Teachers: Transferring Knowledge from Language Models to Sequence-to-Sequence Speech Recognition
本文提出了一种名为 '从教师学习拼写'(LST)的知识蒸馏方法,通过在训练过程中使用软标签,将外部RNN语言模型(教师)的知识迁移至序列到序列(Seq2Seq)语音识别模型(学生)。该方法在推理时无需添加外部组件,相对于原始Seq2Seq模型,字符错误率(CER)相对降低了18.42%,在AISHELL-1数据集上达到9.3%的CER,结合浅层融合后达到8.3%。
Integrating an external language model into a sequence-to-sequence speech recognition system is non-trivial. Previous works utilize linear interpolation or a fusion network to integrate external language models. However, these approaches introduce external components, and increase decoding computation. In this paper, we instead propose a knowledge distillation based training approach to integrating external language models into a sequence-to-sequence model. A recurrent neural network language model, which is trained on large scale external text, generates soft labels to guide the sequence-to-sequence model training. Thus, the language model plays the role of the teacher. This approach does not add any external component to the sequence-to-sequence model during testing. And this approach is flexible to be combined with shallow fusion technique together for decoding. The experiments are conducted on public Chinese datasets AISHELL-1 and CLMAD. Our approach achieves a character error rate of 9.3%, which is relatively reduced by 18.42% compared with the vanilla sequence-to-sequence model.
研究动机与目标
- 为解决在端到端序列到序列语音识别系统中集成外部语言模型而不增加推理复杂度的挑战。
- 通过基于数据驱动和正则化的蒸馏方法,利用大规模外部文本数据提升自动语音识别性能。
- 在训练期间实现外部语言模型的无缝集成,同时在测试时完全移除它们,保持模型简洁。
- 证明从预训练RNNLM蒸馏知识可优于传统的正则化技术(如标签平滑和单频平滑)。
- 展示LST可与浅层融合有效结合,进一步提升识别准确率。
提出的方法
- 使用预训练的RNN语言模型作为“教师”,为训练转录生成软标签。
- 使用这些软标签通过交叉熵损失训练Seq2Seq模型(学生),软标签中编码了来自外部文本的丰富语言先验知识。
- 蒸馏过程不修改模型结构,也不在推理时引入新参数。
- 对教师的softmax输出应用温度缩放技术,以生成更平滑、更具信息量的软标签。
- 该方法与浅层融合兼容,允许在解码过程中联合使用外部语言模型。
- 通过在开发集上调整超参数(如温度和插值权重)以优化性能。
实验结果
研究问题
- RQ1知识蒸馏能否在不修改模型结构的前提下,有效将外部语言模型的语言知识迁移至序列到序列ASR模型?
- RQ2使用预训练RNNLM生成的软标签作为监督信号,是否能相比标准训练和正则化方法,进一步降低字符错误率?
- RQ3所提出的LST方法能否与浅层融合结合,进一步提升ASR性能?
- RQ4在CER降低方面,LST与标签平滑和单频平滑相比表现如何?
- RQ5蒸馏过程是否通过训练和验证损失的变化表现出更好的泛化能力?
主要发现
- 所提出的LST方法相对于原始Seq2Seq模型,将字符错误率(CER)相对降低了18.42%,在AISHELL-1数据集上达到9.3%的CER。
- 在不使用浅层融合的情况下,LST优于标签平滑(相对CER降低4.4%)和单频平滑(CER为10.0%)。
- 当与浅层融合结合时,基于LST的模型在测试集上达到最佳性能,CER为8.3%。
- LST模型的训练损失高于验证损失,表明其具有正则化效应,有助于提升泛化能力。
- 损失曲线显示,LST模型的验证损失略低于基线Seq2Seq模型,证实了其泛化能力的提升。
- 通过在开发集上进行超参数调优,发现软标签生成的最佳温度为5.0,浅层融合的最佳插值权重为0.9。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。