Skip to main content
QUICK REVIEW

[论文解读] Distilling the Knowledge of BERT for Sequence-to-Sequence ASR

Hayato Futami, Hirofumi Inaguma|arXiv (Cornell University)|Aug 9, 2020
Speech Recognition and Synthesis参考文献 34被引用 4
一句话总结

本文通过知识蒸馏,将 BERT 中的双向上下文知识蒸馏到序列到序列的自动语音识别(ASR)模型中,训练过程中同时利用左、右上下文——包括跨话语上下文——显著提升了 ASR 性能,优于单向语言模型及现有的语言模型集成技术(如 n-best 重排序和浅层融合),在 CSJ 数据集上实现了 9.19% 的词错误率(WER),且无需额外推理开销。

ABSTRACT

Attention-based sequence-to-sequence (seq2seq) models have achieved promising results in automatic speech recognition (ASR). However, as these models decode in a left-to-right way, they do not have access to context on the right. We leverage both left and right context by applying BERT as an external language model to seq2seq ASR through knowledge distillation. In our proposed method, BERT generates soft labels to guide the training of seq2seq ASR. Furthermore, we leverage context beyond the current utterance as input to BERT. Experimental evaluations show that our method significantly improves the ASR performance from the seq2seq baseline on the Corpus of Spontaneous Japanese (CSJ). Knowledge distillation from BERT outperforms that from a transformer LM that only looks at left context. We also show the effectiveness of leveraging context beyond the current utterance. Our method outperforms other LM application approaches such as n-best rescoring and shallow fusion, while it does not require extra inference cost.

研究动机与目标

  • 为解决序列到序列 ASR 模型在解码过程中存在的从左到右限制,该模型在训练和推理时均无法访问未来(右)上下文。
  • 通过知识蒸馏,将深度双向语言模型 BERT 的上下文知识迁移至序列到序列 ASR 模型,以提升 ASR 性能。
  • 探究在 BERT 基础的软标签生成过程中,使用当前话语之外的上下文(如前一和后一话语)的有效性。
  • 将所提方法与传统的语言模型集成技术(如 n-best 重排序和浅层融合)进行比较,尤其关注性能和推理效率方面的差异。

提出的方法

  • 使用 BERT 作为教师模型,在训练期间为 ASR 学生模型生成软标签,利用当前话语的左、右上下文。
  • 通过将前一、当前和后一话语拼接,扩展上下文范围,直至达到固定的 token 长度后输入 BERT。
  • 通过最小化 BERT 输出概率与 ASR 模型预测之间的软标签交叉熵损失实现知识蒸馏,引入温度缩放和蒸馏权重超参数。
  • ASR 模型通过蒸馏损失端到端训练,而 BERT 冻结,仅在训练期间提供软监督。
  • 该方法在推理阶段无需语言模型,消除了额外的解码开销。
  • 温度和蒸馏权重等超参数在开发集上进行调优。

实验结果

研究问题

  • RQ1与单向语言模型相比,从 BERT 进行知识蒸馏是否能提升序列到序列 ASR 的性能?
  • RQ2在 BERT 输入中引入右文和跨话语上下文是否能带来优于仅使用话语内上下文的 ASR 性能提升?
  • RQ3与传统的语言模型集成技术(如 n-best 重排序和浅层融合)相比,所提蒸馏方法在准确率和推理成本方面表现如何?
  • RQ4当训练数据增加时,BERT 蒸馏带来的性能增益是否依然存在?

主要发现

  • 从 BERT 进行知识蒸馏后,CSJ-APS(240 小时)数据集上的词错误率(WER)降低至 9.19%,相比基线序列到序列 ASR 模型相对提升了 10.86%。
  • 基于 BERT 的蒸馏优于从单向 Transformer 语言模型(TrfLM(uni))蒸馏,后者 WER 为 9.89%,证明了双向上下文的优势。
  • 使用跨话语上下文(上下文长度 256)的性能优于仅使用话语内上下文(utterance),WER 从 9.53% 降低至 9.19%。
  • 该方法在所有束宽(beam width)下均优于 n-best 重排序和浅层融合,即使应用于基线模型,也表明蒸馏已捕获了语言模型的大部分优势。
  • 在 520 小时数据(CSJ-APS + CSJ-SPS)上训练时,该方法仍达到 7.85% 的 WER,相比改进后的基线相对提升了 7.5%,证实其在更大数据规模下的有效性。
  • 消融实验表明,将 BERT 在更长上下文(256 个 token)上进行预训练,并在蒸馏过程中使用相同长度的上下文,可获得最佳性能,WER 为 9.19%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。