Skip to main content
QUICK REVIEW

[论文解读] Distilling the Knowledge of BERT for CTC-based ASR

Hayato Futami, Hirofumi Inaguma|arXiv (Cornell University)|Sep 5, 2022
Speech Recognition and Synthesis被引用 6
一句话总结

本文提出将 BERT 的知识蒸馏到基于 CTC 的自动语音识别(ASR)模型中,通过强制对齐将 BERT 的 token 级预测与 CTC 的 frame 级输出对齐,以保留快速推理能力。该方法在 CSJ 和 TED-LIUM2 上提升了 ASR 准确率,且不增加运行时开销,仅使用标准训练阶段蒸馏即实现了贪婪解码下的最先进性能。

ABSTRACT

Connectionist temporal classification (CTC) -based models are attractive because of their fast inference in automatic speech recognition (ASR). Language model (LM) integration approaches such as shallow fusion and rescoring can improve the recognition accuracy of CTC-based ASR by taking advantage of the knowledge in text corpora. However, they significantly slow down the inference of CTC. In this study, we propose to distill the knowledge of BERT for CTC-based ASR, extending our previous study for attention-based ASR. CTC-based ASR learns the knowledge of BERT during training and does not use BERT during testing, which maintains the fast inference of CTC. Different from attention-based models, CTC-based models make frame-level predictions, so they need to be aligned with token-level predictions of BERT for distillation. We propose to obtain alignments by calculating the most plausible CTC paths. Experimental evaluations on the Corpus of Spontaneous Japanese (CSJ) and TED-LIUM2 show that our method improves the performance of CTC-based ASR without the cost of inference speed.

研究动机与目标

  • 在保留其快速、非自回归推理能力的前提下,将 BERT 的上下文语言知识整合到基于 CTC 的 ASR 模型中。
  • 解决在知识蒸馏过程中将 BERT 的 token 级预测与 CTC 的 frame 级预测对齐的挑战。
  • 通过避免推理时依赖 BERT 或束搜索,保持推理速度。
  • 仅通过标准训练阶段蒸馏,在标准基准上提升 ASR 性能。
  • 证明 BERT 的双向上下文能够超越单向语言模型,在 CTC 模型蒸馏中带来更好的 ASR 性能。

提出的方法

  • 使用 BERT 作为教师模型,为真实转录中的每个词生成 token 级软标签。
  • 使用前向-后向算法或 Viterbi 算法计算最可能的 CTC 路径,以将 BERT 的 token 级预测与 CTC 的 frame 级输出对齐。
  • 通过最小化 BERT 的 token 级概率与 CTC 模型在对应时间帧上的 frame 级预测之间的交叉熵损失,实施知识蒸馏。
  • 端到端训练 CTC 模型,同时使用 CTC 损失和蒸馏损失,使其能够从 BERT 学习上下文表示。
  • 推理时使用贪婪解码,避免束搜索和外部语言模型推理,以保持速度。
  • 利用 BERT 的双向注意力机制捕捉左、右上下文,提升对词级依赖关系的建模能力。

实验结果

研究问题

  • RQ1能否通过从 BERT 进行知识蒸馏,在不损害其快速推理能力的前提下提升基于 CTC 的 ASR 模型性能?
  • RQ2如何有效对齐 BERT 的 token 级预测与基于 CTC 的模型的 frame 级预测?
  • RQ3使用像 BERT 这样的双向语言模型,是否能在 CTC 模型的蒸馏中带来优于单向语言模型的 ASR 性能?
  • RQ4从 BERT 进行蒸馏是否能同时提升基于 CTC 的 ASR 模型的 WER 和困惑度(PPL)?
  • RQ5当与传统的语言模型集成技术(如重排序或浅层融合)结合时,该方法是否仍能保持快速推理?

主要发现

  • 在 CSJ 语料上,该方法将 WER 从基线 CTC 的 9.34% 降低至 9.05%,且推理时间未增加。
  • 在 TED-LIUM2 上,该方法将 WER 从 12.13% 降低至 11.40%,表明在多样化数据集上具有稳定的性能提升。
  • 该方法将 BERT 的困惑度(PPL)从 5.53 降低至 4.92,表明语言建模对齐性得到改善。
  • 即使使用贪婪解码,该方法在 WER 上仍优于 n-best 重排序和浅层融合,且推理速度与基线 CTC 保持一致。
  • 将该蒸馏方法与重排序或浅层融合结合,可进一步降低 WER,在 TED-LIUM2 上达到 8.20%(n=50),接近最优性能。
  • 可视化结果显示,蒸馏后 frame 级预测变得更加语义合理(例如 'ed'、'selves'、'kids'),表明上下文建模能力得到提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。