Skip to main content
QUICK REVIEW

[论文解读] Intermediate Loss Regularization for CTC-based Speech Recognition

Jaesong Lee, Shinji Watanabe|arXiv (Cornell University)|Feb 5, 2021
Speech Recognition and Synthesis参考文献 39被引用 7
一句话总结

本文提出中间 CTC 损失,这是一种简单的辅助训练目标,将 CTC 损失应用于基于 CTC 的 ASR 编码器的中间层,以极低的计算开销提升模型泛化能力。该方法仅使用贪婪解码且无需外部语言模型或束搜索,即在 WSJ 上实现 9.9% 的 WER,在 AISHELL-1 上实现 5.2% 的 CER,达到仅使用 CTC 的最先进性能。

ABSTRACT

We present a simple and efficient auxiliary loss function for automatic speech recognition (ASR) based on the connectionist temporal classification (CTC) objective. The proposed objective, an intermediate CTC loss, is attached to an intermediate layer in the CTC encoder network. This intermediate CTC loss well regularizes CTC training and improves the performance requiring only small modification of the code and small and no overhead during training and inference, respectively. In addition, we propose to combine this intermediate CTC loss with stochastic depth training, and apply this combination to a recently proposed Conformer network. We evaluate the proposed method on various corpora, reaching word error rate (WER) 9.9% on the WSJ corpus and character error rate (CER) 5.2% on the AISHELL-1 corpus respectively, based on CTC greedy search without a language model. Especially, the AISHELL-1 task is comparable to other state-of-the-art ASR systems based on auto-regressive decoder with beam search.

研究动机与目标

  • 在不依赖自回归解码器或外部语言模型的前提下,提升基于连接时序分类(CTC)的端到端自动语音识别(ASR)模型性能。
  • 通过一种轻量级正则化技术,解决 CTC 的局限性,如强条件独立性假设以及与注意力机制模型相比性能欠佳的问题。
  • 设计一种训练目标,增强编码器深层的特征学习能力,同时保持推理效率。
  • 探索中间 CTC 损失与其他正则化技术(如随机深度)之间的协同效应,以进一步提升模型鲁棒性与准确性。

提出的方法

  • 引入一种辅助损失函数——中间 CTC 损失,其计算基于编码器中间层的输出,而非最终层。
  • 使用标准 CTC 损失与中间 CTC 损失的加权组合进行模型训练,其中超参数用于平衡两项目标。
  • 将中间 CTC 损失应用于 Transformer 和 Conformer 架构,这两种架构结合自注意力与卷积层,以提升建模能力。
  • 将中间 CTC 损失与随机深度正则化相结合,训练过程中随机丢弃残差块,以增强泛化能力。
  • 推理时使用贪婪解码,确保与标准 CTC 相比无额外计算开销。
  • 在多个基准测试集上评估该方法,包括 WSJ、AISHELL-1 和 TED-LIUM2,且采用一致的训练与解码协议。

实验结果

研究问题

  • RQ1在编码器的中间层应用 CTC 损失是否能在不增加推理成本的前提下提升基于 CTC 的 ASR 模型性能?
  • RQ2与其它辅助训练策略相比,中间 CTC 损失在性能提升与训练效率方面表现如何?
  • RQ3将中间 CTC 损失与随机深度结合是否能进一步提升 ASR 准确率?
  • RQ4中间 CTC 损失是否能增强非自回归 ASR 方法(如 Mask CTC)的性能,后者依赖 CTC 进行初始预测?
  • RQ5在无需束搜索或语言模型的情况下,仅使用 CTC 的模型在多大程度上可实现最先进性能?

主要发现

  • 中间 CTC 损失在多种架构(包括 Transformer 和 Conformer)上均提升了 ASR 性能,在 WSJ、AISHELL-1 和 TED-LIUM2 上均表现出一致的性能增益。
  • 在 WSJ 语料上,该方法仅使用 CTC 和贪婪解码即实现了 9.9% 的词错误率(WER),优于以往的非自回归 CTC 基模型,接近自回归模型的最先进结果。
  • 在 AISHELL-1 语料上,该方法实现了 5.2% 的字符错误率(CER),超过基于 Transformer 的编码器-解码器模型,并接近自回归模型的最先进结果 5.1%。
  • 中间 CTC 损失与随机深度的结合取得了最佳性能,表明二者具有互补的正则化效果。
  • 中间 CTC 损失还提升了基于 Mask CTC 的非自回归 ASR 性能,将 WSJ 上的 WER 从 13.5% 降低至 11.6%,显示出更广泛的应用潜力。
  • 消融实验表明,采用默认中间层(如网络中间位置)的设置表现最佳,优于随机选择或低层变体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。