Skip to main content
QUICK REVIEW

[论文解读] Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition

Somshubra Majumdar, Jagadeesh Balam|arXiv (Cornell University)|Apr 5, 2021
Speech Recognition and Synthesis参考文献 29被引用 43
一句话总结

Citrinet 是一个深度的一维时通道可分离卷积的 CT CASR 模型,结合挤压-激励(SE),在没有外部语言模型的情况下缩小了非自回归 CTC 模型与自回归 Seq2Seq/RNN-T 模型之间的性能差距。

ABSTRACT

We propose Citrinet - a new end-to-end convolutional Connectionist Temporal Classification (CTC) based automatic speech recognition (ASR) model. Citrinet is deep residual neural model which uses 1D time-channel separable convolutions combined with sub-word encoding and squeeze-and-excitation. The resulting architecture significantly reduces the gap between non-autoregressive and sequence-to-sequence and transducer models. We evaluate Citrinet on LibriSpeech, TED-LIUM2, AISHELL-1 and Multilingual LibriSpeech (MLS) English speech datasets. Citrinet accuracy on these datasets is close to the best autoregressive Transducer models.

研究动机与目标

  • 推动在端到端语音识别中缩小非自回归 CTC 模型与自回归 Seq2Seq/RNN-T 模型之间的性能差距。
  • 提出 Citrinet,一种通过深度卷积 CTC 模型并增强以一维时-通道可分离卷积和挤压-激励模块。
  • 在多个标准语音识别数据集上评估 Citrinet,并与领先的自回归模型以及常温基线进行比较。

提出的方法

  • 将 Citrinet 作为一个深度残差 CTC 模型引入,带前奏/后缀块和三个巨型块的残差 QuartzNet 风格块。
  • 使用一维时-通道可分离卷积,核布局为 (K4),并结合挤压-激励上下文模块以捕获全局信息。
  • 采用子词单元(词片)进行标记化策略,评估阶段可选外部语言模型重分数。
  • 使用 SpecAugment、NovoGrad 优化器、余弦学习率调度,以及标准声学前端(80 维对数梅尔特征)。
  • 通过改变宽度(C)、深度(R)、核布局和标记化尺寸来评估变体对 WER/CER 的影响。

实验结果

研究问题

  • RQ1在没有外部语言模型的情况下,非自回归 CTC 模型在标准语音识别基准上能达到多接近自回归 Seq2Seq/RNN-T 模型的水平?
  • RQ2Citrinet 的哪些结构选择(核布局、SE 上下文、宽度、深度、标记化)对语音识别精度影响最大?
  • RQ3Citrinet 是否能在 LibriSpeech、MLS、TED-LIUM 2 和 AISHELL-1 上实现接近状态级别的性能?
  • RQ4SE 模块中的上下文窗口大小对识别精度有何影响?
  • RQ5英语 MLS 的预训练如何迁移到其他数据集(TED-LIUM 2、AISHELL-1),并影响微调结果?

主要发现

  • Citrinet-1024 在 LibriSpeech test-other 上无外部语言模型时达到 WER 6.22%,并与带 LM 重分数的最先进自回归模型的差距缩小。
  • Citrinet 的变体(如 Citrinet-1024)在多个人数数据集上在无语言模型时就接近 Transducer 模型的性能(如 MLS English 与 TED-LIUM 2 的结果)。
  • SE 上下文显著提升了准确性,更大的 SE 上下文窗口与更低的 WER/CER 在所测试的设置中相关。
  • 核宽度消融实验显示存在最佳范围;核过窄或过宽都会降低性能,在它们的设置中 0.75–1.0 的缩放比带来最佳结果。
  • 增大模型宽度(C)和深度(R)通常提升性能,但代价是更多参数,在达到某些配置后收益递减。
  • 分词器词汇表大小会影响准确性,极大词汇表会降低性能,而非常小的词汇表会因为 CT 损失约束而降低可训练性。
  • 该模型从跨数据集预训练(MLS English)及在领域特定数据(TED-LIUM 2、AISHELL-1)上微调中受益,达到与基线相当甚至优于的 CER/WER。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。