[论文解读] Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition
Citrinet 是一个深度的一维时通道可分离卷积的 CT CASR 模型,结合挤压-激励(SE),在没有外部语言模型的情况下缩小了非自回归 CTC 模型与自回归 Seq2Seq/RNN-T 模型之间的性能差距。
We propose Citrinet - a new end-to-end convolutional Connectionist Temporal Classification (CTC) based automatic speech recognition (ASR) model. Citrinet is deep residual neural model which uses 1D time-channel separable convolutions combined with sub-word encoding and squeeze-and-excitation. The resulting architecture significantly reduces the gap between non-autoregressive and sequence-to-sequence and transducer models. We evaluate Citrinet on LibriSpeech, TED-LIUM2, AISHELL-1 and Multilingual LibriSpeech (MLS) English speech datasets. Citrinet accuracy on these datasets is close to the best autoregressive Transducer models.
研究动机与目标
- 推动在端到端语音识别中缩小非自回归 CTC 模型与自回归 Seq2Seq/RNN-T 模型之间的性能差距。
- 提出 Citrinet,一种通过深度卷积 CTC 模型并增强以一维时-通道可分离卷积和挤压-激励模块。
- 在多个标准语音识别数据集上评估 Citrinet,并与领先的自回归模型以及常温基线进行比较。
提出的方法
- 将 Citrinet 作为一个深度残差 CTC 模型引入,带前奏/后缀块和三个巨型块的残差 QuartzNet 风格块。
- 使用一维时-通道可分离卷积,核布局为 (K4),并结合挤压-激励上下文模块以捕获全局信息。
- 采用子词单元(词片)进行标记化策略,评估阶段可选外部语言模型重分数。
- 使用 SpecAugment、NovoGrad 优化器、余弦学习率调度,以及标准声学前端(80 维对数梅尔特征)。
- 通过改变宽度(C)、深度(R)、核布局和标记化尺寸来评估变体对 WER/CER 的影响。
实验结果
研究问题
- RQ1在没有外部语言模型的情况下,非自回归 CTC 模型在标准语音识别基准上能达到多接近自回归 Seq2Seq/RNN-T 模型的水平?
- RQ2Citrinet 的哪些结构选择(核布局、SE 上下文、宽度、深度、标记化)对语音识别精度影响最大?
- RQ3Citrinet 是否能在 LibriSpeech、MLS、TED-LIUM 2 和 AISHELL-1 上实现接近状态级别的性能?
- RQ4SE 模块中的上下文窗口大小对识别精度有何影响?
- RQ5英语 MLS 的预训练如何迁移到其他数据集(TED-LIUM 2、AISHELL-1),并影响微调结果?
主要发现
- Citrinet-1024 在 LibriSpeech test-other 上无外部语言模型时达到 WER 6.22%,并与带 LM 重分数的最先进自回归模型的差距缩小。
- Citrinet 的变体(如 Citrinet-1024)在多个人数数据集上在无语言模型时就接近 Transducer 模型的性能(如 MLS English 与 TED-LIUM 2 的结果)。
- SE 上下文显著提升了准确性,更大的 SE 上下文窗口与更低的 WER/CER 在所测试的设置中相关。
- 核宽度消融实验显示存在最佳范围;核过窄或过宽都会降低性能,在它们的设置中 0.75–1.0 的缩放比带来最佳结果。
- 增大模型宽度(C)和深度(R)通常提升性能,但代价是更多参数,在达到某些配置后收益递减。
- 分词器词汇表大小会影响准确性,极大词汇表会降低性能,而非常小的词汇表会因为 CT 损失约束而降低可训练性。
- 该模型从跨数据集预训练(MLS English)及在领域特定数据(TED-LIUM 2、AISHELL-1)上微调中受益,达到与基线相当甚至优于的 CER/WER。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。