[论文解读] Improved Mask-CTC for Non-Autoregressive End-to-End ASR
该论文通过引入Conformer编码器并采用辅助训练与解码策略实现动态长度预测,改进了非自回归端到端自动语音识别中的Mask-CTC,以纠正CTC输出中的插入和删除错误。增强后的模型在WSJ eval92上达到9.1%的WER,超越标准CTC并匹配自回归模型性能,同时在CPU上保持亚0.1 RTF的推理速度。
For real-world deployment of automatic speech recognition (ASR), the system is desired to be capable of fast inference while relieving the requirement of computational resources. The recently proposed end-to-end ASR system based on mask-predict with connectionist temporal classification (CTC), Mask-CTC, fulfills this demand by generating tokens in a non-autoregressive fashion. While Mask-CTC achieves remarkably fast inference speed, its recognition performance falls behind that of conventional autoregressive (AR) systems. To boost the performance of Mask-CTC, we first propose to enhance the encoder network architecture by employing a recently proposed architecture called Conformer. Next, we propose new training and decoding methods by introducing auxiliary objective to predict the length of a partial target sequence, which allows the model to delete or insert tokens during inference. Experimental results on different ASR tasks show that the proposed approaches improve Mask-CTC significantly, outperforming a standard CTC model (15.5% $ ightarrow$ 9.1% WER on WSJ). Moreover, Mask-CTC now achieves competitive results to AR models with no degradation of inference speed ($
研究动机与目标
- 解决非自回归(NAR)与自回归(AR)端到端ASR模型之间的性能差距,特别是在计算资源有限的实际部署场景中。
- 克服Mask-CTC的局限性,其性能受限于CTC输出的质量与固定长度,导致标记生成中持续存在错误。
- 在不牺牲NAR模型并行推理速度的前提下,实现在推理过程中对插入和删除错误的动态纠正。
- 探索改进后的Mask-CTC框架在端到端语音翻译(E2E-ST)任务中的适用性,拓展其在ASR之外的应用范围。
提出的方法
- 用Conformer架构替换Mask-CTC中的标准Transformer编码器,以提升声学表征学习能力并增强初始CTC性能。
- 引入一种新的辅助训练目标,用于在解码过程中预测部分目标序列的长度,使模型能够动态插入或删除标记。
- 设计一种解码策略,利用预测长度引导掩码预测的优化,实现对CTC生成序列中错误的迭代修正。
- 对CTC输出应用置信度过滤和受限掩码预测(MP)解码,以初始化目标序列,提升语音翻译任务中的稳定性和性能。
- 在E2E-ST任务中对NAR模型采用序列级知识蒸馏,以提升生成质量而不增加推理复杂度。
- 实现一种受限掩码预测机制,限制每轮迭代中被掩码的标记数量,以在迭代过程中保留来自CTC输出的信息。
实验结果
研究问题
- RQ1在不降低其快速推理速度的前提下,Mask-CTC的性能能否得到显著提升?
- RQ2Conformer编码器在多大程度上能提升CTC输出质量,从而改善整体Mask-CTC性能?
- RQ3在推理过程中进行动态长度预测,能否有效纠正CTC生成序列中的插入和删除错误?
- RQ4改进后的Mask-CTC框架是否能泛化到其他序列到序列任务,如端到端语音翻译?
- RQ5将动态长度预测应用于Mask-CTC时,推理速度与准确率之间的权衡如何?
主要发现
- 采用Conformer与动态长度预测(DLP)的改进Mask-CTC在WSJ eval92上达到9.1%的WER,优于标准CTC(15.5%),并匹配最先进自回归模型的性能。
- 该模型在CPU上保持了亚0.1 RTF的推理速度,证实改进并未损害非自回归模型的核心优势——极快的推理速度。
- 在Voxforge和TEDLIUM2数据集上,改进后的Mask-CTC性能与自回归模型相当,表明其在多样化ASR数据集上的良好泛化能力。
- DLP方法在WSJ上尤为有效,成功纠正了CTC输出中的错误,但在TEDLIUM2上增益有限,可能是因为基于Conformer的CTC模型本身已具备较高准确率。
- 在Fisher-CallHome西班牙语的端到端语音翻译任务中,改进后的Mask-CTC优于自回归基线模型,在开发集上达到49.94 BLEU,测试集上达到48.66 BLEU,表明其在多语言翻译任务中具有强大泛化能力。
- 受限掩码预测解码策略通过在迭代过程中保留CTC衍生信息,显著提升了语音翻译性能,凸显其在非单调对齐任务中的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。