Skip to main content
QUICK REVIEW

[论文解读] Improved Mask-CTC for Non-Autoregressive End-to-End ASR

Yosuke Higuchi, Hirofumi Inaguma|arXiv (Cornell University)|Oct 26, 2020
Speech Recognition and Synthesis参考文献 45被引用 6
一句话总结

该论文通过引入Conformer编码器并采用辅助训练与解码策略实现动态长度预测,改进了非自回归端到端自动语音识别中的Mask-CTC,以纠正CTC输出中的插入和删除错误。增强后的模型在WSJ eval92上达到9.1%的WER,超越标准CTC并匹配自回归模型性能,同时在CPU上保持亚0.1 RTF的推理速度。

ABSTRACT

For real-world deployment of automatic speech recognition (ASR), the system is desired to be capable of fast inference while relieving the requirement of computational resources. The recently proposed end-to-end ASR system based on mask-predict with connectionist temporal classification (CTC), Mask-CTC, fulfills this demand by generating tokens in a non-autoregressive fashion. While Mask-CTC achieves remarkably fast inference speed, its recognition performance falls behind that of conventional autoregressive (AR) systems. To boost the performance of Mask-CTC, we first propose to enhance the encoder network architecture by employing a recently proposed architecture called Conformer. Next, we propose new training and decoding methods by introducing auxiliary objective to predict the length of a partial target sequence, which allows the model to delete or insert tokens during inference. Experimental results on different ASR tasks show that the proposed approaches improve Mask-CTC significantly, outperforming a standard CTC model (15.5% $ ightarrow$ 9.1% WER on WSJ). Moreover, Mask-CTC now achieves competitive results to AR models with no degradation of inference speed ($

研究动机与目标

  • 解决非自回归(NAR)与自回归(AR)端到端ASR模型之间的性能差距,特别是在计算资源有限的实际部署场景中。
  • 克服Mask-CTC的局限性,其性能受限于CTC输出的质量与固定长度,导致标记生成中持续存在错误。
  • 在不牺牲NAR模型并行推理速度的前提下,实现在推理过程中对插入和删除错误的动态纠正。
  • 探索改进后的Mask-CTC框架在端到端语音翻译(E2E-ST)任务中的适用性,拓展其在ASR之外的应用范围。

提出的方法

  • 用Conformer架构替换Mask-CTC中的标准Transformer编码器,以提升声学表征学习能力并增强初始CTC性能。
  • 引入一种新的辅助训练目标,用于在解码过程中预测部分目标序列的长度,使模型能够动态插入或删除标记。
  • 设计一种解码策略,利用预测长度引导掩码预测的优化,实现对CTC生成序列中错误的迭代修正。
  • 对CTC输出应用置信度过滤和受限掩码预测(MP)解码,以初始化目标序列,提升语音翻译任务中的稳定性和性能。
  • 在E2E-ST任务中对NAR模型采用序列级知识蒸馏,以提升生成质量而不增加推理复杂度。
  • 实现一种受限掩码预测机制,限制每轮迭代中被掩码的标记数量,以在迭代过程中保留来自CTC输出的信息。

实验结果

研究问题

  • RQ1在不降低其快速推理速度的前提下,Mask-CTC的性能能否得到显著提升?
  • RQ2Conformer编码器在多大程度上能提升CTC输出质量,从而改善整体Mask-CTC性能?
  • RQ3在推理过程中进行动态长度预测,能否有效纠正CTC生成序列中的插入和删除错误?
  • RQ4改进后的Mask-CTC框架是否能泛化到其他序列到序列任务,如端到端语音翻译?
  • RQ5将动态长度预测应用于Mask-CTC时,推理速度与准确率之间的权衡如何?

主要发现

  • 采用Conformer与动态长度预测(DLP)的改进Mask-CTC在WSJ eval92上达到9.1%的WER,优于标准CTC(15.5%),并匹配最先进自回归模型的性能。
  • 该模型在CPU上保持了亚0.1 RTF的推理速度,证实改进并未损害非自回归模型的核心优势——极快的推理速度。
  • 在Voxforge和TEDLIUM2数据集上,改进后的Mask-CTC性能与自回归模型相当,表明其在多样化ASR数据集上的良好泛化能力。
  • DLP方法在WSJ上尤为有效,成功纠正了CTC输出中的错误,但在TEDLIUM2上增益有限,可能是因为基于Conformer的CTC模型本身已具备较高准确率。
  • 在Fisher-CallHome西班牙语的端到端语音翻译任务中,改进后的Mask-CTC优于自回归基线模型,在开发集上达到49.94 BLEU,测试集上达到48.66 BLEU,表明其在多语言翻译任务中具有强大泛化能力。
  • 受限掩码预测解码策略通过在迭代过程中保留CTC衍生信息,显著提升了语音翻译性能,凸显其在非单调对齐任务中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。