Skip to main content
QUICK REVIEW

[论文解读] Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input

Xingchen Song, Zhiyong Wu|arXiv (Cornell University)|Oct 28, 2020
Speech Recognition and Synthesis参考文献 18被引用 4
一句话总结

该论文提出了一种非自回归(NAR)Transformer自动语音识别(ASR)模型,通过使用贪婪CTC预测结果增强解码器输入,在保持比自回归基线模型快50倍推理速度的同时提升了准确率。与使用掩码或复制编码器状态的方法不同,该模型通过优化CTC输出而非直接复制,实现了在Aishell-1和Aishell-2数据集上的SOTA NAR性能,与强自回归模型相比,绝对词错误率(CER)仅下降0.0%–0.3%。

ABSTRACT

Non-autoregressive (NAR) transformer models have achieved significantly inference speedup but at the cost of inferior accuracy compared to autoregressive (AR) models in automatic speech recognition (ASR). Most of the NAR transformers take a fixed-length sequence filled with MASK tokens or a redundant sequence copied from encoder states as decoder input, they cannot provide efficient target-side information thus leading to accuracy degradation. To address this problem, we propose a CTC-enhanced NAR transformer, which generates target sequence by refining predictions of the CTC module. Experimental results show that our method outperforms all previous NAR counterparts and achieves 50x faster decoding speed than a strong AR baseline with only 0.0 ~ 0.3 absolute CER degradation on Aishell-1 and Aishell-2 datasets.

研究动机与目标

  • 解决非自回归(NAR)Transformer ASR模型中因解码器输入中目标侧上下文弱或间接导致的准确率下降问题。
  • 通过向解码器提供更强、更相关的目标侧信息,提升NAR解码性能。
  • 在保持高推理速度的同时,缩小NAR与自回归(AR)模型在ASR准确率上的差距。
  • 评估CTC预测输出作为直接、信息丰富的输入在NAR解码器优化中的有效性。

提出的方法

  • 模型使用贪婪CTC预测结果作为主要解码器输入,替代固定长度的MASK序列或复制的编码器状态。
  • 解码器在单次前向传播中对CTC预测结果进行优化,同时利用语音上下文和部分目标侧上下文。
  • 该方法避免了MP-CTC中使用的掩码机制,而是直接利用CTC输出来引导NAR解码器。
  • CTC模块提供长度监督和初始目标序列估计,NAR解码器随后对这些估计进行修正。
  • 解码器基于CTC预测结果和编码后的语音特征进行条件化,实现语音表示与目标序列建模的联合优化。
  • 该方法采用联合CTC损失与注意力损失进行训练,确保CTC输出与最终预测结果之间的一致性。

实验结果

研究问题

  • RQ1将CTC预测结果作为解码器输入,能否提升非自回归Transformer ASR模型的准确率?
  • RQ2通过CTC输出直接提供目标侧上下文,能否缩小NAR与AR ASR模型之间的性能差距?
  • RQ3CTC增强的NAR解码器能否在保持大规模数据集上竞争力准确率的同时实现更快的推理速度?
  • RQ4与现有NAR方法(如ST-NAR和MP-CTC)相比,该方法在速度与准确率方面表现如何?

主要发现

  • 所提出的NAR Transformer在Aishell-1开发集上达到5.6%的CER,在测试集上达到6.3%,优于所有先前的NAR模型。
  • 在Aishell-2上,模型在iOS上达到7.1%的CER,在麦克风(Mic)上为8.0%,在Android上为8.1%,在该大规模语料库上超越了所有先前的NAR方法。
  • 模型实现比强自回归基线快50倍的解码速度,且仅造成0.0%–0.3%的绝对CER下降。
  • CTC增强的解码器输入通过提供有意义的目标侧上下文,降低了NAR任务的难度,提升了泛化能力与对齐效果。
  • 该模型在Aishell-1和Aishell-2上均达到了NAR模型的SOTA性能,证明了其在工业级大规模语音识别任务中的有效性。
  • 该方法在推理速度上甚至优于强自回归基线,同时保持了相近的准确率,因此在实时应用中极具潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。