Skip to main content
QUICK REVIEW

[论文解读] WNARS: WFST based Non-autoregressive Streaming End-to-End Speech Recognition

Zhichao Wang, Wenwen Yang|arXiv (Cornell University)|Apr 8, 2021
Speech Recognition and Synthesis参考文献 29被引用 9
一句话总结

WNARS 提出了一种基于 WFST 的非自回归流式端到端自动语音识别框架,通过将 CTC-注意力模型与 WFST 解码相结合,解决了自回归注意力模型在解码效率、词级语言模型整合以及流式处理兼容性方面的不足。该方法在 AISHELL-1 数据集上实现了 5.22% 的 SOTA 字符错误率(CER),延迟仅为 640ms,相较于先前的流式系统以及一个强大的 10,000 小时工业基线模型,错误率降低超过 20%,且延迟降低 50%。

ABSTRACT

Recently, attention-based encoder-decoder (AED) end-to-end (E2E) models have drawn more and more attention in the field of automatic speech recognition (ASR). AED models, however, still have drawbacks when deploying in commercial applications. Autoregressive beam search decoding makes it inefficient for high-concurrency applications. It is also inconvenient to integrate external word-level language models. The most important thing is that AED models are difficult for streaming recognition due to global attention mechanism. In this paper, we propose a novel framework, namely WNARS, using hybrid CTC-attention AED models and weighted finite-state transducers (WFST) to solve these problems together. We switch from autoregressive beam search to CTC branch decoding, which performs first-pass decoding with WFST in chunk-wise streaming way. The decoder branch then performs second-pass rescoring on the generated hypotheses non-autoregressively. On the AISHELL-1 task, our WNARS achieves a character error rate of 5.22% with 640ms latency, to the best of our knowledge, which is the state-of-the-art performance for online ASR. Further experiments on our 10,000-hour Mandarin task show the proposed method achieves more than 20% improvements with 50% latency compared to a strong TDNN-BLSTM lattice-free MMI baseline.

研究动机与目标

  • 解决基于注意力的端到端自动语音识别模型中自回归束搜索解码的低效问题。
  • 实现词级语言模型在端到端自动语音识别系统中的有效集成,而这是自回归解码难以实现的。
  • 通过将全局注意力转换为分块 CTC 解码,支持流式自动语音识别,实现低延迟推理。
  • 在流式、非自回归设置下,同时提升识别准确率与延迟表现。
  • 展示将 CTC-注意力模型与 WFST 结合在流式、可扩展且适用于生产环境的自动语音识别系统中的有效性。

提出的方法

  • 该框架采用混合 CTC-注意力架构,其中 CTC 分支使用 WFST 实现高效、词级的语言模型集成,进行首次通过的流式解码。
  • 解码分支对 CTC 分支生成的假设进行非自回归的第二次重打分,条件基于完整的编码器输出。
  • 采用多分块推理策略,可配置左、中、右上下文大小(N_l, N_c, N_r),以平衡延迟与性能。
  • 在 CTC 分支中使用 WFST 解码,以在首次通过生成假设时高效应用词级语言模型。
  • 模型采用混合 CTC-注意力损失进行训练,以促进单调对齐并提升训练稳定性。
  • 系统采用基于 Conformer 的编码器与解码器,结合多头自注意力与卷积模块,实现上下文建模。

实验结果

研究问题

  • RQ1非自回归、流式自动语音识别系统是否能在保持低延迟的同时实现 SOTA 准确率?
  • RQ2通过基于 WFST 的解码,词级语言模型在端到端自动语音识别系统中能否被高效集成?
  • RQ3在混合架构中结合 CTC 与注意力机制,是否能实现在不牺牲准确率的前提下高效、低延迟的流式解码?
  • RQ4多分块处理如何影响流式自动语音识别中延迟与识别性能之间的权衡?
  • RQ5所提出的框架是否能在大规模、真实世界场景中超越强大的传统自动语音识别基线?

主要发现

  • WNARS 在 AISHELL-1 测试集上实现了 5.22% 的字符错误率(CER),延迟仅为 640ms,代表了在相同延迟条件下在线自动语音识别的 SOTA 性能。
  • 在 960ms 延迟下,与非流式基线(4.57% CER)相比,CER 仅下降 0.65%,表明对延迟约束具有极强的鲁棒性。
  • 与一个强大的 TDNN-BLSTM LFMMI 基线相比,在 10,000 小时普通话数据集上,WNARS 在延迟降低 50%(960ms vs. 1900ms)的情况下,将 CER 降低了 20.3%(近端话筒设置)与 20.4%(远场设置)。
  • 与字符级语言模型集成相比,使用 WFST 进行词级语言模型集成使 CER 相对降低 10.6%,证实了词级语言模型集成的优势。
  • 当延迟从 960ms 降低到 480ms 时,系统仅出现 0.18% 的绝对 CER 下降,表明对延迟变化具有极强的鲁棒性。
  • 多分块策略在各种延迟配置下均保持稳定性能,且在固定延迟下,增加右文大小(N_r)可进一步提升准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。