[论文解读] Listen Attentively, and Spell Once: Whole Sentence Generation via a Non-Autoregressive Architecture for Low-Latency Speech Recognition
该论文提出LASO,一种非自回归端到端语音识别模型,通过利用基于注意力机制的前馈网络架构,在单次前向传播中生成整个句子,实现低延迟推理。通过在语音信号语义中隐式建模token关系,而非显式依赖自回归或掩码语言建模,LASO在AISHELL-1数据集上实现了6.4%的字符错误率(CER),优于最先进自回归Transformer模型,同时将推理延迟降低至21ms,实现50倍加速。
Although attention based end-to-end models have achieved promising performance in speech recognition, the multi-pass forward computation in beam-search increases inference time cost, which limits their practical applications. To address this issue, we propose a non-autoregressive end-to-end speech recognition system called LASO (listen attentively, and spell once). Because of the non-autoregressive property, LASO predicts a textual token in the sequence without the dependence on other tokens. Without beam-search, the one-pass propagation much reduces inference time cost of LASO. And because the model is based on the attention based feedforward structure, the computation can be implemented in parallel efficiently. We conduct experiments on publicly available Chinese dataset AISHELL-1. LASO achieves a character error rate of 6.4%, which outperforms the state-of-the-art autoregressive transformer model (6.7%). The average inference latency is 21 ms, which is 1/50 of the autoregressive transformer model.
研究动机与目标
- 解决依赖束搜索解码的自回归端到端语音识别模型存在的高推理延迟问题。
- 探究语音信号中的隐式语言语义是否可替代显式的自回归或掩码语言建模以实现序列生成。
- 开发一种非自回归架构,实现在不牺牲识别准确率的前提下并行、单次通过的推理。
- 实现适用于实时应用的低延迟、高准确率语音识别。
提出的方法
- LASO采用三模块架构:基于CNN的编码器用于声学特征提取,位置相关汇总模块(PDS)用于弥合语音与文本序列长度的差距,以及用于token级别语义精炼的解码器。
- PDS利用多头自注意力机制从编码器查询高层表示,并生成与位置相关的上下文向量。
- 解码器使用前馈注意力模块并行预测token,无循环结构,也不依赖先前预测的token。
- 模型采用交叉熵损失进行端到端训练,推理时在每个位置直接选择最可能的token,无需束搜索。
- 该架构通过前馈注意力实现并行计算,支持单次通过推理,显著降低延迟。
- 通过速度扰动进行数据增强,以提升鲁棒性与性能。
实验结果
研究问题
- RQ1通过依赖语音中隐式的语义结构而非显式的自回归或掩码语言建模,非自回归模型能否在不使用显式建模的情况下生成准确转录?
- RQ2在准确率与推理速度两方面,非自回归模型相较于最先进自回归Transformer模型的表现如何?
- RQ3基于前馈注意力的架构是否能在实现单次通过、并行推理的同时,达到具有竞争力的性能?
- RQ4模型在直接从语音信号中捕捉token级别语义方面,性能提升程度如何?
- RQ5位置相关汇总模块(PDS)在无自回归依赖的情况下,对对齐语音表征与token位置的有效性如何?
主要发现
- LASO在AISHELL-1测试集上达到6.4%的字符错误率(CER),优于最先进自回归Transformer模型(6.7% CER)。
- LASO的推理延迟为每句21ms,相比自回归Transformer基线模型实现50倍加速。
- 采用速度扰动的数据增强后,LASO-big在测试集上达到5.8%的CER,证明了数据增强的有效性。
- 得益于其非自回归设计带来的并行单次推理,即使不使用束搜索,模型性能依然强劲。
- 注意力权重可视化结果表明,有意义的token与相关语音片段对齐,而<eos> token无明显对齐,验证了模型注意力行为的合理性。
- PDS模块成功捕捉了与位置相关的语义表征,实现了在无自回归依赖情况下的准确token预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。