Skip to main content
QUICK REVIEW

[论文解读] A comparison of end-to-end models for long-form speech recognition

Chung‐Cheng Chiu, Wei Han|arXiv (Cornell University)|Nov 6, 2019
Speech Recognition and Synthesis参考文献 13被引用 13
一句话总结

本文比较了端到端模型——特别是 RNN-T 和多种注意力机制架构——在长时长语音识别中的表现。研究发现,标准注意力模型在长语音上因泛化能力差而表现不佳,但通过结合单调注意力与重叠分割解码,可使其性能与 RNN-T 相当,而 RNN-T 在长时长数据上默认即表现出强健性。

ABSTRACT

End-to-end automatic speech recognition (ASR) models, including both attention-based models and the recurrent neural network transducer (RNN-T), have shown superior performance compared to conventional systems. However, previous studies have focused primarily on short utterances that typically last for just a few seconds or, at most, a few tens of seconds. Whether such architectures are practical on long utterances that last from minutes to hours remains an open question. In this paper, we both investigate and improve the performance of end-to-end models on long-form transcription. We first present an empirical comparison of different end-to-end models on a real world long-form task and demonstrate that the RNN-T model is much more robust than attention-based systems in this regime. We next explore two improvements to attention-based systems that significantly improve its performance: restricting the attention to be monotonic, and applying a novel decoding algorithm that breaks long utterances into shorter overlapping segments. Combining these two improvements, we show that attention-based end-to-end models can be very competitive to RNN-T on long-form speech recognition.

研究动机与目标

  • 评估端到端自动语音识别模型在真实世界长时长语音识别任务中的表现,尤其关注其在短语音之外的泛化能力。
  • 探究为何标准注意力机制模型在长时长音频上表现不佳,特别是高删除错误率的原因。
  • 通过架构与解码策略的改进,提升注意力机制模型在长时长识别任务中的表现。
  • 确定注意力机制模型是否能在长时长转录任务中达到与 RNN-T 相当的性能。

提出的方法

  • 在真实世界长时长自动语音识别任务中,基于 YouTube 视频字幕,对 RNN-T 和多种注意力机制模型(软注意力、单调注意力、MoChA、MILk、GMM 单调注意力)进行实证比较。
  • 对注意力机制施加单调性约束,以确保声学序列与转录序列之间实现单调对齐。
  • 实现一种新颖的重叠分段解码策略,将长语音分割为重叠的片段,以保留边界处的上下文信息。
  • 使用包含五个混合成分的 GMM 基础单调注意力模型,以提升对齐稳定性并降低错误率。
  • 在 MILk 模型中应用延迟感知损失函数,以促进更早且更一致的标记输出。
  • 所有模型均使用双向 LSTMs(1024 个单元)进行训练,并采用相同的 RNN-T 架构以确保公平比较,使用 Tensorflow-Lingvo 进行共享编码器的优化训练。

实验结果

研究问题

  • RQ1与 RNN-T 相比,标准端到端模型(尤其是注意力机制模型)在长时长语音识别中的表现如何?
  • RQ2注意力机制模型为何在长语音上泛化能力差,其主要错误类型是什么?
  • RQ3单调注意力在多大程度上能提升注意力机制模型在长时长自动语音识别中的鲁棒性?
  • RQ4重叠分段解码是否能缓解长语音处理中的上下文丢失问题?
  • RQ5将单调注意力与重叠解码相结合,能否使注意力机制模型在长时长任务中与 RNN-T 性能相当?

主要发现

  • RNN-T 模型在长时长语音识别任务中取得了最低的 WER,表现出强大的鲁棒性与对长语音的可扩展性。
  • 标准软注意力模型在长时长数据上性能严重下降,WER 达 67.1,主要由于 63.2 的删除错误。
  • 在各类注意力机制模型中,基于 GMM 的单调注意力模型表现最佳(尽管仍逊于 RNN-T),表明单调性有助于性能提升,但单独使用仍不足。
  • 重叠分段解码显著改善了模型性能:在 16 秒分段下,相比非重叠分段,其 WER 损失更小,且 RNN-T 在分段处理时仅表现出 10% 的相对性能下降。
  • 将单调注意力与重叠推理相结合,使表现最佳的注意力模型(MILk)在长时长任务中达到与 RNN-T 竞争的性能。
  • 当长语音被分段处理时,RNN-T 仍能保持高质量输出,而注意力模型因缺乏重叠解码而遭受上下文丢失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。