Skip to main content
QUICK REVIEW

[论文解读] Espresso: A Fast End-to-end Neural Speech Recognition Toolkit

Yiming Wang, Tongfei Chen|arXiv (Cornell University)|Sep 18, 2019
Speech Recognition and Synthesis参考文献 60被引用 14
一句话总结

Espresso 是一个基于 PyTorch 和 fairseq 构建的快速、模块化且可扩展的端到端神经网络自动语音识别(ASR)工具包,具备前瞻性的基于词的语言模型融合全并行解码器。它在无需数据增强的情况下,在 WSJ、LibriSpeech 和 Switchboard 上实现了最先进的 ASR 性能,且解码速度比类似系统(如 ESPnet)快 4–11 倍。

ABSTRACT

We present Espresso, an open-source, modular, extensible end-to-end neural automatic speech recognition (ASR) toolkit based on the deep learning library PyTorch and the popular neural machine translation toolkit fairseq. Espresso supports distributed training across GPUs and computing nodes, and features various decoding approaches commonly employed in ASR, including look-ahead word-based language model fusion, for which a fast, parallelized decoder is implemented. Espresso achieves state-of-the-art ASR performance on the WSJ, LibriSpeech, and Switchboard data sets among other end-to-end systems without data augmentation, and is 4--11x faster for decoding than similar systems (e.g. ESPnet).

研究动机与目标

  • 解决现有端到端 ASR 工具包的局限性,例如可扩展性差和解码速度慢,尤其是在依赖混合深度学习框架的系统(如 ESPnet)中。
  • 通过利用 PyTorch 和 fairseq 的分布式训练能力与优化的推理性能,实现快速、可扩展的端到端 ASR 训练与推理。
  • 引入一种全并行化的解码器,结合前瞻语言模型融合,以加速解码过程,同时不损失准确性。
  • 在标准基准测试(WSJ、LibriSpeech、Switchboard)上实现最先进的 ASR 性能,且无需数据增强,证明所提出的架构与训练技术的有效性。
  • 通过与 fairseq 共享基础设施,促进语音识别与自然语言处理之间的未来集成,实现语音到文本与文本到语音系统的统一研究。

提出的方法

  • 基于 fairseq 和 PyTorch 构建,以确保模块化、可扩展性,并支持跨 GPU 和节点的分布式训练。
  • 使用 Kaldi 风格的 SCP 格式作为输入数据,通过分片加载声学特征,以平衡 I/O 与内存使用。
  • 实现并行化解码器以支持前瞻语言模型融合,其中所有批次中的假设的 LM 分数可同时计算,避免顺序计算。
  • 引入改进的覆盖机制,以减少解码过程中的删除与插入错误,优于标准的 EOS 阈值法。
  • 支持子词分词(SentencePiece),并采用交叉熵损失进行联合训练,无需依赖 CTC 或混合训练。
  • 支持与 fairseq 现有推理与训练流水线的无缝互操作,包括束搜索与分桶批处理。
Fig. 1 : The efficient look-ahead LM algorithm. The dark gray and light gray subtrees correspond to the probability mass spanned by prefix $p\mathtt{c}$ and $p$ (numerator and denominator in Eq. ( 1 )) respectively. These can be efficiently computed via Eq. ( 4 ) using cumsum .
Fig. 1 : The efficient look-ahead LM algorithm. The dark gray and light gray subtrees correspond to the probability mass spanned by prefix $p\mathtt{c}$ and $p$ (numerator and denominator in Eq. ( 1 )) respectively. These can be efficiently computed via Eq. ( 4 ) using cumsum .

实验结果

研究问题

  • RQ1基于 PyTorch 的模块化 ASR 工具包是否能在保持或提升准确率的同时,实现比现有端到端系统(如 ESPnet)更快的解码速度?
  • RQ2与顺序方法相比,前瞻语言模型融合的全并行化实现是否能显著降低解码延迟?
  • RQ3改进的覆盖机制是否能比标准的 EOS 阈值法更有效地降低端到端 ASR 中的词错误率?
  • RQ4基于 fairseq 构建的统一工具包在多大程度上能加速并提升语音到文本与文本到语音系统研究的可维护性?
  • RQ5通过利用更优的模型架构与解码技术,是否可以在不使用数据增强的情况下实现最先进的 ASR 性能?

主要发现

  • Espresso 在无需数据增强的情况下,在 WSJ、LibriSpeech 和 Switchboard 上均实现了最先进的 WER,其中在 LibriSpeech dev-clean 上达到 3.3% WER,在 dev-other 上达到 2.9% WER,得益于改进的覆盖机制。
  • 在 WSJ 数据集上,语言模型训练速度比 ESPnet 快 17.9%,ASR 模型训练速度比 ESPnet 快 16.0%。
  • 解码速度比 ESPnet 快 3.7 倍(无语言模型融合时),在使用前瞻语言模型融合时解码速度超过 10 倍,得益于并行化的 LM 评分。
  • 改进的覆盖机制比 EOS 阈值法更有效地减少了删除错误,从而在 LibriSpeech 和 WSJ 上实现了更低的 WER。
  • 在 Switchboard 上,使用子词语言模型时,Espresso 达到 9.2% WER,不使用时为 10.7%,优于未使用 SpecAugment 的先前端到端模型。
  • 该工具包支持与 fairseq 的无缝集成,为未来在语音翻译与文本到语音系统中使用共享基础设施开展联合研究提供了可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。