Skip to main content
QUICK REVIEW

[论文解读] Universal ASR: Unify and Improve Streaming ASR with Full-context Modeling.

Jiahui Yu, Wei Han|arXiv (Cornell University)|Oct 12, 2020
Speech Recognition and Synthesis被引用 13
一句话总结

本文提出 Universal ASR,一种统一的端到端框架,通过联合训练和原位知识蒸馏,在流式和全上下文自动语音识别之间共享模型权重。该方法显著提升了流式 ASR 的延迟和准确率,在 LibriSpeech 和一个内部 MultiDomain 数据集上取得了新的 SOTA 结果。

ABSTRACT

Streaming automatic speech recognition (ASR) aims to emit each hypothesized word as quickly and accurately as possible, while full-context ASR waits for the completion of a full speech utterance before emitting completed hypotheses. In this work, we propose a unified framework, Universal ASR, to train a single end-to-end ASR model with shared weights for both streaming and full-context speech recognition. We show that the latency and accuracy of streaming ASR significantly benefit from weight sharing and joint training of full-context ASR, especially with inplace knowledge distillation. The Universal ASR framework can be applied to recent state-of-the-art convolution-based and transformer-based ASR networks. We present extensive experiments with two state-of-the-art ASR networks, ContextNet and Conformer, on two datasets, a widely used public dataset LibriSpeech and an internal large-scale dataset MultiDomain. Experiments and ablation studies demonstrate that Universal ASR not only simplifies the workflow of training and deploying streaming and full-context ASR models, but also significantly improves both emission latency and recognition accuracy of streaming ASR. With Universal ASR, we achieve new state-of-the-art streaming ASR results on both LibriSpeech and MultiDomain in terms of accuracy and latency.

研究动机与目标

  • 简化流式与全上下文 ASR 模型的训练和部署流程。
  • 通过与全上下文建模联合训练,提升流式 ASR 在延迟和准确率方面的性能。
  • 在不损害模型容量或推理效率的前提下,实现流式与全上下文 ASR 之间的权重共享。
  • 证明原位知识蒸馏在利用全上下文监督提升流式 ASR 性能方面的有效性。
  • 在 LibriSpeech 和大规模内部 MultiDomain 数据集上实现流式 ASR 的 SOTA 结果。

提出的方法

  • 使用共享权重训练单一端到端 ASR 模型,支持流式和全上下文推理模式。
  • 在训练过程中利用全上下文监督,通过原位知识蒸馏提升流式推理性能。
  • 在不改变推理架构的前提下,将全上下文建模集成到训练过程中,实现联合优化。
  • 该框架兼容基于卷积(如 ContextNet)和基于 Transformer(如 Conformer)的 ASR 架构。
  • 知识蒸馏在原位应用,即全上下文模型的预测结果在训练期间指导流式模型。
  • 该方法支持端到端训练,同时优化低延迟流式输出和高精度全序列识别。

实验结果

研究问题

  • RQ1通过权重共享,单一 ASR 模型是否能在流式和全上下文设置下均实现有竞争力的性能?
  • RQ2与全上下文监督联合训练如何提升流式 ASR 的延迟和准确率?
  • RQ3在使用全上下文数据训练时,原位知识蒸馏在多大程度上提升了流式 ASR 性能?
  • RQ4Universal ASR 框架是否能在不同 ASR 架构(如 ContextNet 和 Conformer)上实现泛化?
  • RQ5Universal ASR 是否能在公共数据集和大规模内部数据集上均实现 SOTA 结果?

主要发现

  • Universal ASR 在 LibriSpeech 上实现了流式 ASR 的新 SOTA 结果,涵盖词错误率和输出延迟两个指标。
  • 通过与全上下文建模联合训练及原位知识蒸馏,该框架显著提升了流式 ASR 的准确率。
  • 由于训练期间全上下文监督带来的更优模型推理,流式 ASR 延迟得以降低。
  • 该方法通过消除对独立训练和维护流式与全上下文模型的需求,简化了模型部署。
  • 在 ContextNet 和 Conformer 上的实验表明,不同架构和数据集上均实现了稳定提升。
  • 该方法在大规模内部 MultiDomain 数据集上表现出强大的泛化能力,证实了其可扩展性和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。