Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model

Anjuli Kannan, Arindrima Datta|arXiv (Cornell University)|Sep 11, 2019
Speech Recognition and Synthesis参考文献 32被引用 4
一句话总结

该论文提出了一种基于RNN-T的流式端到端(E2E)多语言语音识别模型,在九种印度语言上均优于单语E2E和传统ASR系统。通过结合语言向量和语言特定的适配器模块,该模型实现了稳定的10%相对WER降低——在低资源语言上最高可达34%——同时保持低延迟,适用于实时应用。

ABSTRACT

Multilingual end-to-end (E2E) models have shown great promise in expansion of automatic speech recognition (ASR) coverage of the world's languages. They have shown improvement over monolingual systems, and have simplified training and serving by eliminating language-specific acoustic, pronunciation, and language models. This work presents an E2E multilingual system which is equipped to operate in low-latency interactive applications, as well as handle a key challenge of real world data: the imbalance in training data across languages. Using nine Indic languages, we compare a variety of techniques, and find that a combination of conditioning on a language vector and training language-specific adapter layers produces the best model. The resulting E2E multilingual model achieves a lower word error rate (WER) than both monolingual E2E models (eight of nine languages) and monolingual conventional systems (all nine languages).

研究动机与目标

  • 开发一种适用于语音助手等交互式应用的流式、低延迟多语言ASR系统。
  • 解决多语言训练中的数据不平衡问题,即由于数据分布不均,高资源语言主导模型性能。
  • 在不牺牲高资源语言准确率的前提下,提升低资源语言的性能。
  • 证明单一E2E模型可超越多个单语传统系统,同时简化部署流程。

提出的方法

  • 采用RNN-T架构实现流式推理,通过依赖过去输出和当前声学帧来实现低延迟实时推理。
  • 使用语言向量来对目标语言进行条件控制,提升跨语言的歧义消除能力。
  • 应用语言特定的适配器模块——插入编码器层中的小型可训练前馈网络——实现在每种语言上的参数高效专业化。
  • 采用类别平衡采样和自适应加权策略来缓解数据不平衡问题,尽管与语言向量结合时效果减弱。
  • 联合使用语言向量和适配器模块,以共同提升所有语言的鲁棒性和性能,尤其在低资源语言上表现更优。
  • 在包含九种印度语言的37,000小时多语言语料库上评估模型,与单语E2E和传统ASR基线进行对比。

实验结果

研究问题

  • RQ1流式端到端多语言ASR模型能否在保持低延迟的同时,实现与最先进单语传统ASR系统相当的性能?
  • RQ2语言向量和适配器模块在缓解数据不平衡训练中低资源语言性能下降方面有多有效?
  • RQ3结合语言向量与语言特定适配器模块是否优于单独使用任一技术或数据采样策略?
  • RQ4数据不平衡在多大程度上影响模型性能?架构改进如适配器能否补偿数据分布的偏斜?
  • RQ5单一E2E模型能否在准确率和部署效率上取代九个独立的单语模型?

主要发现

  • 所提出的多语言E2E模型在九种语言中的八种上,WER低于单语E2E模型。
  • 该模型在所有九种语言上均优于单语传统ASR系统,实现了稳定的10%相对WER降低,且在Kannada等低资源语言上最高达34%的相对提升。
  • 语言向量与适配器模块的结合取得了最佳性能,在Kannada上实现9%的相对WER降低,在Urdu上实现8%的降低。
  • 仅使用语言向量条件控制可降低低资源语言的WER,但会导致高资源语言性能下降;适配器通过实现语言特定适应而避免过拟合,从而缓解此问题。
  • 每种语言仅增加250万参数(约占完整模型的2%),因此具有高度参数效率,且可选择性地部署。
  • 模型通过RNN-T保持流式能力,支持实时推理,适用于语音助手等交互式应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。