[论文解读] Scaling End-to-End Models for Large-Scale Multilingual ASR
本文提出通过GShard将端到端多语言自动语音识别(ASR)模型扩展至100亿参数,以克服因数据不平衡和模型容量限制导致的高资源语言性能下降问题。通过增大模型规模,作者在全部15种语言上均实现了最先进性能,相较于单语基线模型在高资源语言上表现更优,并可通过极少的额外训练实现对新语言和领域的高效持续适应。
Building ASR models across many languages is a challenging multi-task learning problem due to large variations and heavily unbalanced data. Existing work has shown positive transfer from high resource to low resource languages. However, degradations on high resource languages are commonly observed due to interference from the heterogeneous multilingual data and reduction in per-language capacity. We conduct a capacity study on a 15-language task, with the amount of data per language varying from 7.6K to 53.5K hours. We adopt GShard [1] to efficiently scale up to 10B parameters. Empirically, we find that (1) scaling the number of model parameters is an effective way to solve the capacity bottleneck - our 500M-param model already outperforms monolingual baselines and scaling it to 1B and 10B brought further quality gains; (2) larger models are not only more data efficient, but also more efficient in terms of training cost as measured in TPU days - the 1B-param model reaches the same accuracy at 34% of training time as the 500M-param model; (3) given a fixed capacity budget, adding depth works better than width and large encoders do better than large decoders; (4) with continuous training, they can be adapted to new languages and domains.
研究动机与目标
- 解决大规模多语言ASR中因模型容量瓶颈和数据不平衡导致的高资源语言性能下降问题。
- 研究在数据量差异极大的语言(7.6K至53.5K小时)下,增加模型容量对多语言ASR性能的影响。
- 在固定参数预算下,确定提升多语言ASR性能的最优扩展策略——深度与宽度、编码器与解码器容量分配的权衡。
- 探索通过持续训练将多语言模型扩展至新语言和新领域而不发生灾难性遗忘的可行性。
- 证明更大的模型在样本效率和训练成本(以TPU天数衡量)方面更具优势,可显著减少达到目标准确率所需的TPU天数。
提出的方法
- 采用GShard专家混合(MoE)技术,高效地将模型扩展至100亿参数,同时保持训练效率。
- 使用基于注意力机制的编码器-解码器架构训练单一多语言端到端ASR模型,其中编码器采用Conformer结构,解码器基于Transformer。
- 通过消融实验比较在固定参数预算下,宽度与深度扩展的差异,以及编码器与解码器容量分配的影响。
- 利用连续训练方法,将预训练的多语言模型适应至新语言和新领域,例如Multilingual Librispeech数据集中的朗读语音。
- 使用词错误率(WER)在15种语言上评估性能,并通过达到目标准确率所需的TPU天数和训练步数衡量效率。
- 通过从预训练多语言模型初始化新模型,应用知识蒸馏和迁移学习,以提升收敛速度和性能。

实验结果
研究问题
- RQ1将模型容量扩展至100亿参数是否能消除多语言ASR设置中高资源语言的性能下降?
- RQ2在固定参数预算下,增加模型深度与宽度对识别性能有何影响?
- RQ3更大的模型是否能提升样本效率并降低多语言ASR的训练成本(以TPU天数衡量)?
- RQ4预训练的多语言模型是否可通过持续训练有效微调至新语言和新领域,且不降低对已有语言的性能?
- RQ5在多样化语言和领域上进行预训练,能在多大程度上将知识迁移至未见语言和语音风格?
主要发现
- 将模型从5亿参数扩展至100亿参数,在全部15种语言上均一致降低WER,其中10亿参数模型在高资源语言上的表现优于单语基线模型。
- 10亿参数模型的平均WER为11.57%,优于32个单语1420万参数模型的11.87%平均WER,包括在单语设置下无法训练成功的菲律宾语(PH)。
- 10亿参数模型在34%的训练时间内即可达到5亿参数模型的准确率,表明在TPU天数衡量下训练效率更高。
- 更大的模型更具样本效率,收敛所需优化步数更少,并在不同语言和领域间展现出更好的泛化能力。
- 连续训练使模型能够适应新语言(如Multilingual Librispeech中5种未见语言)和新领域(如长篇朗读语音),相比随机初始化实现12%的相对WER降低。
- 在Multilingual Librispeech数据集上对10亿参数多语言模型进行微调后,平均WER降至7.9%,相对提升10%,并修复了英语上的性能下降问题。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。