[论文解读] Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition
本文提出使用稀疏门控专家模型(MoE)在计算开销最小化的情况下扩展多语言端到端自动语音识别模型。通过将MoE应用于序列到序列Transformer(S2S-T)和Transformer Transducer(T-T)架构,该方法在S2S-T上将相对词错误率降低16.3%,在T-T上降低4.6%,在保持高效性的同时显著提升了准确率。
The sparsely-gated Mixture of Experts (MoE) can magnify a network capacity with a little computational complexity. In this work, we investigate how multi-lingual Automatic Speech Recognition (ASR) networks can be scaled up with a simple routing algorithm in order to achieve better accuracy. More specifically, we apply the sparsely-gated MoE technique to two types of networks: Sequence-to-Sequence Transformer (S2S-T) and Transformer Transducer (T-T). We demonstrate through a set of ASR experiments on multiple language data that the MoE networks can reduce the relative word error rates by 16.3% and 4.6% with the S2S-T and T-T, respectively. Moreover, we thoroughly investigate the effect of the MoE on the T-T architecture in various conditions: streaming mode, non-streaming mode, the use of language ID and the label decoder with the MoE.
研究动机与目标
- 为提升多种语言上的多语言端到端ASR模型准确率,实现其规模化扩展。
- 探究稀疏门控MoE在不按比例增加计算成本的前提下提升模型容量的有效性。
- 在流式与非流式模式下,比较MoE在S2S-T与T-T两种架构中的性能表现。
- 评估MoE对语音编码器与标签解码器的影响,以及语言ID在路由中的作用。
- 探索MoE在更深网络中的可扩展性,并为未来知识蒸馏应用提供潜力。
提出的方法
- MoE层使用路由网络为每个输入标记仅选择一个专家,从而最小化计算开销。
- 每个MoE模块用一组24至120个稀疏专家及门控机制替代Transformer层中的前馈网络(FFN)。
- 容量因子设为1.5,以平衡专家负载并防止数据溢出,残差连接用于处理溢出情况。
- 模型采用简单的切换路由机制,即每个标记仅激活最高1个专家,将计算量降至接近基线水平。
- 将语言ID作为独热向量输入,以引导路由并提升多语言泛化能力。
- 在多种语言上开展实验,采用流式与非流式推理模式,以评估模型鲁棒性。
实验结果
研究问题
- RQ1MoE扩展如何提升S2S-T与T-T架构在多语言ASR中的准确率?
- RQ2MoE对T-T模型不同组件(如语音编码器与标签解码器)的影响有何相对差异?
- RQ3引入语言ID信息如何影响MoE的路由机制与识别性能?
- RQ4MoE在更深网络中是否带来更大性能增益?其在流式与非流式推理中的表现如何?
- RQ5MoE能否在保持高资源语言高性能的同时,提升低资源语言的性能?
主要发现
- MoE-S2S-T模型相比基线模型实现16.3%的相对词错误率降低,使用72个专家时性能最佳。
- MoE-T-T模型在非流式模式下实现4.6%的相对WER降低,在流式模式下降低4.3%,且在更深架构中增益进一步提升。
- 在语音编码器中引入MoE可提升识别准确率,而在标签解码器中应用MoE则无显著收益。
- 将语言ID作为输入可使非MoE T-T模型的WER降低最多达14.7%相对值,并进一步提升MoE模型性能。
- 采用MoE的深层T-T模型(36层)实现12.18%的WER,相比非MoE版本提升3.2%相对值,显示出良好的可扩展性。
- MoE机制保持了极低的计算开销,仅因门控机制带来微小增加,使其在大规模多语言ASR中极具效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。