[论文解读] SpeechMoE: Scaling to Large Acoustic Models with Dynamic Routing Mixture of Experts
本文提出 SpeechMoE,一种用于语音识别大规模声学模型的动态路由专家混合(MoE)架构。通过将共享嵌入网络与路由器输入结合,并引入稀疏性 L1 损失和平均重要性损失,SpeechMoE 在保持相当 FLOPs 的前提下,相较强基线模型实现了 7.0% 至 23.0% 的相对字符错误率(CER)改进,通过专家专业化与均衡路由,展现出卓越的容量与效率。
Recently, Mixture of Experts (MoE) based Transformer has shown promising results in many domains. This is largely due to the following advantages of this architecture: firstly, MoE based Transformer can increase model capacity without computational cost increasing both at training and inference time. Besides, MoE based Transformer is a dynamic network which can adapt to the varying complexity of input instances in realworld applications. In this work, we explore the MoE based model for speech recognition, named SpeechMoE. To further control the sparsity of router activation and improve the diversity of gate values, we propose a sparsity L1 loss and a mean importance loss respectively. In addition, a new router architecture is used in SpeechMoE which can simultaneously utilize the information from a shared embedding network and the hierarchical representation of different MoE layers. Experimental results show that SpeechMoE can achieve lower character error rate (CER) with comparable computation cost than traditional static networks, providing 7.0%-23.0% relative CER improvements on four evaluation datasets.
研究动机与目标
- 为解决在语音识别中扩大声学模型规模而不增加计算成本的挑战。
- 通过根据输入复杂度动态将输入路由至专业化专家,提升模型容量与自适应能力。
- 通过新型训练目标增强路由稀疏性与专家使用平衡,提升模型多样性与鲁棒性。
- 评估将共享嵌入与层输出结合用于低层级语音特征中以改善路由决策的有效性。
提出的方法
- 提出一种新型 MoE 架构 SpeechMoE,其中路由器使用前一层输出与共享嵌入网络作为输入,以提升路由决策能力。
- 引入稀疏性 L1 损失,以鼓励每个输入的路由激活保持稀疏,促进高效专家利用。
- 采用平均重要性损失以平衡专家使用,防止利用不足,增强模型多样性与鲁棒性。
- 采用类似 Switch Transformer 的 top-1 路由策略,基于路由分数仅激活每个输入 token 的一个专家。
- 使用共享嵌入网络将低层级谱图特征转换为更高层级表示,以提供更优的路由引导。
- 通过组合 CTC 损失、稀疏性 L1 损失与平均重要性损失的复合损失进行模型训练,以联合优化准确性、稀疏性与平衡性。

实验结果
研究问题
- RQ1动态路由 MoE 架构是否能在保持固定 FLOPs 的前提下提升语音识别性能?
- RQ2将共享嵌入与层输出结合对低层级语音特征中的路由性能有何影响?
- RQ3所提出的稀疏性 L1 损失在多大程度上提升了路由稀疏性与模型效率?
- RQ4平均重要性损失如何增强专家使用平衡性与模型泛化能力?
- RQ5增加专家数量对模型性能与训练动态有何影响?
主要发现
- 结合稀疏性 L1 损失与平均重要性损失的 SpeechMoE 在 Read 测试集上相较基线模型实现 23.0% 的相对 CER 改进。
- 8 专家模型(MoE-8e)在 AISHELL 测试集上实现 11.9% 的相对 CER 降低,表明容量提升带来显著性能增益。
- 将共享嵌入网络加入路由器输入后,Spon 集 CER 降低 0.19 个点,Chat 集降低 0.49 个点,证明其在低层级特征路由中的有效性。
- 相比基线 MoE 模型,平均重要性损失在 Spon 集上进一步将 CER 降低 0.15 个点,表明专家使用更加均衡。
- 专家数量从 2 增加至 8 后,验证 CTC 损失降低且训练速度加快,证实模型具备可扩展性与性能提升。
- 所有配置下模型 FLOPs 保持相近(2.3B),证明容量提升未带来额外计算成本。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。