[논문 리뷰] SpeechMoE: Scaling to Large Acoustic Models with Dynamic Routing Mixture of Experts
이 논문은 음성 인식에서 대규모 음성 모델을 위한 동적 라우팅 혼합 전문가(MoE) 아키텍처인 SpeechMoE를 제안한다. 공유 임bedding 네트워크를 라우터 입력에 통합하고, 희소성 L1 손실 및 평균 중요도 손실을 도입함으로써, SpeechMoE는 강력한 기준 모델 대비 7.0%에서 23.0%의 상대적 문자 오류률(CER) 향상을 달성하면서도 동일한 FLOPs를 유지하여 전문가 특화화와 균형 잡힌 라우팅을 통해 뛰어난 능력과 효율성을 입증한다.
Recently, Mixture of Experts (MoE) based Transformer has shown promising results in many domains. This is largely due to the following advantages of this architecture: firstly, MoE based Transformer can increase model capacity without computational cost increasing both at training and inference time. Besides, MoE based Transformer is a dynamic network which can adapt to the varying complexity of input instances in realworld applications. In this work, we explore the MoE based model for speech recognition, named SpeechMoE. To further control the sparsity of router activation and improve the diversity of gate values, we propose a sparsity L1 loss and a mean importance loss respectively. In addition, a new router architecture is used in SpeechMoE which can simultaneously utilize the information from a shared embedding network and the hierarchical representation of different MoE layers. Experimental results show that SpeechMoE can achieve lower character error rate (CER) with comparable computation cost than traditional static networks, providing 7.0%-23.0% relative CER improvements on four evaluation datasets.
연구 동기 및 목표
- 음성 인식에서 계산 비용을 증가시키지 않고 음성 모델을 확장하는 데 도전하는 것.
- 입력 복잡도에 따라 전문화된 전문가에게 입력을 동적 라우팅함으로써 모델 용량과 적응성을 향상시키는 것.
- 새로운 훈련 목표를 통해 라우팅의 희소성과 전문가 활용 균형을 향상시키는 것.
- 낮은 수준의 음성 특징에서 라우터 결정을 향상시키기 위해 공유 임bedding과 레이어 출력을 결합하는 효과를 평가하는 것.
제안 방법
- 라우터가 이전 레이어의 출력과 공유 임베딩 네트워크를 모두 입력으로 사용하여 라우팅 결정을 향상시키는 새로운 MoE 아키텍처인 SpeechMoE를 제안한다.
- 입력 당 라우터 활성화를 희소하게 유지함으로써 효율적인 전문가 활용을 장려하기 위해 희소성 L1 손실을 도입한다.
- 전문가 사용을 균형 있게 유지하고 활용도가 낮은 전문가를 방지하기 위해 평균 중요도 손실을 활용하며, 이는 모델의 다양성과 강건성을 향상시킨다.
- Switch Transformer와 유사한 top-1 라우팅 전략을 사용하여, 라우터 점수에 기반해 각 입력 토큰당 하나의 전문가만 활성화한다.
- 낮은 수준의 스펙트로그램 특징를 더 높은 수준의 표현으로 변환하기 위해 공유 임베딩 네트워크를 활용하여 라우팅 가이던스를 향상시킨다.
- 정확도, 희소성, 균형을 동시에 최적화하기 위해 CTC 손실, 희소성 L1 손실, 평균 중요도 손실을 복합적으로 사용하여 모델을 훈련한다.

실험 결과
연구 질문
- RQ1고정된 FLOPs를 유지하면서 동적 라우팅 MoE 아키텍처가 음성 인식 성능을 향상시킬 수 있는가?
- RQ2공유 임베딩과 레이어 출력을 결합하면 낮은 수준의 음성 특징에서 라우터 성능에 어떤 영향을 미치는가?
- RQ3제안된 희소성 L1 손실이 라우팅의 희소성과 모델 효율성에 얼마나 기여하는가?
- RQ4평균 중요도 손실이 전문가 활용 균형과 모델 일반화 능력을 어떻게 향상시키는가?
- RQ5전문가 수를 늘일수록 모델 성능과 훈련 동역학에는 어떤 영향을 미치는가?
주요 결과
- 스패arsity L1 손실과 평균 중요도 손실을 적용한 SpeechMoE는 기준 모델 대비 읽기 테스트 세트에서 23.0%의 상대적 CER 향상을 달성했다.
- 8개의 전문가를 가진 모델(MoE-8e)은 AISHELL 테스트 세트에서 11.9%의 상대적 CER 감소를 기록하여 능력 증가에 따른 강력한 성능 향상을 입증했다.
- 라우터 입력에 공유 임베딩 네트워크를 추가함으로써 Spon 세트에서는 CER이 0.19점 감소하고, Chat 세트에서는 0.49점 감소하여 낮은 수준의 특징 라우팅에서의 효과를 입증했다.
- 기준 MoE 모델 대비 평균 중요도 손실을 적용한 경우 Spon 세트에서 CER이 0.15점 추가로 감소하여 전문가 활용 균형 향상 효과를 확인했다.
- 전문가 수를 2개에서 8개로 늘임으로써 검증용 CTC 손실이 낮아지고 훈련 속도가 빨라져 확장성과 성능 향상이 확인되었다.
- 모든 설정에서 동일한 FLOPs(2.3B)를 유지하여 능력 증가가 추가 계산 비용을 수반하지 않음을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.