Skip to main content
QUICK REVIEW

[논문 리뷰] Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition

Kenichi Kumatani, Robert Gmyr|arXiv (Cornell University)|2021. 12. 10.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 계산 비용을 최소화하면서 다국어 엔드 투 엔드 음성 인식 모델을 확장하기 위해 희박하게 게이트된 전문가의 혼합(MoE)을 제안한다. S2S-T 및 T-T 아키텍처에 MoE를 적용함으로써, S2S-T에서는 상대적 단어 오류율(WER)을 16.3% 감소시키고 T-T에서는 4.6% 감소시켜 효율성을 유지하면서도 정확도 향상을 입증한다.

ABSTRACT

The sparsely-gated Mixture of Experts (MoE) can magnify a network capacity with a little computational complexity. In this work, we investigate how multi-lingual Automatic Speech Recognition (ASR) networks can be scaled up with a simple routing algorithm in order to achieve better accuracy. More specifically, we apply the sparsely-gated MoE technique to two types of networks: Sequence-to-Sequence Transformer (S2S-T) and Transformer Transducer (T-T). We demonstrate through a set of ASR experiments on multiple language data that the MoE networks can reduce the relative word error rates by 16.3% and 4.6% with the S2S-T and T-T, respectively. Moreover, we thoroughly investigate the effect of the MoE on the T-T architecture in various conditions: streaming mode, non-streaming mode, the use of language ID and the label decoder with the MoE.

연구 동기 및 목표

  • 다양한 언어에서 높은 정확도를 달성하기 위해 다국어 엔드 투 엔드 ASR 모델을 확장하는 것.
  • 희박하게 게이트된 MoE가 계산 비용에 비례하지 않게 모델 용량을 증가시키는 데 효과적인지 조사하는 것.
  • 스트리밍 및 비스트리밍 모드에서 S2S-T 및 T-T 아키텍처 간의 MoE 성능을 비교하는 것.
  • MoE가 오디오 인코더와 레이블 디코더에 미치는 영향을 평가하고, 라우팅에 있어 언어 ID의 역할을 분석하는 것.
  • 앞서 나올 연구에서 깊이 있는 네트워크에서 MoE의 확장성과 지식 정복에 잠재적 응용 가능성을 탐색하는 것.

제안 방법

  • MoE 레이어는 각 입력 토큰에 대해 오직 한 전문가만 선택하는 라우팅 네트워크를 사용하여 계산 오버헤드를 최소화한다.
  • 각 MoE 블록은 트랜스포저 레이어의 피드포워드 네트워크(FFN)를 24~120개의 희박한 전문가와 게이팅 메커니즘으로 대체한다.
  • 전문가 부하 균형과 데이터 오버플로우 방지를 위해 용량 인자를 1.5로 설정하고, 잔차 연결을 통해 오버플로우를 처리한다.
  • 간단한 스위칭 라우터를 사용하여 각 토큰에 대해 오직 상위 1개의 전문가만 활성화되며, 이로 인해 계산량이 기준 수준에 근접하게 유지된다.
  • 라우팅을 향상시키고 다국어 일반화 성능을 높이기 위해 언어 ID를 원핫 벡터로 통합한다.
  • 정확도를 평가하기 위해 스트리밍 및 비스트리밍 추론 모드를 모두 활용해 다수의 언어에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1MoE 스케일링은 S2S-T 및 T-T 아키텍처에서 다국어 ASR 정확도에 어떻게 기여하는가?
  • RQ2T-T 모델의 다양한 구성 요소, 예를 들어 오디오 인코더와 레이블 디코더에서 MoE의 상대적 영향은 어떠한가?
  • RQ3언어 ID 정보의 포함 여부가 MoE 라우팅과 인식 성능에 어떤 영향을 미치는가?
  • RQ4더 깊은 네트워크에서 MoE는 더 큰 성능 향상을 가져오는가? 또한 스트리밍과 비스트리밍 추론 간 성능 비교는 어떠한가?
  • RQ5MoE는 자원이 적은 언어에서 성능 향상을 이끌 수 있으며, 同시에 자원이 풍부한 언어의 높은 성능를 유지할 수 있는가?

주요 결과

  • MoE-S2S-T 모델은 기준 모델 대비 상대적 단어 오류율(WER)을 16.3% 감소시켰으며, 72개의 전문가를 사용했을 때 최고의 성능를 기록했다.
  • MoE-T-T 모델은 비스트리밍 모드에서 WER을 4.6% 상대적으로 감소시키고, 스트리밍 모드에서는 4.3% 감소시켰으며, 깊이 있는 아키텍처에서 성능 향상이 더욱 두드러졌다.
  • 오디오 인코더에 MoE를 적용하면 인식 정확도가 향상되지만, 레이블 디코더에 적용할 경우 유의미한 성능 향상이 없었다.
  • 언어 ID를 입력으로 사용하면 비-MoE T-T 모델에서 WER을 최대 14.7% 상대적으로 감소시키며, MoE 성능까지 추가로 향상시켰다.
  • 36층의 깊은 T-T 모델에 MoE를 적용한 결과 WER이 12.18%로 나타났으며, 비-MoE 버전 대비 3.2% 상대적 향상률을 기록하여 확장성의 잠재력을 입증했다.
  • MoE 메커니즘은 게이팅으로 인한 증가분이 미미하여 계산 오버헤드를 최소화하며, 대규모 다국어 ASR에 있어 효율적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.