Skip to main content
QUICK REVIEW

[論文レビュー] Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition

Kenichi Kumatani, Robert Gmyr|arXiv (Cornell University)|Dec 10, 2021
Speech and Audio Processing被引用数 4
ひとこと要約

本論文では、計算コストを最小限に抑えながら多言語エンドツーエンド音声認識モデルを拡大するために、スパarsely-gated mixture of experts (MoE)を提案する。S2S-TおよびT-Tアーキテクチャの両方にMoEを適用することで、S2S-Tでは相対語誤り率(WER)を16.3%削減、T-Tでは4.6%削減し、専門家ルーティングにより効率を維持したまま顕著な精度向上を実証した。

ABSTRACT

The sparsely-gated Mixture of Experts (MoE) can magnify a network capacity with a little computational complexity. In this work, we investigate how multi-lingual Automatic Speech Recognition (ASR) networks can be scaled up with a simple routing algorithm in order to achieve better accuracy. More specifically, we apply the sparsely-gated MoE technique to two types of networks: Sequence-to-Sequence Transformer (S2S-T) and Transformer Transducer (T-T). We demonstrate through a set of ASR experiments on multiple language data that the MoE networks can reduce the relative word error rates by 16.3% and 4.6% with the S2S-T and T-T, respectively. Moreover, we thoroughly investigate the effect of the MoE on the T-T architecture in various conditions: streaming mode, non-streaming mode, the use of language ID and the label decoder with the MoE.

研究の動機と目的

  • 多様な言語における精度を向上させるために、多言語エンドツーエンドASRモデルの拡大を図ること。
  • 計算コストに比例して増加しないモデル容量の拡大に、スパarsely-gated MoEの有効性を検証すること。
  • ストリーミングおよび非ストリーミングモードの両方で、S2S-TおよびT-TアーキテクチャにおけるMoEの性能を比較すること。
  • MoEが音声エンコーダーとラベルデコーダーの両方に与える影響を評価し、ルーティングにおける言語IDの役割を検討すること。
  • 今後の研究における知識蒸留への応用を含め、MoEのスケーラビリティを検討すること。

提案手法

  • MoEレイヤーはルーティングネットワークを用いて、各入力トークンに対して1つの専門家のみを選択することで、計算コストを最小限に抑える。
  • 各MoEブロックは、Transformerレイヤー内のフィードフォワードネットワーク(FFN)を、24〜120個のスパース専門家とゲーティングメカニズムで置き換える。
  • 専門家の負荷をバランスさせるために容量係数を1.5に設定し、オーバーフローは残差接続で処理する。
  • モデルはシンプルなスイッチングルーターを採用しており、各トークンに対してトップ1の専門家のみを活性化させることで、計算量をベースラインに近づける。
  • ルーティングの改善と多言語一般化の向上を図るため、言語IDをワンホットベクトルとして入力に組み込む。
  • ストリーミングおよび非ストリーミング推論モードの両方を用いて、複数言語で実験を行い、耐障害性を評価する。

実験結果

リサーチクエスチョン

  • RQ1MoEスケーリングは、S2S-TおよびT-Tアーキテクチャにおける多言語ASR精度にどのように寄与するか?
  • RQ2T-Tモデルの異なる構成要因(音声エンコーダーとラベルデコーダー)におけるMoEの相対的影響は何か?
  • RQ3言語ID情報の組み込みは、MoEルーティングおよび認識性能にどのような影響を与えるか?
  • RQ4より深いネットワークではMoEがより大きな効果を発揮するか?また、ストリーミングと非ストリーミング推論の間で性能に差は生じるか?
  • RQ5低リソース言語においてMoEが性能向上をもたらすか?同時に、高リソース言語の性能は維持できるか?

主な発見

  • MoE-S2S-Tモデルは、ベースラインと比較して16.3%の相対的語誤り率(WER)削減を達成し、72個の専門家が最良の性能を示した。
  • MoE-T-Tモデルは、非ストリーミングモードで相対的に4.6%、ストリーミングモードで4.3%のWER削減を達成し、より深いアーキテクチャではその効果が増大した。
  • 音声エンコーダーにMoEを適用すると認識精度が向上するが、ラベルデコーダーに適用しても顕著な利益は得られなかった。
  • 言語IDを入力に組み込むことで、非MoEのT-Tモデルでは相対的に最大14.7%のWER削減が達成され、MoE性能のさらなる向上も確認された。
  • 36層の深層T-TモデルにMoEを適用した場合、WERは12.18%に低下し、非MoEバージョンと比較して3.2%の相対的改善を示した。これはスケーラビリティを示している。
  • MoE機構は計算コストの増加を最小限に抑え、ゲーティングによるわずかな増加に留まり、大規模な多言語ASRに効率的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。