Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Transformers for Large-Scale Speech Recognition

Liang Lu, Changliang Liu|arXiv (Cornell University)|May 19, 2020
Speech Recognition and Synthesis参考文献 25被引用数 14
ひとこと要約

この論文は、65,000時間の学習データを用いた大規模な音声認識におけるTransformerの性能を調査しており、オフライン設定ではBLSTMより6%相対的にWERを低減することを示している。ストリーミング環境では、800msの遅延制約下でTransformer-XLがLC-BLSTMの性能に達しており、標準的なアテンションマスク付きストリーミングTransformerの限界を克服している。

ABSTRACT

While recurrent neural networks still largely define state-of-the-art speech recognition systems, the Transformer network has been proven to be a competitive alternative, especially in the offline condition. Most studies with Transformers have been constrained in a relatively small scale setting, and some forms of data argumentation approaches are usually applied to combat the data sparsity issue. In this paper, we aim at understanding the behaviors of Transformers in the large-scale speech recognition setting, where we have used around 65,000 hours of training data. We investigated various aspects on scaling up Transformers, including model initialization, warmup training as well as different Layer Normalization strategies. In the streaming condition, we compared the widely used attention mask based future context lookahead approach to the Transformer-XL network. From our experiments, we show that Transformers can achieve around 6% relative word error rate (WER) reduction compared to the BLSTM baseline in the offline fashion, while in the streaming fashion, Transformer-XL is comparable to LC-BLSTM with 800 millisecond latency constraint.

研究の動機と目的

  • 65,000時間の学習データを用いた大規模な音声認識におけるTransformerの性能を評価すること。
  • 64 GPUにわたるスケーリングにおけるモデル初期化とウォームアップ学習の課題を解決すること。
  • 遅延制約下でLC-BLSTMと比較するストリーミングTransformerの変種(アテンションマスク付きとTransformer-XL)を検討すること。
  • 認識精度に与えるモデルの深さ、幅、正則化戦略の影響を調査すること。
  • ストリーミングTransformerがオフラインモデルに比べて性能が劣る理由を理解し、効果的な解決策を提案すること。

提案手法

  • 同期バッチ正則化と勾配クリッピングを用いて、最大64 GPUでデータ並列処理による深層Transformerの学習。
  • 深層モデルの学習安定化のため、深さスケール初期化と学習率ウォームアップを採用。
  • スケーリングされたドットプロダクトアテンションを用いたマルチヘッド自己アテンション:$\text{Attention}(Q,K,V) = \text{Softmax}(\frac{QK^T}{\sqrt{d_k}})V$。
  • ストリーミングTransformerにおける順序保持のため、入力シーケンスの単調性を維持するためのインタレースド畳み込み層を適用し、自己アテンションによる順序の入れ替え効果を軽減。
  • 以前のチャンクからの隠れ状態を永続的に保持するTransformer-XLを実装し、$[-40,40]$の文脈を用いた長距離文脈モデリングを可能にした。
  • 文脈ウィンドウの制約を設定:オフラインでは$[-\infty,\infty]$、ストリーミングでは$[-40,40]$、LC-BLSTMのベースラインでは$[-1,40]$を採用。

実験結果

リサーチクエスチョン

  • RQ165,000時間のデータを用いた大規模な音声認識において、TransformerはBLSTMを上回ることができるか?
  • RQ2大規模な設定下で複数のGPUにわたる深層Transformerをスケーリングするために不可欠な訓練技術は何か?
  • RQ3標準的なアテンションマスク付きストリーミングTransformerはなぜオフラインモデルに比べて性能が劣るのか?その原因を特定し、是正策を講じるにはどうすればよいか?
  • RQ4厳密な遅延制約下で、Transformer-XLはLC-BLSTMと比べてストリーミング音声認識でどの程度の性能を示すか?
  • RQ5オフラインおよびストリーミングの両設定下で、モデルの深さと幅が認識精度に与える影響は何か?

主な発見

  • オフライン設定では、同程度のモデルサイズでBLSTMベースラインに比べて6%相対的にWERが低減された。
  • ストリーミング設定では、Transformer-XLが評価セットで12.2のWERを達成し、800msの遅延制約下でLC-BLSTMと同等の性能を示した。
  • インタレースド畳み込みを適用しないアテンションマスク付きストリーミングTransformerは、オフラインモデルと比較して18%〜25%のWER悪化を示した。
  • インタレースド畳み込み層の導入により、ストリーミングTransformerにおけるWER損失が軽減され、入力シーケンスの単調性が維持された。
  • より深いTransformer(最大48層)はわずかな向上を示したが、過学習またはより強い正則化の必要性を示唆している。
  • 48層のTransformer-XLは開発セットで18.5のWERを達成しており、より良い正則化手法を用いればさらなる改善が期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。