Skip to main content
QUICK REVIEW

[論文レビュー] Improving RNN Transducer Modeling for End-to-End Speech Recognition

Jinyu Li, Rui Zhao|arXiv (Cornell University)|Sep 26, 2019
Speech Recognition and Synthesis参考文献 39被引用数 5
ひとこと要約

この論文は、RNN Transducer (RNN-T) のエンドツーエンド音声認識のためのモデリングを、トレーニング時のメモリ使用量の最適化によりより大きなミニバッチを可能にするとともに、新たなモデルアーキテクチャの提案により改善している。具体的には、エンコーダーに拡張された文脈長短記憶型リカレントユニット(ecltGRU)を、予測ネットワークにGRUを採用した。最良のモデルは、サイズが小さい(216 MB)ベースラインRNN-Tよりも11.8%相対的なWERを削減し、同程度のサイズのデバイスハイブリッドモデルを15.0%相対的に上回り、5.1 GBのサーバハイブリッドモデルと同等の性能を達成した。

ABSTRACT

In the last few years, an emerging trend in automatic speech recognition research is the study of end-to-end (E2E) systems. Connectionist Temporal Classification (CTC), Attention Encoder-Decoder (AED), and RNN Transducer (RNN-T) are the most popular three methods. Among these three methods, RNN-T has the advantages to do online streaming which is challenging to AED and it doesn't have CTC's frame-independence assumption. In this paper, we improve the RNN-T training in two aspects. First, we optimize the training algorithm of RNN-T to reduce the memory consumption so that we can have larger training minibatch for faster training speed. Second, we propose better model structures so that we obtain RNN-T models with the very good accuracy but small footprint. Trained with 30 thousand hours anonymized and transcribed Microsoft production data, the best RNN-T model with even smaller model size (216 Megabytes) achieves up-to 11.8% relative word error rate (WER) reduction from the baseline RNN-T model. This best RNN-T model is significantly better than the device hybrid model with similar size by achieving up-to 15.0% relative WER reduction, and obtains similar WERs as the server hybrid model of 5120 Megabytes in size.

研究の動機と目的

  • RNN-Tトレーニング中のメモリ消費量を低減し、より大きなミニバッチサイズと高速なトレーニングを可能にする。
  • ベースラインのLSTMに基づくRNN-Tよりも、より正確でコンactなRNN-Tモデルアーキテクチャを設計する。
  • リソース制約のあるデバイスへのデプロイに適した、高精度で低フットプリントのRNN-Tモデルを実現する。
  • 将来の文脈のアンロックとレイヤートレジャリー設計がRNN-T性能に与える影響を調査する。

提案手法

  • 大きな中間テンソルを保存しないために、勾配計算を見直し、RNN-Tの逆伝播中におけるメモリ使用量を顕著に削減した。
  • ecltGRUアーキテクチャを提案した。これは、深さ方向と時間方向のLSTM/GRUユニットを用いて、時系列モデリングと分類タスクを分離する。
  • レイヤートレジャリーの概念を導入し、分類タスクと時系列モデリングを分離することで、表現効率を向上させた。
  • エンコーダーと予測ネットワークの出力を結合するために、学習可能な投影行列U、Vと非線形活性化関数ψを用いたジョイントネットワークを採用した。
  • 推論コストを削減するため、フレームスキッピング(2倍の要因)を適用し、入力フレームを20msに短縮した。
  • ビーム幅10のビームサーチデコードを用いて、30,000時間の匿名化されたマイクロソフト生産データ上でモデルをトレーニングした。

実験結果

リサーチクエスチョン

  • RQ1メモリ最適化されたRNN-Tトレーニングは、より大きなミニバッチサイズと高速な収束を可能にするか?
  • RQ2標準のLSTMユニットにecltGRUのような新規アーキテクチャを採用することで、RNN-Tの精度とモデル効率が向上するか?
  • RQ3エンコーダーにおける将来の文脈アンロックは、アライメント遅延をどれほど低減し、認識性能を向上させるか?
  • RQ4提案されたRNN-Tモデルは、同程度のフットプリントを持つハイブリッドモデルと比較して、精度とサイズの点でどの程度優れているか?

主な発見

  • ecltGRUをエンコーダーに、GRUを予測ネットワークに使用した最良のRNN-Tモデルは、ベースラインのLSTMに基づくRNN-Tモデルに対して11.8%相対的な語誤り率(WER)を削減した。
  • この最良のモデルは、モデルサイズがわずか216 MBにとどまり、ベースラインRNN-Tモデルよりも小さい一方で、同サイズのデバイスハイブリッドモデルを15.0%相対的に上回った。
  • RNN-Tモデルは、非常に大きなフットプリント(5.12 GB言語モデル)を持つサーバハイブリッドモデルと同等のWER性能を達成したが、はるかに小さいフットプリントであった。
  • ecltGRUエンコーダーにより、平均アライメント遅延が10入力フレーム(300ms)から2入力フレーム(60ms)に低下し、24フレームの将来アンロックを用いた早期意思決定が向上した。
  • メモリ最適化により、より大きなミニバッチサイズが可能になり、モデル品質に compromise をきたさずにトレーニングが高速化された。
  • レイヤートレジャリーの使用とecltGRUにおける分離された深さ・時間ユニットにより、標準のLSTMよりも高い精度とより小さなモデルサイズが実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。