[論文レビュー] Developing Real-time Streaming Transformer Transducer for Speech Recognition on Large-scale Dataset
本論文は、大規模な音声認識のためのリアルタイムストリーミングTransformer Transducer (T-T)およびConformer Transducer (C-T)モデルを提案する。Transformer-XLとチャンク別処理を組み合わせることで、精度を損なわず低遅延推論を実現する。CPU上で0.25のリアルタイム要因(RTF)を達成し、360msの先行予測を伴う。RNN-TやストリーミングTransformer AEDモデルを10%以上の相対的WER改善で上回り、計算効率も高い。
Recently, Transformer based end-to-end models have achieved great success in many areas including speech recognition. However, compared to LSTM models, the heavy computational cost of the Transformer during inference is a key issue to prevent their applications. In this work, we explored the potential of Transformer Transducer (T-T) models for the fist pass decoding with low latency and fast speed on a large-scale dataset. We combine the idea of Transformer-XL and chunk-wise streaming processing to design a streamable Transformer Transducer model. We demonstrate that T-T outperforms the hybrid model, RNN Transducer (RNN-T), and streamable Transformer attention-based encoder-decoder model in the streaming scenario. Furthermore, the runtime cost and latency can be optimized with a relatively small look-ahead.
研究の動機と目的
- ストリーミング音声認識におけるTransformer Transducer (T-T)モデルの高い計算コストと遅延を解決する。
- 低遅延かつ高精度を実現する大規模データセットにおけるリアルタイム推論を可能にする。
- ストリーミングASRシステムにおける訓練効率、実行時コスト、モデル性能のバランスを図る。
- 時間制限付きマスキング、チャンク別処理、メモリベースのアプローチといった、従来のストリーミング手法の制限を克服する。
提案手法
- Transformer-XLの再帰的メカニズムとチャンク別ストリーミング処理を統合し、文脈依存性を制限し、遅延の増大を抑える。
- 固定された履歴長(例:60フレーム)を用いて訓練効率を維持し、重複するチャンクを回避する。
- 小さな先行予測(例:24フレーム、720ms)を適用し、自然なチャンク別デコードを可能にし、遅延を低減する。
- TransformerエンコーダとLSTM予測器を組み合わせたハイブリッドアーキテクチャを採用し、速度と精度のバランスを図る。
- 32台のV100 GPUを用いて混合精度学習を実施し、65,000時間の学習を2日で完了する。
- INT8量子化を適用し、特にCPU上での推論を高速化し、WERの低下を最小限に抑える。
実験結果
リサーチクエスチョン
- RQ1ストリーミングTransformer Transducerモデルは、大規模な音声認識データセットにおいて、低遅延でリアルタイム推論を達成できるか?
- RQ2Transformer-XLとチャンク別処理を組み合わせることで、T-Tモデルにおける遅延と計算効率がどのように向上するか?
- RQ3ストリーミングT-TおよびC-Tモデルに小さな先行予測を導入した場合、遅延、推論速度、精度のトレードオフはいかなるものか?
- RQ4INT8量子化は、ストリーミングT-TおよびC-TモデルのCPU上での推論を顕著に高速化できるか、性能劣化は最小限に抑えられるか?
主な発見
- T-TおよびC-Tは、ハイブリッドモデル、RNN-T、ストリーミングTransformer AEDモデルを10%以上の相対的WER改善で上回る。
- 360msの先行予測を伴うT-Tは、CPU上で0.25のリアルタイム要因(RTF)を達成し、産業用途のリアルタイム要件を満たす。
- 60フレームの履歴と24フレームの先行予測を用いたT-Tは、4スレッドで8.28% WER、0.16 RTFを達成し、精度と効率の両面でRNN-Tを上回る。
- INT8量子化により、RNN-Tで3.6倍、T-TおよびC-Tで約2倍の速度向上が得られ、T-Tでは僅か0.22%のWER劣化にとどまる。
- 小さな先行予測でも、ほぼオフライン性能(7.78% WER)を維持しており、全発話推論と比較して精度の低下が最小限であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。