Skip to main content
QUICK REVIEW

[論文レビュー] Developing Real-time Streaming Transformer Transducer for Speech Recognition on Large-scale Dataset

Xie Chen, Yu Wu|arXiv (Cornell University)|Oct 22, 2020
Speech Recognition and Synthesis参考文献 34被引用数 9
ひとこと要約

本論文は、大規模な音声認識のためのリアルタイムストリーミングTransformer Transducer (T-T)およびConformer Transducer (C-T)モデルを提案する。Transformer-XLとチャンク別処理を組み合わせることで、精度を損なわず低遅延推論を実現する。CPU上で0.25のリアルタイム要因(RTF)を達成し、360msの先行予測を伴う。RNN-TやストリーミングTransformer AEDモデルを10%以上の相対的WER改善で上回り、計算効率も高い。

ABSTRACT

Recently, Transformer based end-to-end models have achieved great success in many areas including speech recognition. However, compared to LSTM models, the heavy computational cost of the Transformer during inference is a key issue to prevent their applications. In this work, we explored the potential of Transformer Transducer (T-T) models for the fist pass decoding with low latency and fast speed on a large-scale dataset. We combine the idea of Transformer-XL and chunk-wise streaming processing to design a streamable Transformer Transducer model. We demonstrate that T-T outperforms the hybrid model, RNN Transducer (RNN-T), and streamable Transformer attention-based encoder-decoder model in the streaming scenario. Furthermore, the runtime cost and latency can be optimized with a relatively small look-ahead.

研究の動機と目的

  • ストリーミング音声認識におけるTransformer Transducer (T-T)モデルの高い計算コストと遅延を解決する。
  • 低遅延かつ高精度を実現する大規模データセットにおけるリアルタイム推論を可能にする。
  • ストリーミングASRシステムにおける訓練効率、実行時コスト、モデル性能のバランスを図る。
  • 時間制限付きマスキング、チャンク別処理、メモリベースのアプローチといった、従来のストリーミング手法の制限を克服する。

提案手法

  • Transformer-XLの再帰的メカニズムとチャンク別ストリーミング処理を統合し、文脈依存性を制限し、遅延の増大を抑える。
  • 固定された履歴長(例:60フレーム)を用いて訓練効率を維持し、重複するチャンクを回避する。
  • 小さな先行予測(例:24フレーム、720ms)を適用し、自然なチャンク別デコードを可能にし、遅延を低減する。
  • TransformerエンコーダとLSTM予測器を組み合わせたハイブリッドアーキテクチャを採用し、速度と精度のバランスを図る。
  • 32台のV100 GPUを用いて混合精度学習を実施し、65,000時間の学習を2日で完了する。
  • INT8量子化を適用し、特にCPU上での推論を高速化し、WERの低下を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1ストリーミングTransformer Transducerモデルは、大規模な音声認識データセットにおいて、低遅延でリアルタイム推論を達成できるか?
  • RQ2Transformer-XLとチャンク別処理を組み合わせることで、T-Tモデルにおける遅延と計算効率がどのように向上するか?
  • RQ3ストリーミングT-TおよびC-Tモデルに小さな先行予測を導入した場合、遅延、推論速度、精度のトレードオフはいかなるものか?
  • RQ4INT8量子化は、ストリーミングT-TおよびC-TモデルのCPU上での推論を顕著に高速化できるか、性能劣化は最小限に抑えられるか?

主な発見

  • T-TおよびC-Tは、ハイブリッドモデル、RNN-T、ストリーミングTransformer AEDモデルを10%以上の相対的WER改善で上回る。
  • 360msの先行予測を伴うT-Tは、CPU上で0.25のリアルタイム要因(RTF)を達成し、産業用途のリアルタイム要件を満たす。
  • 60フレームの履歴と24フレームの先行予測を用いたT-Tは、4スレッドで8.28% WER、0.16 RTFを達成し、精度と効率の両面でRNN-Tを上回る。
  • INT8量子化により、RNN-Tで3.6倍、T-TおよびC-Tで約2倍の速度向上が得られ、T-Tでは僅か0.22%のWER劣化にとどまる。
  • 小さな先行予測でも、ほぼオフライン性能(7.78% WER)を維持しており、全発話推論と比較して精度の低下が最小限であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。