[論文レビュー] FastEmit: Low-latency Streaming ASR with Sequence-level Emission Regularization
FastEmit は、語のアライメントを必要とせず、追加の学習や推論コストなしに遅延を低減する、ストリーミング端末からエンドツーエンド ASR のためのシーケンスレベル発射正則化手法である。LibriSpeech において、遅延を 150–300ms 減少させ、WER を 4.4%/8.9% から 3.1%/7.5% に改善する。ハイパーパrameter のチューニングも最小限で、追加の計算コストなしに実現される。
Streaming automatic speech recognition (ASR) aims to emit each hypothesized word as quickly and accurately as possible. However, emitting fast without degrading quality, as measured by word error rate (WER), is highly challenging. Existing approaches including Early and Late Penalties and Constrained Alignments penalize emission delay by manipulating per-token or per-frame probability prediction in sequence transducer models. While being successful in reducing delay, these approaches suffer from significant accuracy regression and also require additional word alignment information from an existing model. In this work, we propose a sequence-level emission regularization method, named FastEmit, that applies latency regularization directly on per-sequence probability in training transducer models, and does not require any alignment. We demonstrate that FastEmit is more suitable to the sequence-level optimization of transducer models for streaming ASR by applying it on various end-to-end streaming ASR networks including RNN-Transducer, Transformer-Transducer, ConvNet-Transducer and Conformer-Transducer. We achieve 150-300 ms latency reduction with significantly better accuracy over previous techniques on a Voice Search test set. FastEmit also improves streaming ASR accuracy from 4.4%/8.9% to 3.1%/7.5% WER, meanwhile reduces 90th percentile latency from 210 ms to only 30 ms on LibriSpeech.
研究の動機と目的
- 正確なトランスダクタ訓練がなされているにもかかわらず、ストリーミングエンドツーエンド ASR モデルにおける高い発射遅延の課題に対処すること。
- Early/Late Penalties や Constrained Alignments といった従来手法で生じる、トークンごとまたはフレームごとの発射ペナルティによる精度の低下を克服すること。
- トランスダクタの最適化と整合性を持つシーケンスレベルの正則化手法を開発し、精度を損なわず遅延を低減すること。
- RNN-T、Transformer-T、ConvNet-T、Conformer-T など、多様なストリーミング ASR アーキテクチャに即座に統合可能なプラグアンドプレイの統合を可能にすること。
- 最小限のハイパーパrameterチューニングと、学習時および推論時の追加計算コストなしに、低遅延推論を実現すること。
提案手法
- 全シーケンスにわたってブランクトークンの発射を抑制するように、トランサクタのフォワードバックワードアルゴリズムを変更するシーケンスレベル正則化損失を導入する。
- ラティス内での非ブランクトークンの負の対数確率に比例する正則化項を適用し、ターゲット語の早期発射を促進する。
- 標準的なトランサクタ損失と発射正則化損失を、1つのハイパーパrameter λ を用いてバランスさせる。
- 結合損失を用いてモデルをエンドツーエンドで学習させ、正則化が直接的にシーケンスレベルの確率分布に作用するようにする。
- 外部の語アライメントや事前学習モデルに依存しないようにし、あらゆるトランサクタベースのモデルと互換性を持つようにする。
- 最小限のハイパーパrameterチューニング(λ のみを調整)により、異なるモデルやデータセットへの容易な展開を可能にする。

実験結果
リサーチクエスチョン
- RQ1シーケンスレベルの発射正則化は、認識精度を損なわずストリーミング ASR の遅延を低減できるか?
- RQ2Early/Late Penalties や Constrained Alignments といった、トークンごとまたはフレームごとの正則化手法と比較して、FastEmit は WER と遅延の両面で優れているか?
- RQ3FastEmit は RNN-T、Transformer-T、ConvNet-T、Conformer-T といった多様なストリーミング ASR アーキテクチャに一般化可能か?
- RQ4ハイパーパrameter λ を用いた場合、遅延低減と精度保持の最適なバランスはどのようになるか?
- RQ5FastEmit は語レベルのアライメントを必要とせず、追加の学習・推論コストなしに適用可能か?
主な発見
- LibriSpeech において、FastEmit はテストクリーンセットで 90パーセンタイルの遅延を 210ms から 30ms に低減し、WER を 4.4% から 3.1% に改善した。テストオザー設定では、WER を 8.9% から 7.5% に改善した。
- ボイスサーチテストセットでは、RNN-T、Transformer-T、Conformer-T モデルにおいて、FastEmit が 150–300ms の遅延低減を達成し、CA や MaskFrame ベースラインよりも WER-遅延トレードオフで優れた性能を示した。
- FastEmit は、長時間のトランスダクションにおける勾配消失の問題を緩和することで、LibriSpeech での認識精度を向上させ、削除誤りを減少させたと推定される。
- ハイパーパrameterチューニングの結果、ContextNet では λ=0.01、Conformer では λ=0.004 が最適な遅延-精度バランスをもたらし、λ のさらなる増加は WER の悪化を引き起こした。
- FastEmit は RNN-Transducer、Transformer-Transducer、ConvNet-Transducer、Conformer-Transducer など、複数のアーキテクチャに効果的に一般化された。
- この手法は外部のアライメントデータを必要とせず、学習時および推論時の追加コストも発生しないため、生産環境での展開に非常に適している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。