Skip to main content
QUICK REVIEW

[論文レビュー] Minimum Bayes Risk Training of RNN-Transducer for End-to-End Speech Recognition

Chao Weng, Chengzhu Yu|arXiv (Cornell University)|Nov 28, 2019
Speech Recognition and Synthesis参考文献 33被引用数 16
ひとこと要約

本論文は、端末対端末の音声認識におけるRNN-Transducer (RNN-T) モデルに対して、最小ベイズリスク (MBR) 学習を提案し、参照発話とリアルタイムで生成されたN-best仮説の間の期待編集距離を最適化する。この手法は文字誤り率 (CER) を顕著に改善し、強力な畳み込みおよびトランスフォーマー基盤のRNN-Tベースラインに対して、読み取り文脈で1.2%、会話的文脈で0.5%の絶対的低下を達成する。外部ニューラル言語モデル (NNLM) を組み合わせることでさらなる向上が得られる。

ABSTRACT

In this work, we propose minimum Bayes risk (MBR) training of RNN-Transducer (RNN-T) for end-to-end speech recognition. Specifically, initialized with a RNN-T trained model, MBR training is conducted via minimizing the expected edit distance between the reference label sequence and on-the-fly generated N-best hypothesis. We also introduce a heuristic to incorporate an external neural network language model (NNLM) in RNN-T beam search decoding and explore MBR training with the external NNLM. Experimental results demonstrate an MBR trained model outperforms a RNN-T trained model substantially and further improvements can be achieved if trained with an external NNLM. Our best MBR trained system achieves absolute character error rate (CER) reductions of 1.2% and 0.5% on read and spontaneous Mandarin speech respectively over a strong convolution and transformer based RNN-T baseline trained on ~21,000 hours of speech.

研究の動機と目的

  • 参照発話の品質を直接最適化するための判別的学習アプローチをRNN-Tに開発すること。
  • 他のASRフレームワークで成功を収めたMBR学習がRNN-Tシステムでは未だ実装されていないという課題を解決すること。
  • ビームサーチデコードとMBR学習への外部ニューラル言語モデル (NNLM) の統合を検討し、より高い耐障害性と正確性を実現すること。
  • N-best仮説生成を伴うMBR学習が、大規模な中国語音声データセットにおいて標準的なRNN-T学習よりも優れた性能を示すことを実証すること。

提案手法

  • 最適化の安定性を確保するため、事前学習済みRNN-Tモデルを用いてMBR学習を初期化する。
  • ビームサイズ8でビームサーチを用い、モデルの出力分布からサンプリングすることで、学習中にN-best仮説を生成する。
  • 参照発話とN-best仮説の間の期待編集距離を、MBR目的関数として計算する。
  • 訓練の安定性を保ちつつN-best生成の遅延を防ぐために、MBR損失と標準的なRNN-T損失を組み合わせた正則化損失(λ = 1.0)を適用する。
  • 固定の補間重みλ = 0.1を用いて、対数確率補間によるヒューリスティックを導入し、ビームサーチデコード中に外部NNLMを統合する。
  • 外部NNLMを併用するかしないかにかかわらず、音声認識部と言語モデル部の両方をエンドツーエンドで最適化可能なMBRモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1MBR学習をRNN-Tモデルに効果的に適用することで、自動音声認識性能の向上が達成可能か?
  • RQ2ビームサーチデコード中に外部ニューラル言語モデル (NNLM) を統合することで、MBR学習の成果が向上するか?
  • RQ3外部NNLMを併用した共同学習が、MBR最適化RNN-Tモデルの文字誤り率 (CER) 減少に与える影響は何か?
  • RQ4読み取りおよび会話的音声の両方において、MBR学習は標準的なRNN-T学習と比較して収束性および耐障害性に優れているか?

主な発見

  • MBRで最適化されたRNN-Tモデルは、強力な畳み込みおよびトランスフォーマー基盤のRNN-Tベースラインと比較して、読み取り中国語音声セットで1.2%、会話的音声セットで0.5%の絶対的CER低下を達成した。
  • 外部NNLMを一切使用しないMBR学習でも、デコード時に外部NNLMを用いたベースラインRNN-Tモデルを上回る性能を示した。
  • 外部NNLMを学習およびデコードの両方で使用した場合、MBRモデルは読み取りセットでCERを5.0%、会話的セットで14.9%まで低下させた。
  • デコード時にβ = 0.8のソフトマックススムージングを適用することで、読み取りセットのCERは6.5%から6.2%へ、会話的セットでは15.6%から15.4%へ低下した。
  • シャロウフュージョンによる外部NNLMの適用により、ベースラインRNN-Tモデルでは読み取りセットでCERが0.5%、会話的セットで0.1%低下した。
  • 標準RNN-T損失との正則化(λ = 1.0)により、N-best生成の著しい遅延が抑制され、訓練効率が維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。