Skip to main content
QUICK REVIEW

[論文レビュー] Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability

Jinyu Li, Rui Zhao|arXiv (Cornell University)|Jul 30, 2020
Speech Recognition and Synthesis参考文献 36被引用数 5
ひとこと要約

この論文では、最適化されたトレーニング、改善された初期化、および将来のラックアラウンドを用いた高度なモデリングにより、最先端のハイブリッドASRシステムを上回る高精度なRNN-Tモデルを提示している。テキストのみのデータを用いてTTSによって生成された音声を用いて予測ネットワークおよび結合ネットワークのみをファインチューニングすることで、実行時推論のオーバーヘッドなしに顕著な相対的WER削減を達成し、LMリスコアリングやスペルチェック手法を上回っている。

ABSTRACT

Because of its streaming nature, recurrent neural network transducer (RNN-T) is a very promising end-to-end (E2E) model that may replace the popular hybrid model for automatic speech recognition. In this paper, we describe our recent development of RNN-T models with reduced GPU memory consumption during training, better initialization strategy, and advanced encoder modeling with future lookahead. When trained with Microsoft's 65 thousand hours of anonymized training data, the developed RNN-T model surpasses a very well trained hybrid model with both better recognition accuracy and lower latency. We further study how to customize RNN-T models to a new domain, which is important for deploying E2E models to practical scenarios. By comparing several methods leveraging text-only data in the new domain, we found that updating RNN-T's prediction and joint networks using text-to-speech generated from domain-specific text is the most effective.

研究の動機と目的

  • 3段階最適化と高度な音声モデリングを用いて、高精度なハイブリッドASRシステムを上回る性能を発揮するRNN-Tモデルの開発。
  • 最適化されたワードピeceトークン化とメモリ構成により、RNN-Tトレーニング中のGPUメモリ消費量を低減すること。
  • エンコーダーにおける交差エントロピー初期化と将来のコンテキストモデリングを用いて、RNN-T認識精度を向上させること。
  • 音声のトランスクリプションを必要とせず、ドメイン固有のテキストデータのみを用いてRNN-Tモデルをカスタマイズする有効な手法の調査。
  • エンドツーエンドASRにおけるドメイン適応において、TTSベースの適応、スペルチェック、LMリスコアリング、データ混合の有効性を比較すること。

提案手法

  • スペーストークンをアンダースコアマークに置き換えることでGPUメモリ使用量を削減し、ワードピeceユニット(WPU)の分解回数をほぼ半減させた。
  • 時間的に整合された音声特徴量とWPUトランスクリプションを用いた交差エントロピー(CE)トレーニングにより、エンコーダーを初期化することで、トレーニングの安定性と精度を向上させた。
  • エンコーダーに2フレーム分の将来のラックアラウンドを導入し、文脈に依存する表現を可能にすることで、変換性能を向上させた。
  • ドメイン固有のテキストデータから合成されたTTS音声を生成し、予測ネットワークおよび結合ネットワークのみをファインチューニングすることで、RNN-Tモデルのカスタマイズを実現した。
  • 代替のカスタマイズ手法を評価した:LSTM-LMを用いたLMリスコアリング、変換器ベースのモデルによるスペルチェック、実音声データとTTSデータの混合。
  • より良いスペルチェックのためのWER低減を実現するため、大規模なテキストで事前学習されたRoBERTaを用い、非事前学習バージョンよりも優れた性能を達成した。

実験結果

リサーチクエスチョン

  • RQ1最適化された初期化と将来のコンテキストモデリングを用いたRNN-Tモデルは、精度とレイテンシーの両面で、高パフォーマンスなハイブリッドASRシステムを上回ることができるか?
  • RQ2音声のトランスクリプションが利用できない状況において、ドメイン固有のテキストデータのみを用いたTTSベースのデータ拡張は、RNN-Tモデルのドメイン適応にどの程度効果的か?
  • RQ3ドメイン固有のテキストから生成されたTTS音声を用いて予測ネットワークおよび結合ネットワークのみをファインチューニングする方法は、LMリスコアリングやスペルチェックといった追加の推論時コンponentsを必要とする手法を上回るか?
  • RQ4低リソースドメイン環境において、実音声データとTTS生成データを組み合わせることで、モデル適応にどのような影響を与えるか?
  • RQ5大規模なテキスト(例:RoBERTa)で事前学習することで、RNN-T適応に用いられるスペルチェックモデルの性能はどの程度向上するか?

主な発見

  • CE初期化と2フレーム分のラックアラウンドを備えたRNN-Tモデルは、ベースラインと比較して11.6%の相対的WER低減を達成し、最良のハイブリッドモデルを3.1%相対的に上回った。
  • 最終的なRNN-Tモデルは、最良のハイブリッドモデルと比較してエンコーダーのラックアラウンドレイテンシーを120 ms低減し、ストリーミング効率の向上を示した。
  • ドメイン固有のテキストから生成されたTTS音声を用いて予測ネットワークおよび結合ネットワークのみをファインチューニングすることで、1280p640x6、1600p800_4x6、2560p800_4x6モデルそれぞれで7.9%、7.2%、9.8%の相対的WER低減が達成された。
  • TTSオンリーアダプテーション手法は、実音声とTTSデータを混合する手法を上回った。これは、十分なテキストデータが存在する限り、追加の実データがなくてもモデル適応が効果的に行えることを示している。
  • ドメインテキストで微調整されたRoBERTaを用いたスペルチェックは、1280p640x6および1600p800_4x6モデルでそれぞれ7.9%および6.1%の相対的WER低減を達成し、非事前学習バージョンを上回った。
  • ドメイン固有のLSTM-LMを用いたLMリスコアリングは、3.9%および1.6%の相対的WER低減を達成したが、追加の実行時計算を要するのに対し、パラメータ効率の高いTTSベースの適応手法はその必要がなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。