Skip to main content
QUICK REVIEW

[論文レビュー] A comparison of end-to-end models for long-form speech recognition

Chung‐Cheng Chiu, Wei Han|arXiv (Cornell University)|Nov 6, 2019
Speech Recognition and Synthesis参考文献 13被引用数 13
ひとこと要約

この論文は、長時間音声認識のためのエンドツーエンドモデル——特にRNN-Tとさまざまなアテンションベースのアーキテクチャ——を比較している。標準的なアテンションモデルは、長時間の発話に対して一般化が悪いことから、性能を発揮できないが、モノトニックアテンションとオーバーラップするセグメンテーションデコードを組み合わせることで、RNN-Tと同等の性能を達成できることが判明した。RNN-Tは、長時間データに対して標準で頑健であることが確認された。

ABSTRACT

End-to-end automatic speech recognition (ASR) models, including both attention-based models and the recurrent neural network transducer (RNN-T), have shown superior performance compared to conventional systems. However, previous studies have focused primarily on short utterances that typically last for just a few seconds or, at most, a few tens of seconds. Whether such architectures are practical on long utterances that last from minutes to hours remains an open question. In this paper, we both investigate and improve the performance of end-to-end models on long-form transcription. We first present an empirical comparison of different end-to-end models on a real world long-form task and demonstrate that the RNN-T model is much more robust than attention-based systems in this regime. We next explore two improvements to attention-based systems that significantly improve its performance: restricting the attention to be monotonic, and applying a novel decoding algorithm that breaks long utterances into shorter overlapping segments. Combining these two improvements, we show that attention-based end-to-end models can be very competitive to RNN-T on long-form speech recognition.

研究の動機と目的

  • 実世界の長時間音声認識タスクにおけるエンドツーエンドASRモデルの性能を評価すること、特に短い発話にとどまらない一般化性能に焦点を当てる。
  • 標準的なアテンションベースのモデルが長時間音声に対してなぜ性能を発揮できないのか、特に高い削除誤り率の要因を調査すること。
  • アーキテクチャ的およびデコード法の変更を通じて、長時間音声認識のためのアテンションベースのモデルを改善すること。
  • アテンションベースのモデルが長時間音声変換タスクでRNN-Tと同等の性能を達成できるかどうかを特定すること。

提案手法

  • YouTube動画のトランスクリプトを用いて、実世界の長時間ASRタスクにおいてRNN-Tと複数のアテンションベースのモデル(ソフトアテンション、モノトニックアテンション、MoChA、MILk、GMMモノトニック)を実験的に比較する。
  • 音声特徴とトランスクリプトの系列間の整合性を強制するために、アテンション機構にモノトニック性制約を適用する。
  • 長時間発話をオーバーラップするチャンクに分割することで、境界部でのコンテキスト損失を防ぐ、新しいオーバーラップセグメンテーションデコード戦略を実装する。
  • アライメントの安定性を高め、誤差率を低下させるために、5つの混合素子を用いたGMMベースのモノトニックアテンションモデルを採用する。
  • MILkモデルにおいて、遅延に配慮した損失関数を適用し、トークンの発行を早期かつ一貫性を持って促進する。
  • すべてのモデルを双方向LSTM(1024ユニット)で学習し、公平な比較のためRNN-Tアーキテクチャを共有する。TensorFlow-Lingvoを用いて最適化されたトレーニングを実施する。

実験結果

リサーチクエスチョン

  • RQ1標準的なエンドツーエンドモデル、特にアテンションベースのモデルは、RNN-Tと比較して長時間音声認識においてどのように性能を発揮するか?
  • RQ2アテンションベースのモデルが長時間発話に一般化できない理由は何か?観察される主な誤りタイプは何か?
  • RQ3モノトニックアテンションは、長時間ASRにおけるアテンションベースのモデルの頑健性をどの程度向上させられるか?
  • RQ4オーバーラップセグメンテーションデコードは、長時間発話処理におけるコンテキスト損失を緩和できるか?
  • RQ5モノトニックアテンションとオーバーラップデコードの組み合わせにより、アテンションベースのモデルはRNN-Tと同等の性能を長時間タスクで達成できるか?

主な発見

  • RNN-Tモデルは、長時間音声認識において最良のWERを達成し、長時間発話への頑健さとスケーラビリティを示した。
  • 標準的なソフトアテンションモデルは、長時間データにおいて著しい性能低下を示し、WERが67.1にまで上昇した。これは主に63.2件の削除誤りに起因する。
  • アテンションベースのモデルの中で、GMMベースのモノトニックアテンションモデルが最も優れた性能を示した(ただしRNN-Tよりは劣る)。これはモノトニック性が有効であるが、単独では不十分であることを示している。
  • オーバーラップセグメンテーションデコードは、性能向上に顕著な効果を示した。16秒のセグメントでは、非オーバーラップセグメンテーションと比較してWERの損失が減少し、RNN-Tはセグメント化時でもわずか10%の相対的劣化にとどまった。
  • モノトニックアテンションとオーバーラップデコードの組み合わせにより、最良のアテンションベースのモデル(MILk)が、長時間タスクでRNN-Tと同等の性能を達成した。
  • RNN-Tモデルは、長時間発話をセグメント化しても高い品質を維持しているが、アテンションモデルはオーバーラップデコードなしではコンテキスト損失を被る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。