Skip to main content
QUICK REVIEW

[論文レビュー] Simplified End-to-End MMI Training and Voting for ASR

Lior Fritz, David Burshtein|arXiv (Cornell University)|Mar 30, 2017
Speech Recognition and Synthesis参考文献 27被引用数 6
ひとこと要約

本論文は、簡素化されたエンドツーエンドASRシステムを提案する。最大相互情報量(MMI)学習と軽量言語モデルを用い、CTCと同様に勾配ベースの直接学習を可能にする。CTCとは異なり、高品質なアライメントを生成し、複数の独立して学習されたモデルの予測を平均するという単純なアンサンブル手法を可能にする。WSJ eval92では23%の相対的語誤り率(WER)削減、dev93では18.63%の削減を達成し、デコードが高速化され、デコーダーのグラフサイズも43%小さくなる。

ABSTRACT

A simplified speech recognition system that uses the maximum mutual information (MMI) criterion is considered. End-to-end training using gradient descent is suggested, similarly to the training of connectionist temporal classification (CTC). We use an MMI criterion with a simple language model in the training stage, and a standard HMM decoder. Our method compares favorably to CTC in terms of performance, robustness, decoding time, disk footprint and quality of alignments. The good alignments enable the use of a straightforward ensemble method, obtained by simply averaging the predictions of several neural network models, that were trained separately end-to-end. The ensemble method yields a considerable reduction in the word error rate.

研究の動機と目的

  • 複雑なハイブリッドHMM-DNNシステムに代わる、直接的なMMI基準を用いたエンドツーエンドASR学習の簡素化。
  • CTCと比較して、効果的なモデルアンサンブルに不可欠なアライメント品質の向上。
  • 独立して学習されたモデルの予測を平均するという単純で効果的なアンサンブル手法の実現。
  • CTCおよびハイブリッドシステムと比較して、デコード時間とディスク容量の削減。
  • エンドツーエンド学習と標準的なHMMデコーダーを維持しつつ、CTCと同等の性能を達成すること。

提案手法

  • CTCに類似した、1状態で文脈に依存しない発音HMMに、語の間にブランク状態を設ける。
  • 学習中に単純なn-gram言語モデルを用いてMMI基準に基づく目的関数を定式化する。
  • HMM-GMMシステムの事前学習を回避し、勾配降下法によるエンドツーエンド学習を実施する。
  • 標準的なHMMデコーダー(WFSTを用いて)を用いてデコードを行い、モデルが生成する信頼性の高いアライメントを活用する。
  • 複数の独立して学習されたDNNの出力ポストリアルを平均する投票方式によりアンサンブルを形成する。
  • 言語モデルをMMI目的関数に統合し、ネットワークがより正確な変換を学習するように導く。

実験結果

リサーチクエスチョン

  • RQ1簡素化されたエンドツーエンドMMI学習法は、学習の簡素さを保ちつつ、CTCを上回る性能を達成できるか?
  • RQ2提案手法はCTCよりも信頼性の高いアライメントを生成するのか? これにより、効果的なモデル平均化が可能になるか?
  • RQ3出力ポストリアルの平均化に基づく単純な投票方式は、より複雑なデコーディング手順を要するCTCアンサンブルを上回る性能を発揮できるか?
  • RQ4CTCおよびハイブリッドシステムと比較して、デコード時間とディスク容量はどの程度削減されるか?
  • RQ5MMI目的関数に軽量言語モデルを統合することで、認識精度にどのような影響を与えるか?

主な発見

  • 提案手法EEMMIは、単一モデルと比較してWSJ eval92で23%の相対的WER削減を達成し、WERは4.22%にまで低下した。
  • dev93では、アンサンブルによりWERが18.63%削減され、WERは7.34%にまで低下した。
  • CTCと比較してデコーダーのグラフサイズを43%削減し、ディスク容量を顕著に低減した。
  • デコードはCTCの1.38倍高速で、リアルタイム要因は0.0179(CTCは0.0247)であった。
  • アライメント品質が顕著に向上しており、アンサンブルにおけるポストリアル分散の低減が確認され、効果的な平均化が可能となった。
  • より複雑なデコーディング手順を要するCTCアンサンブルと比較して、単純な投票方式が優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。