Skip to main content
QUICK REVIEW

[論文レビュー] Improving the Performance of Online Neural Transducer Models

Tara N. Sainath, Chung‐Cheng Chiu|arXiv (Cornell University)|Dec 5, 2017
Topic Modeling参考文献 18被引用数 6
ひとこと要約

この論文は、事前学習されたLASモデルからの初期化、wordpiecesおよび外部LM融合による強力な言語モデルの統合、および前方および後方の注目窓の拡張により、ストリーミング音声認識のためのオンラインニューラルトランスダーアイモデルを改善する。これらの改善により、300msの遅延(チャンクサイズ5)を有するNTは、非ストリーミングLASの性能と1%相対WER以内に収まり、リアルタイムアプリケーションに適したままその正確性を維持する。

ABSTRACT

Having a sequence-to-sequence model which can operate in an online fashion is important for streaming applications such as Voice Search. Neural transducer is a streaming sequence-to-sequence model, but has shown a significant degradation in performance compared to non-streaming models such as Listen, Attend and Spell (LAS). In this paper, we present various improvements to NT. Specifically, we look at increasing the window over which NT computes attention, mainly by looking backwards in time so the model still remains online. In addition, we explore initializing a NT model from a LAS-trained model so that it is guided with a better alignment. Finally, we explore including stronger language models such as using wordpiece models, and applying an external LM during the beam search. On a Voice Search task, we find with these improvements we can get NT to match the performance of LAS.

研究の動機と目的

  • ストリーミング音声認識において、ストリーミングNTモデルと非ストリーミングフルシーケンスモデル(例:LAS)との間の性能格差を埋めること。
  • 低遅延を維持しつつLASレベルの正確性を達成できるように、NTのアーキテクチャ的および学習的改善を調査すること。
  • 特にワードピeceおよび外部言語モデルを含む、より強力な言語モデリングがNTの性能に与える影響を評価すること。
  • LASモデルからの事前学習が、NTの収束性および最終的な性能を向上させるかどうかを検証すること。
  • LASと比較してNTで性能低下が生じる主な要因、特に言語モデリングエラーを特定すること。

提案手法

  • NTの注目窓を、以前のチャンクの注目(look-back)および5フレーム分の前方注目(look-ahead)に拡張し、両者とも追加の遅延を発生させない。
  • NTモデルの重みを事前学習済みLASモデルから初期化することで、より良いアライメントの監視と高速な収束を実現する。
  • 語彙素子単位をワードピース(WPM)に置き換えることで、デコーダー内での言語モデルの能力を強化する。
  • 浅い統合を用いて外部n-gram FST言語モデルとNTシステムを統合し、言語モデリングを改善する。
  • LASおよびNTモデルの両方でマルチヘッド注目を用いることで、表現学習および注目ダイナミクスを向上させる。
  • 12,500時間のボイスサーチデータセット上で、チャンクサイズ5(300ms)および10(450ms)を用いてモデルを学習・評価し、遅延と性能のトレードオフを評価する。

実験結果

リサーチクエスチョン

  • RQ1NTの注目窓に前方および後方の注目機構を追加することで、LASとの性能低下が軽減されるか?
  • RQ2事前学習済みLASモデルからNTモデルを事前学習することで、その最終的性能が顕著に向上するか?
  • RQ3ワードピースベースのサブワード単位は、特に低チャンクサイズにおいて、NTにおける言語モデリングをどの程度向上させるか?
  • RQ4外部言語モデル統合により、NTとLASの性能格差をさらに縮小できるか?
  • RQ5NTにおける主な誤りタイプは何か?そして、アーキテクチャ的および学習的改善によってこれらを軽減できるか?

主な発見

  • 前方および後方注目を備えたNTは、チャンクサイズ10(450ms遅延)において、LASと比較して20%以上の相対WERの低下を示し、大幅な改善余地があることを示している。
  • LASモデルからの事前学習により、NTの性能格差が縮小され、チャンクサイズ10のNTがLASの性能に達するようになった。
  • ワードピース(WPM)の使用は、NTにおける言語モデリングを顕著に向上させ、チャンクサイズ5および10の両方でWERを8.6に低下させ、LASとの差を縮小した。
  • NTにおけるマルチヘッド注目は、LASとは異なり、シングルヘッド注目よりも性能を向上させないことが判明し、ストリーミング環境下での注目メカニズムの使用に限界があることを示唆している。
  • WPMと組み合わせた外部FST言語モデル統合は、デコーダー内に既に存在するRNN-LMの能力のため、追加の利得をもたらさなかった。
  • チャンクサイズ5(300ms遅延)を有する最良のNTシステムは、LASと比較して1%相対WERの低下にとどまり、リアルタイム制約下でもほぼ同等の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。