Skip to main content
QUICK REVIEW

[論文レビュー] On Training Recurrent Networks with Truncated Backpropagation Through Time in Speech Recognition

Hao Tang, James Glass|arXiv (Cornell University)|Jul 9, 2018
Speech Recognition and Synthesis参考文献 19被引用数 5
ひとこと要約

本稿では、オンライン対バッチデコードというトレーニングおよびデコード戦略が、音声認識における再帰的ネットワークの長期依存関係の学習能力に与える影響を調査する。バッチデコードはLSTMがマークフ型関数に制限されることを示し、一方オンラインデコードは再帰的関数の学習を可能にする。極めて重要な点として、最適なパフォーマンスを得るためにはトレーニングとデコードモードを一致させる必要があり、勾配消失はマークフ行動の主要な指標であることが示された。

ABSTRACT

Recurrent neural networks have been the dominant models for many speech and language processing tasks. However, we understand little about the behavior and the class of functions recurrent networks can realize. Moreover, the heuristics used during training complicate the analyses. In this paper, we study recurrent networks' ability to learn long-term dependency in the context of speech recognition. We consider two decoding approaches, online and batch decoding, and show the classes of functions to which the decoding approaches correspond. We then draw a connection between batch decoding and a popular training approach for recurrent networks, truncated backpropagation through time. Changing the decoding approach restricts the amount of past history recurrent networks can use for prediction, allowing us to analyze their ability to remember. Empirically, we utilize long-term dependency in subphonetic states, phonemes, and words, and show how the design decisions, such as the decoding approach, lookahead, context frames, and consecutive prediction, characterize the behavior of recurrent networks. Finally, we draw a connection between Markov processes and vanishing gradients. These results have implications for studying the long-term dependency in speech data and how these properties are learned by recurrent networks.

研究の動機と目的

  • 異なるデコード戦略(オンライン対バッチ)が再帰的ネットワークが学習可能な関数クラスに与える制約を理解すること。
  • 切り捨てられた時間軸を介したバックプロパゲーション(BPTT)によるトレーニングがモデルパフォーマンスおよび一般化に与える影響を調査すること。
  • 見通し(lookahead)、文脈フレーム、連続予測といった設計選択がLSTMにおける長期依存関係の学習に与える影響を検討すること。
  • 再帰的ネットワークにおけるマークフ仮定、リプシッツ連続性、および勾配消失の間の関係を確立すること。
  • バッチデコードでトレーニングされたLSTMがオンライン推論にうまく一般化できるかどうか、逆にオンライン推論にバッチデコードでトレーニングされたLSTMが一般化できるかどうかを特定すること。

提案手法

  • オンライン(各時刻で1つの再帰的チェーンが予測を行う)とバッチ(固定文脈窓を持つ複数の独立したチェーン)の2つのデコードアプローチを比較する。
  • 長期間の依存関係を近似するために、トレーニング中に固定された展開長を用いた切り捨てられた時間軸を介したバックプロパゲーション(BPTT)を採用する。
  • トレーニング中に将来の文脈に条件づけるために、見通し機構(例:20フレーム)を導入する。
  • 予測中に利用可能な有効な履歴を制限するために文脈フレームを適用し、固定順序のマークフ過程を模倣する。
  • 連続予測(複数の出力を連続して予測する)を導入し、再帰的関数の学習を近似する。
  • 距離の遠い時刻(例:t−20)における入力への勾配ノルムを実証的に評価し、リプシッツ連続性およびマークフ行動の代理指標とする。

実験結果

リサーチクエスチョン

  • RQ1オンライン対バッチデコード戦略は、再帰的ネットワークが学習可能な関数クラスにどのように制約を加えるか?
  • RQ2切り捨てられたBPTTによるトレーニングは長期依存関係をモデル化する能力を保持するのか? また、マークフ仮定とどのように関係するか?
  • RQ3バッチデコードでトレーニングされたLSTMはオンライン推論に一般化できるか? 逆にオンライン推論でトレーニングされたLSTMはバッチデコードに一般化できるか?
  • RQ4見通し、文脈フレーム、連続予測といったハイパーパrameterがモデルパフォーマンスおよび関数的容量に与える影響は何か?
  • RQ5勾配消失現象は、再帰的ネットワークにおけるマークフ関数のための必要条件であるか?

主な発見

  • バッチデコードでトレーニングされたLSTMは、遠く離れた時刻(例:t−20)で勾配ノルムが消失しており、マークフ過程として振る舞うことが確認された。
  • オンラインデコードでトレーニングされたLSTMは、遠く離れた入力に対しても非ゼロの勾配ノルムを維持しており、固定順序マークフモデルを超える再帰的関数の学習が可能であることが示された。
  • トレーニングとデコードモードが一致している場合に最高のパフォーマンスが達成された。オンラインデコードでトレーニングされたLSTMはバッチデコードでは性能が著しく低下し、逆にバッチデコードでトレーニングされたLSTMはオンラインデコードでも同様の傾向を示した。
  • オンラインデコードでは、見通し(例:20フレーム)を増やすことでトレーニング誤差が顕著に減少し、長期文脈学習においてその重要性が浮き彫りになった。
  • 連続予測(例:15ステップ)を増やすことで、単語誤り率(FER)が56.96%から30.93%に低下し、モデルが再帰的関数の学習に近づくことが改善された。
  • 文脈フレームの数は、予測に利用可能な履歴を厳密に制限しており、文脈が短すぎる(例:30フレーム対40フレーム)と性能が劣化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。