Skip to main content
QUICK REVIEW

[論文レビュー] Constructing Long Short-Term Memory based Deep Recurrent Neural Networks for Large Vocabulary Speech Recognition

Xiangang Li, Xihong Wu|arXiv (Cornell University)|Oct 16, 2014
Speech Recognition and Synthesis参考文献 18被引用数 12
ひとこと要約

本稿では、大規模語彙音声認識性能を向上させるために、新しい深層Long Short-Term Memory(LSTM)アーキテクチャを提案する。特に、LSTM-OPおよびスタックドLSTMの変種を用いて、深層入力-隠れ層、隠れ層-隠れ層、および隠れ層-出力遷移を拡張することで、中国語会話電話音声タスクにおいて、DNNの38.01%からCERを34.65%まで低減し、最先端の結果を達成した。

ABSTRACT

Long short-term memory (LSTM) based acoustic modeling methods have recently been shown to give state-of-the-art performance on some speech recognition tasks. To achieve a further performance improvement, in this research, deep extensions on LSTM are investigated considering that deep hierarchical model has turned out to be more efficient than a shallow one. Motivated by previous research on constructing deep recurrent neural networks (RNNs), alternative deep LSTM architectures are proposed and empirically evaluated on a large vocabulary conversational telephone speech recognition task. Meanwhile, regarding to multi-GPU devices, the training process for LSTM networks is introduced and discussed. Experimental results demonstrate that the deep LSTM networks benefit from the depth and yield the state-of-the-art performance on this task.

研究の動機と目的

  • 音声認識のための音声モデリングを改善するために、時間的深さを超えた空間的深さ(空間的深さ)を有するLSTMネットワークの深さを検討すること。
  • 大規模音声認識タスクにおいて、LSTM-OP、スタックドLSTM、ハイブリッド設計などの代替的深層LSTMアーキテクチャを評価すること。
  • 系列モデルの文脈において、深層LSTMネットワークのマルチGPU訓練の有効性を調査すること。
  • 認識精度の観点から、深層LSTMバリアントと標準的な浅いLSTMおよびフィードフォワードDNNを比較すること。
  • 計算コストを最小限に抑えながら性能を最大化する最適なアーキテクチャの組み合わせを特定すること。

提案手法

  • 入力-隠れ層、隠れ層-隠れ層、および隠れ層-出力関数の3つの構成要素を変更することで、深層LSTMバリアントを設計する。
  • 表現能力を向上させるために、LSTM-OP(出力投影)およびLSTM-IP(入力投影)アーキテクチャを導入する。
  • 収束を高速化するために、マルチGPUシステム上で切り捨てられた時間に沿った誤差逆伝播(truncated BPTT)を用いて訓練する。
  • LSTM-OPの上にフィードフォワード層を組み合わせたハイブリッドモデルを構築し、性能を向上させる。
  • 系列モデリングとアライメント最適化のため、接続主義的時系列分類(CTC)と判別的訓練を採用する。
  • タイミング制御と状態制御を改善するために、ピアホール(peephole)接続とtanh活性化関数をメモリセルに適用する。

実験結果

リサーチクエスチョン

  • RQ1空間的深さ(時間的深さを超えて)を有するLSTMネットワークの深さを増すことで、大語彙音声認識の性能が向上するか?
  • RQ2LSTM-OP、スタックドLSTM、またはハイブリッド設計などのアーキテクチャ変種の中で、大規模会話音声タスクで最も高い認識精度を達成するのはどれか?
  • RQ3語彙誤り率(WER)の観点から、深層LSTMネットワークは標準的な浅いLSTMおよびフィードフォワードDNNと比較して、どのように性能を発揮するか?
  • RQ4深層入力-隠れ層、隠れ層-隠れ層、および隠れ層-出力関数の組み合わせが認識性能に与える影響は何か?
  • RQ5マルチGPU訓練は、収束性や精度を損なわずに、深層LSTMネットワークの訓練を効率的かつスケーラブルに拡大できるか?

主な発見

  • 3つのフィードフォワード中間層を有する深層LSTM-OPネットワークが最良の性能を示し、CERを34.65%まで低減した。
  • LSTM-OPアーキテクチャは、標準的な浅いLSTMおよびスタックドLSTMを上回り、浅いLSTMと比較して13.98%の相対的CER低減を達成した。
  • フィードフォワードDNN(CER 38.01%)と比較して、深層LSTMネットワークはCERを8.87%低減し、顕著な精度向上を示した。
  • LSTM-OP層をスタック(3層)した場合、LSTM-IP層をスタックした場合よりも優れた性能を示したが、両者ともハイブリッドフィードフォワード統合に比べて効果が劣った。
  • LSTM-OPと3つのフィードフォワード層を組み合わせたハイブリッドモデルは、より深いスタックアーキテクチャよりも計算量を抑えながら、最良の精度を達成した。
  • マルチGPU訓練により、切り捨てられたBPTTを用いて、深層LSTMネットワークの効率的かつスケーラブルな訓練が可能となり、大規模な実験を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。