Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end attention-based distant speech recognition with Highway LSTM

Hassan Taherian|arXiv (Cornell University)|Oct 17, 2016
Speech Recognition and Synthesis参考文献 12被引用数 3
ひとこと要約

本論文は、マルチチャネル音声入力とハイウェイ長短期記憶(HLSTM)ネットワークを用いた遠距離音声認識のためのエンドツーエンドのアテンションベースの音声認識システムを提案する。アテンション機構と言語モデルとしての重み付き有限状態トランスダクタ(WFST)を統合することで、リバーブや重なり音声による劣化を受けるAM I遠距離音声認識ベンチマークにおいて、勾配消失に強く、より深いネットワークを用いることで、先行研究を上回るロバスト性と性能を達成した。

ABSTRACT

End-to-end attention-based models have been shown to be competitive alternatives to conventional DNN-HMM models in the Speech Recognition Systems. In this paper, we extend existing end-to-end attention-based models that can be applied for Distant Speech Recognition (DSR) task. Specifically, we propose an end-to-end attention-based speech recognizer with multichannel input that performs sequence prediction directly at the character level. To gain a better performance, we also incorporate Highway long short-term memory (HLSTM) which outperforms previous models on AMI distant speech recognition task.

研究の動機と目的

  • リバーブや重なり音声による劣化が性能に与える影響を受ける遠距離音声認識(DSR)に特化したエンドツーエンドの音声認識システムの開発を目的とする。
  • 従来の前処理(例:ビームフォーミング)に依存せずに、マルチチャネル音声入力を直接処理できるように、既存のアテンションベースの再帰的シーケンス生成器(ARSG)を拡張することを目的とする。
  • スタックドRNNにおける勾配消失問題を軽減するため、ハイウェイLSTM(HLSTM)を導入することで、モデルの深さと学習安定性を向上させることを目的とする。
  • ARSGデコーダーにWFSTフレームワークを用いて言語モデルを統合し、学習の tractability を損なわせずに単語誤り率(WER)を低減することを目的とする。

提案手法

  • モデルは、N個の音声ストリームからなるマルチチャネル入力Xを用い、これらを連結して双方向ハイウェイLSTM(BHLSTM)エンコーダーに供給し、深層的な文脈表現を学習する。
  • アテンション機構は、クエリ、キー、コンテキストベクトルを用いたコンテキストベースのスコア関数により、デコーダー状態とエンコーダー隠れ状態hi間のアライメント重みαi,lを計算する。
  • コンテキストベクトルciは、アテンション重みαi,lを用いてエンコーダー状態の重み付き和として計算され、関連する入力フレームに注目する。
  • デコーダーは、直前出力文字、デコーダー隠れ状態、およびコンテキストベクトルに条件付けられた、1文字ずつ出力文字を生成する一方向LSTMである。
  • WFSTフレームワークを用いて、言語モデルをデコーディングプロセスに統合し、重み付き和により音響モデルスコアと言語モデルスコアを組み合わせ、調整可能なハイパーパrameter βを用いる。
  • モデル全体は、正解トランスクリプションの対数尤度を最大化することでエンドツーエンドに学習され、推論時のロバスト性を向上させるためにスケジューリングサンプリングが適用される。

実験結果

リサーチクエスチョン

  • RQ1前処理としてビームフォーミングを用いない、マルチチャネル入力とアテンションベースのエンドツーエンドモデルは、従来のDNN-HMMシステムを上回る性能を達成できるか?
  • RQ2ハイウェイLSTMの統合は、DSRにおける深層RNNアーキテクチャの学習安定性と性能にどのように寄与するか?
  • RQ3WFSTを介して言語モデルを統合することで、遠距離音声認識におけるエンドツーエンドASRの単語誤り率(WER)はどの程度低減されるか?
  • RQ4チャネルごとに別々に処理するのではなく、エンコーディング前にマルチチャネル入力を連結することで、より良い性能が得られるか?
  • RQ5ノイズやリバーブ環境下でも、アテンション機構は複数チャネルにわたる関連する入力フレームに効果的に注目できるか?

主な発見

  • マルチチャネル入力とBHLSTMエンコーダーを備えた本手法のエンドツーエンドモデルは、勾配消失を回避できるより深いネットワークを活用し、AMI遠距離音声認識ベンチマークで最先端の性能を達成した。
  • ハイウェイLSTMの使用により、標準LSTMに比べて、より深いRNNアーキテクチャの安定した学習が可能となり、エンコーダーにおける表現学習が向上した。
  • WFSTフレームワークによる言語モデルの統合は、単語誤り率(WER)を顕著に低減させ、エンドツーエンドASRにおける言語モデリングの重要性を示した。
  • 単一チャネル入力に依存する従来のアテンションベースのモデルや、従来のDNN-HMMシステムに比べ、特に厳しい音響環境下でも優れた性能を発揮した。
  • マルチチャネル入力とアテンション、HLSTMの統合により、マイクロフォンアレイの幾何構造に関する事前知識が不要な、ロバストでリアルタイムな推論が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。