Skip to main content
QUICK REVIEW

[論文レビュー] Online Sequence Training of Recurrent Neural Networks with Connectionist Temporal Classification

Kyuyeon Hwang, Wonyong Sung|arXiv (Cornell University)|Nov 21, 2015
Speech Recognition and Synthesis参考文献 24被引用数 5
ひとこと要約

この論文は、長時間または連続的なシーケンスにおいて、完全なアンロールなしで効率的でメモリ制限付きの訓練を可能にする、一方向RNN向けの期待最大化(EM)ベースのオンラインCTC訓練アルゴリズムを提案する。CTC-TR(切り捨てCTC)とEMベースのフレームカバレッジ(CTC-EM)を組み合わせることで、64倍のアンロール(640msウィンドウ)でほぼ最先端の性能を達成し、GPU上で1秒間に27,000フレームの訓練速度を実現しながら、WSJで相対的に4.5%のWER増加にとどめる。

ABSTRACT

Connectionist temporal classification (CTC) based supervised sequence training of recurrent neural networks (RNNs) has shown great success in many machine learning areas including end-to-end speech and handwritten character recognition. For the CTC training, however, it is required to unroll (or unfold) the RNN by the length of an input sequence. This unrolling requires a lot of memory and hinders a small footprint implementation of online learning or adaptation. Furthermore, the length of training sequences is usually not uniform, which makes parallel training with multiple sequences inefficient on shared memory models such as graphics processing units (GPUs). In this work, we introduce an expectation-maximization (EM) based online CTC algorithm that enables unidirectional RNNs to learn sequences that are longer than the amount of unrolling. The RNNs can also be trained to process an infinitely long input sequence without pre-segmentation or external reset. Moreover, the proposed approach allows efficient parallel training on GPUs. For evaluation, phoneme recognition and end-to-end speech recognition examples are presented on the TIMIT and Wall Street Journal (WSJ) corpora, respectively. Our online model achieves 20.7% phoneme error rate (PER) on the very long input sequence that is generated by concatenating all 192 utterances in the TIMIT core test set. On WSJ, a network can be trained with only 64 times of unrolling while sacrificing 4.5% relative word error rate (WER).

研究の動機と目的

  • 長時間シーケンスにおけるCTC訓練の高コストな完全アンロールの問題に対処すること。特に、GPUのような共有メモリシステムにおいて。
  • 事前分割や外部リセットなしに、一方向RNNのオンラインおよび連続シーケンス訓練を可能にすること。
  • アンロール長を短縮することでメモリ制約下でより多くの並列シーケンスを処理できるようにしつつ、高いモデル性能を維持する方法を開発すること。
  • 固定アンロールウィンドウを用いることで、可変長シーケンスにおける負荷の不均衡を低減し、GPU上での効率的でスケーラブルな訓練を促進すること。
  • 限られたメモリリソースを備えた小型のオンライン学習・適応システムを支援すること。

提案手法

  • 期待最大化(EM)に基づくオンラインCTCアルゴリズムを導入し、2段階のプロセスに分ける:切り捨てCTC(CTC-TR)とEMベースのフレームカバレッジ(CTC-EM)。
  • CTC-TRを用いて、固定ウィンドウサイズに制限された切り捨てアンロールを通じた標準的な誤差逆伝播を実行し、メモリ使用量を制限する。
  • CTC-EMを用いて、特にシーケンス境界部や長時間シーケンス内でのCTC-TRが見逃したフレームをカバーする。EMスタイルの反復推定を用いる。
  • EMベースのフレームカバレッジを損失関数に統合し、不完全または切り捨てられたシーケンスにおけるモデル学習を向上させる。
  • 発話単位の発話文を用いて連結されたシーケンスで訓練することで、リセットなしに連続的なRNN推論を可能にする。これにより、無限のストリームを処理できる。
  • 固定アンロールウィンドウを用いることで、GPU並列訓練と統合し、負荷バランスの取れたデータストリームで高いスループットを実現する。

実験結果

リサーチクエスチョン

  • RQ1完全なアンロールなしで、長時間または連続入力シーケンスに対するCTCベースのシーケンス訓練を効率的に行うことは可能か?
  • RQ2一方向RNNのオンラインCTC訓練において、モデル性能を維持しつつ、メモリ使用量をどのように削減できるか?
  • RQ3EMベースのフレームカバレッジは、CTC訓練における切り捨て誤差逆伝播による性能損失をどの程度補えるか?
  • RQ4提案手法により、可変長シーケンスを対象としたGPU上での高スループット・並列訓練が可能か?
  • RQ5オンラインCTC訓練において、アンロール長、訓練速度、モデル精度の間のトレードオフはいかほどか?

主な発見

  • 提案されたオンラインCTCアルゴリズムは、192発話からなる連結TIMITテストセットで20.7%のフォネム誤り率(PER)を達成し、連続シーケンス処理の有効性を示した。
  • WSJコーパスにおいて、64倍のアンロール(640msウィンドウ)で訓練したモデルは、完全アンロールと比較して相対的に4.5%のWER増加にとどまり、1秒間に26,980フレームの訓練速度を達成した。
  • 256本の並列ストリームと64倍のアンロールを用いることで、訓練速度は26,980フレーム/秒に達し、メモリ制約下でも顕著な加速が実現された。
  • 256ステップおよび512ステップのアンロールを用いたCTC-TR + CTC-EMの収束曲線は、2,048ステップのCTC-TRと非常に近い形状を示し、アンロールを短縮しても優れた一般化性能を示した。
  • 64倍アンロール(12.43% CTC-TRカバレッジ)でも、完全アンロールのベースラインと比較して1.5%以内のWERを維持でき、低カバレッジ下でも高いロバスト性を示した。
  • TIMITデータセットを用いた実験で、1つの無限長入力ストリームに対して外部リセットなしに連続的なRNN推論が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。