Skip to main content
QUICK REVIEW

[論文レビュー] Simplified Long Short-term Memory Recurrent Neural Networks: part II

Atra Akandeh, Fathi M. Salem|arXiv (Cornell University)|Jul 14, 2017
Neural Networks and Applications被引用数 4
ひとこと要約

本稿では、固定またはベクトル化されたゲーティングメカニズムにより、適応的パラメータを大幅に削減することで、6つの簡素化された長短期記憶(LSTM)変種—LSTM4、LSTM5、LSTM4a、LSTM5a、LSTM6—を提案する。これらのモデルは、標準LSTMと同等のMNISTテスト精度を達成する一方で、パラメータを最大74%削減し、1エポックあたりの学習時間を60%短縮する。ReLU活性化関数を用いる場合、高学習率下でも性能が安定するが、標準LSTMは性能が低下する。

ABSTRACT

This is part II of three-part work. Here, we present a second set of inter-related five variants of simplified Long Short-term Memory (LSTM) recurrent neural networks by further reducing adaptive parameters. Two of these models have been introduced in part I of this work. We evaluate and verify our model variants on the benchmark MNIST dataset and assert that these models are comparable to the base LSTM model while use progressively less number of parameters. Moreover, we observe that in case of using the ReLU activation, the test accuracy performance of the standard LSTM will drop after a number of epochs when learning parameter become larger. However all of the new model variants sustain their performance.

研究の動機と目的

  • 標準LSTMモデルの計算コストと学習時間を、適応的パラメータを最小限に抑えることで低減すること。
  • MNISTベンチマークデータセット上で、パラメータ削減されたLSTM変種の性能を評価すること。
  • さまざまな学習率および活性化関数下での、簡素化LSTMの安定性と精度を調査すること。
  • 簡素化LSTMが著しく低い複雑性で標準LSTMの性能に匹敵できるかどうかを特定すること。
  • 固定ゲート値がモデルの安定性および一般化性能に与える影響を調査すること。

提案手法

  • 入力ゲート、フォグゲート、出力ゲートにおける完全な再帰的重み行列を学習可能なベクトルに置き換えることで、LSTM4およびLSTM5を提案。これにより、要素ごとの乗算が可能になる。
  • フォグゲートを0.96、出力ゲートを1.0に固定することで、LSTM4aおよびLSTM5aを導入。これにより、これらのゲートにおける適応的パラメータが完全に削除される。
  • すべてのゲートを定数に設定(フォグ=0.59、インプット=1.0、出力=1.0)することで、LSTM6を導入。これにより、最小限のパラメータを持つ基本的なRNNに簡素化される。
  • Kerasライブラリを用いて、28×28の画像を28ステップのシーケンスとして入力する方式で、MNISTデータセット上ですべての変種を学習・評価。
  • tanh、シグモイド、ReLUの3つの活性化関数を用い、学習率(η)を3つの値で変更することで、モデルのロバストネスを評価。
  • すべての変種について、訓練精度・テスト精度、パラメータ数、1エポックあたりの時間の観点から、モデル性能を比較。

実験結果

リサーチクエスチョン

  • RQ1適応的パラメータを減らした簡素化LSTM変種は、MNISTデータセットで標準LSTMと同等のテスト精度を達成できるか?
  • RQ2ゲート値を固定すること(例:フォグゲートを0.96や0.59に固定)が、モデルの安定性および性能に与える影響は何か?
  • RQ3活性化関数の選択(tanh、シグモイド、ReLU)が、簡素化LSTMの性能および収束に与える影響は何か?
  • RQ4さまざまな学習率が、簡素化LSTMと標準LSTMの両者の学習ダイナミクスに与える影響は何か?
  • RQ5標準LSTMが劣化する高学習率下でも、簡素化LSTMは性能を維持できるか?

主な発見

  • 標準LSTMモデルは、ReLU活性化関数を用い、学習率η=2e-3の場合にテスト精度が著しく低下するが、すべての簡素化変種は安定した性能を維持する。
  • ReLU活性化関数とη=1e-4を用いた場合、LSTM5が簡素化変種の中で最高のテスト精度(0.9892)を達成し、標準LSTMの0.9853に非常に近い。
  • すべてのゲートを定数に固定したLSTM6は、ReLUとη=2e-3を用いた場合に96.56%のテスト精度を達成し、適切にチューニングされた基本的なRNNが競争力を持つ可能性を示している。
  • LSTM4aとLSTM5aは、さまざまな活性化関数および学習率下で最も一貫した性能を示し、ReLUとη=2e-3の条件下でそれぞれ97.92%および98.21%のテスト精度を達成。
  • パラメータ数は、標準LSTMの52,610からLSTM6の13,910にまで74%削減され、1エポックあたりの学習時間も60%短縮された。
  • ReLUを用いる場合、すべての簡素化変種は高学習率下でも高い性能を維持するが、標準LSTMは約50エポック目以降に性能が劣化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。