Skip to main content
QUICK REVIEW

[論文レビュー] SLIM LSTMs

Fathi M. Salem|arXiv (Cornell University)|Dec 29, 2018
Neural Networks and Applications参考文献 4被引用数 6
ひとこと要約

この論文は、共有重み行列やバイアスベクトルなどの冗長なコンponentsを積極的にプルーニングすることで、モデルの複雑さを低減しながら検証精度を標準LSTMと同等に保つ、非常にパラメータ効率の良いLSTM変種であるSLIM LSTMsを紹介する。この手法は、性能に犠牲を払わず、構造的簡素化によって顕著な計算コストの削減とトレーニングの高速化を達成する。

ABSTRACT

Long Short-Term Memory (LSTM) Recurrent Neural networks (RNNs) rely on gating signals, each driven by a function of a weighted sum of at least 3 components: (i) one of an adaptive weight matrix multiplied by the incoming external input vector sequence, (ii) one adaptive weight matrix multiplied by the previous memory/state vector, and (iii) one adaptive bias vector. In effect, they augment the simple Recurrent Neural Networks (sRNNs) structure with the addition of a memory cell and the incorporation of at most 3 gating signals. The standard LSTM structure and components encompass redundancy and overly increased parameterization. In this paper, we systemically introduce variants of the LSTM RNNs, referred to as SLIM LSTMs. These variants express aggressively reduced parameterizations to achieve computational saving and/or speedup in (training) performance---while necessarily retaining (validation accuracy) performance comparable to the standard LSTM RNN.

研究の動機と目的

  • 標準LSTMネットワークにおける過剰なパラメータ化と冗長性に対処すること。
  • モデルの性能を劣化させることなく、計算コストを低減し、トレーニングを高速化すること。
  • LSTMの本質的な機能を保持する最小限のアーキテクチャ構成を体系的に探索すること。
  • パラメータ削減を積極的に行う軽量LSTM変種のファミリー、すなわちSLIM LSTMsを開発すること。

提案手法

  • 標準LSTMから冗長なコンponents(共有重み行列やバイアスベクトルなど)を削除することで、パラメータ数を削減する。
  • 重み付き和の冗長な部分を排除することで、ゲーティング機構を再構造化し、入力、隠れ状態、バイアスの必須コンponentsのみを保持する。
  • 記憶セルとシーケンスモデリングに必要なゲーティング論理を維持しつつ、適応的パラメータ数を減らすアーキテクチャに再構成する。
  • 各ゲートごとの学習パラメータ数を最小限に抑えることに注力し、可能な限りスパarsityと共有計算を促進する。
  • 得られたSLIM LSTM変種は、元のLSTMフレームワークに最小限の構造的変更を加え、標準的な誤差逆伝播法でトレーニングされる。

実験結果

リサーチクエスチョン

  • RQ1検証精度を損なわずに、LSTMモデルを顕著に簡素化できるか?
  • RQ2シーケンスモデリングタスクにおいてLSTMの性能を維持するために必要な最小限のコンポーネントのセットは何か?
  • RQ3性能の劣化が生じる前に、どの程度のパラメータ削減が可能か?
  • RQ4アーキテクチャのプルーニングによって、トレーニング速度と推論効率をどの程度向上できるか?

主な発見

  • SLIM LSTMsは、標準LSTMと比較して顕著なパラメータ削減を達成しながら、同等の検証精度を維持する。
  • 提案された変種は、計算複雑さの低減により、より高速なトレーニング時間を実現する。
  • この手法は、モデル性能を劣化させることなく、冗長な重み行列とバイアスベクトルを効果的に排除した。
  • パラメータ数が減少しても、簡素化されたアーキテクチャは、標準LSTMが有するコアなシーケンス学習能力を保持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。