[論文レビュー] Grow and Prune Compact, Fast, and Accurate LSTMs
本稿では、コンpactで高速かつ高精度なモデルを実現するため、成長・剪定(GP)トレーニングを用いた隠れ層LSTM(H-LSTM)を提案する。LSTMの制御ゲートに内部隠れ層を追加し、勾配に基づく成長と大きさに基づく剪定を組み合わせることで、パラメータを最大38.7倍、FLOPsを45.5倍、遅延を4.5倍削減しつつ、画像キャプションのCIDErスコアを2.6ポイント向上させ、語りかけ認識ではWERを12.9%から8.7%に低下させた。
Long short-term memory (LSTM) has been widely used for sequential data modeling. Researchers have increased LSTM depth by stacking LSTM cells to improve performance. This incurs model redundancy, increases run-time delay, and makes the LSTMs more prone to overfitting. To address these problems, we propose a hidden-layer LSTM (H-LSTM) that adds hidden layers to LSTM's original one level non-linear control gates. H-LSTM increases accuracy while employing fewer external stacked layers, thus reducing the number of parameters and run-time latency significantly. We employ grow-and-prune (GP) training to iteratively adjust the hidden layers through gradient-based growth and magnitude-based pruning of connections. This learns both the weights and the compact architecture of H-LSTM control gates. We have GP-trained H-LSTMs for image captioning and speech recognition applications. For the NeuralTalk architecture on the MSCOCO dataset, our three models reduce the number of parameters by 38.7x [floating-point operations (FLOPs) by 45.5x], run-time latency by 4.5x, and improve the CIDEr score by 2.6. For the DeepSpeech2 architecture on the AN4 dataset, our two models reduce the number of parameters by 19.4x (FLOPs by 23.5x), run-time latency by 15.7%, and the word error rate from 12.9% to 8.7%. Thus, GP-trained H-LSTMs can be seen to be compact, fast, and accurate.
研究の動機と目的
- 深層LSTMにおけるモデルの精度、推論速度、パラメータ効率のトレードオフを解消すること。
- スタックドLSTMの限界を克服すること。スタックドLSTMは遅延、パラメータ数、過学習のリスクを増加させる。
- コンパクトで高性能なLSTMのための最適なネットワーク構造と重みを同時に学習する手法を開発すること。
- モバイルや組み込みシステムなどのリソース制約のあるデバイスへの正確なLSTMのデプロイを可能にすること。
- モデルサイズ、推論速度、精度の3つの主要指標において優れた性能を達成すること。
提案手法
- LSTMの制御ゲートに複数の隠れ層を追加することで、セル内での多段階の抽象化を可能にするH-LSTMを提案する。
- 勾配に基づく成長と大きさに基づく剪定を組み合わせた、重みとアーキテクチャを同時に最適化する成長・剪定(GP)トレーニングフレームワークを導入する。
- 成長フェーズでは、死滅ReLUニューロンを防ぐためにleaky ReLUを用い、最終的なトレーニングと剪定ではReLUに切り替える。
- 成長後に重要度に基づく剪定を適用することで、低重要度の接続を削除し、最大94.22%の高スパarsityを達成する。
- H-LSTMのゲートでReLU活性化関数を活用することで、スパースな活性化パターンのおかげで推論時のFLOPsを14.5%削減する。
- バックプロパゲーションを用いたエンドツーエンドのトレーニングにより、ネットワークが最適な構造と重みを同時に学習できるようにする。
実験結果
リサーチクエスチョン
- RQ1LSTM制御ゲートに内部隠れ層を追加することで、パラメータ数と推論遅延を削減しながらモデル精度を向上させることができるか?
- RQ2組み合わせた成長・剪定(GP)トレーニング戦略は、H-LSTMの重みとアーキテクチャを効果的に学習できるか?
- RQ3H-LSTMのゲートでReLUを使用することで、シグモイド/tanhゲートを備えた標準LSTMと比較して、FLOPsおよび遅延に顕著な低減が見られるか?
- RQ4幅を縮小したH-LSTMは、依然として標準のスタックドLSTMよりも精度、速度、コンパクト性の点で優れているか?
- RQ5正則化(例:ドロップアウト)は、H-LSTMモデルにおける一般化性能をどの程度向上させるか?
主な発見
- MSCOCOにおける画像キャプションのタスクでは、GPトレーニングを施したH-LSTMが、パラメータを38.7倍、FLOPsを45.5倍削減し、実行時間の遅延を4.5倍低減するとともに、CIDErスコアを2.6ポイント向上させた。
- AN4における音声認識のタスクでは、H-LSTMがパラメータを19.4倍、FLOPsを23.5倍削減し、遅延を15.7%低減し、語彙誤り率(WER)を12.9%から8.7%に低下させた。
- 最終的なコンパクトなH-LSTMモデルは、成長と剪定を繰り返すことで94.22%のスパarsityを達成し、モデルサイズを顕著に削減した。
- H-LSTMのゲートでReLUを用いることで、平均48.3%の活性化スパarsityのおかげで、推論時のFLOPsが14.5%削減された。
- 幅を縮小した1層のH-LSTM(512ではなく320)が、精度、速度、コンパクト性の3つの設計次元すべてにおいて、標準LSTMを上回る性能を達成した。
- ドロップアウト正則化により、CIDErが2.0ポイント向上し、WERが0.96ポイント低下した。これは、H-LSTMにおける一般化性能の向上においてドロップアウトの重要性を裏付けている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。