Skip to main content
QUICK REVIEW

[論文レビュー] Factorization tricks for LSTM networks

Oleksii Kuchaiev, Boris Ginsburg|arXiv (Cornell University)|Mar 31, 2017
Neural Networks and Applications参考文献 13被引用数 88
ひとこと要約

本論文は因子化 LSTM(F-LSTM)とグループ LSTM(G-LSTM)を提案し、パラメータを削減し訓練を加速、One Billion Word Benchmarkでほぼ最先端の困惑度をRNNパラメータ数を抑えて達成。

ABSTRACT

We present two simple ways of reducing the number of parameters and accelerating the training of large Long Short-Term Memory (LSTM) networks: the first one is "matrix factorization by design" of LSTM matrix into the product of two smaller matrices, and the second one is partitioning of LSTM matrix, its inputs and states into the independent groups. Both approaches allow us to train large LSTM networks significantly faster to the near state-of the art perplexity while using significantly less RNN parameters.

研究の動機と目的

  • 大規模言語モデルのためにLSTMのパラメータ数と訓練時間の削減を動機づける。
  • 計算量とメモリ要件を低くするためにLSTMPへの2つの修正(因子分解とグルーピング)を提案する。
  • 大規模な言語モデリングタスクで方法を評価し、強力なベースラインと比較する。
  • これらのアプローチがパフォーマンスを維持しつつ訓練効率を改善する時と方法について指針を提供する。

提案手法

  • Factorized LSTM (F-LSTM) は 4n x 2p のアファイントランスフォームを、W2*W1 の積に置換する。W1 はサイズ 2p x r、W2 はサイズ r x 4n で、ランク r < p。
  • Group LSTM (G-LSTM) は入力 x と隠れ状態 h を独立したグループに分割し、各グループが R^{2p/k} から R^{4n/k} への自分のアフィイントランスフォームを計算する(k グループの場合)。
  • どちらの手法も元の LSTMP に比べてパラメータ数を削減する。F-LSTM はパラメータを (r*2p + r*4n) に削減し、(2p*4n) に対して。G-LSTM は計算をグループ間で分散させ、モデル並列性を可能にする。
  • 本研究は projection(サイズ p)のLSTMPを用い、言語モデリングのタスクとして One Billion Word Benchmark を評価する。
  • 著者は projection サイズが embedding と softmax のサイズを制御するのに重要であると述べる。

実験結果

リサーチクエスチョン

  • RQ1LSTM の重み行列を因数分解してパラメータ数を減らしつつ性能を維持し訓練を速くできるか?
  • RQ2独立したグループに分割した(G-LSTM)ことで、より少ないパラメータで同等またはより高い効率を提供できるか?
  • RQ3F-LSTM と G-LSTM を BIGLSTM のベースラインと比較して、困惑度と訓練スループットはどうか?
  • RQ4異なるグループ数または因数分解ランクに応じて、モデルサイズ、スピード、困惑度のトレードオフはどうなるか?

主な発見

  • G-LSTM の 2 グループは、ほぼベースラインと同程度の困惑度を、はるかに少ないパラメータ数と高速な訓練で達成する。
  • F-LSTM の中間ランク(F512)を用いた F-LSTM は BIGLSTM より訓練が速く、パラメータ数も少なく、競争力のある困惑度を達成する。
  • グループ数を増やす(G-4、G-8)はさらにパラメータ数を削減できるが、困惑度は上昇する可能性がある。G-8 は 39.4 の困惑度で、パラメータ数は 850.4k。
  • 因数分解型およびグループベースの LSTM は、同じ実測時計時間内で大幅に訓練を高速化し、最先端に近い困惑度を達成する。
  • 階層的なグループ構成(例:G4-G8)は、精度の大きな損失を伴わずに効率を向上させる可能性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。