Skip to main content
QUICK REVIEW

[論文レビュー] Structurally Sparsified Backward Propagation for Faster Long Short-Term Memory Training

Maohua Zhu, Jason Clemons|arXiv (Cornell University)|Jun 1, 2018
Advanced Neural Network Applications参考文献 15被引用数 7
ひとこと要約

この論文では、長短期記憶(LSTM)ネットワークにおけるバックプロパゲーションを構造的にスパース化する手法を提案する。バックプロパゲーション中にゲート勾配に固定されたスパarsityを強制することで、GPU上での学習を高速化する。LSTMゲート勾配に粗粒度または細粒度の構造的スパarsityを適用することにより、密行列学習に比べて最大45%高速なバックワードパスを達成し、最先端のスパース化手法に比べて168%高速化される。短時間の密行列学習フェーズを組み合わせることで、精度の損失は最小限に抑えられる。

ABSTRACT

Exploiting sparsity enables hardware systems to run neural networks faster and more energy-efficiently. However, most prior sparsity-centric optimization techniques only accelerate the forward pass of neural networks and usually require an even longer training process with iterative pruning and retraining. We observe that artificially inducing sparsity in the gradients of the gates in an LSTM cell has little impact on the training quality. Further, we can enforce structured sparsity in the gate gradients to make the LSTM backward pass up to 45% faster than the state-of-the-art dense approach and 168% faster than the state-of-the-art sparsifying method on modern GPUs. Though the structured sparsifying method can impact the accuracy of a model, this performance gap can be eliminated by mixing our sparse training method and the standard dense training method. Experimental results show that the mixed method can achieve comparable results in a shorter time span than using purely dense training.

研究の動機と目的

  • 前向き伝搬の最適化に比べて未利用にされているバックワード伝搬におけるスパarsityを活用し、LSTM学習を高速化すること。
  • 現代のGPUではスパース行列乗算のオーバーヘッドが高く、既存の勾配スパース化手法に非効率性が生じる問題を解決すること。
  • スパース学習と周期的な密行列微調整を組み合わせることで、モデル精度を損なわず大幅な高速化を実現すること。
  • GPU最適化された行列演算を活用するハードウェアに配慮したスパarsityパターンを設計し、最大のパフォーマンス向上を達成すること。
  • 特に密行列フェーズを組み合わせた場合に、ゲート勾配における中程度のスパarsity(例:50%)が学習品質にほとんど影響を与えないことを示すこと。

提案手法

  • バックプロパゲーション中のLSTMゲート勾配を標的とした、粗粒度および細粒度の2種類の構造的スパース化手法を提案する。
  • 各ゲートごとに、絶対値が最大のk個の値のみを保持することで、固定されたスパarsityレベル(例:50%)を実現し、構造的スパarsityを強制する。
  • 高パフォーマンスなGPUカーネルと互換性を持つようにスパース化手法を設計し、高価なグローバルtop-k操作を回避する。
  • ハイブリッドトレーニング戦略を導入:大部分の学習ステップでスパース勾配を適用し、その後に少数の密行列ステップを実行して精度を回復させる。
  • 混合トレーニングスケジュール(例:4分の3がスパース+4分の1が密行列)を用いることで、速度とモデル品質のバランスを最適化し、性能劣化を最小限に抑える。
  • 標準的なSGDをスパース勾配とともに使用することで、既存のディープラーニングフレームワークおよびトレーニングパイプラインとの互換性を確保する。

実験結果

リサーチクエスチョン

  • RQ1LSTMゲート勾配における構造的スパarsityは、モデル精度を損なわずバックワードパスを顕著に高速化できるか?
  • RQ2現代のGPU上での構造的勾配スパース化の性能は、密行列学習および既存のスパース化手法と比べてどうか?
  • RQ3許容可能なモデルパフォーマンスを維持しつつ、スパarsityレベルとトレーニング速度の最適なトレードオフは何か?
  • RQ4スパース学習による精度ギャップは、短時間の密行列学習フェーズで効果的に回復できるか?
  • RQ5提案手法は、ニューラル機械翻訳や言語モデルなどの異なるNLPタスクおよびモデルアーキテクチャにスケーラブルか?

主な発見

  • 粗粒度スパース化手法は、現代のGPU上で密行列学習に比べて45%高速なLSTMバックワードパスを達成した。
  • 50%スパarsityにおいて、最先端のスパース化手法(meProp)に比べ168%高速であり、mePropですら高い精度を誇るにもかかわらず、本手法は優位性を示した。
  • 50%スパarsityでは、密行列学習と比較してBLEUスコアがわずか3.5%低下したが、1/4の密行列フェーズでギャップは完全に回復された。
  • 混合スパース・密行列トレーニング戦略により、密行列学習(20.32)と同等のBLEUスコア(20.30–20.45)を、より短時間で達成した。
  • 細粒度手法は36%の高速化を達成し、粗粒度よりもわずかに高い精度を維持したが、カーネルオーバーヘッドのため、効率性に劣った。
  • 高速化効果はアプリケーションの種別に依存せず、機械翻訳、言語モデル、画像キャプション生成など、LSTMベースのタスクに一貫して適用された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。