Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Sparsification of Recurrent Neural Networks

Lobacheva Ekaterina, Nadezhda Chirkova|arXiv (Cornell University)|Jul 31, 2017
Neural Networks and Applications参考文献 21被引用数 14
ひとこと要約

本稿では、バイアス付きスパース変分ドロップアウト(Sparse VD)を用いた再帰的ニューラルネットワーク(RNN)のベイジアンスパース化を提案する。Gal & Ghahramani(2016b)のバイナリ変分ドロップアウトの知見を応用し、感情分析では最大99.5%、文字レベルの言語モデリングでは87.6%のスパースさを達成し、精度の低下を最小限に抑え、リソース制限のあるデバイスへの効率的で正則化され、圧縮されたRNNの展開を可能にする。

ABSTRACT

Recurrent neural networks show state-of-the-art results in many text analysis tasks but often require a lot of memory to store their weights. Recently proposed Sparse Variational Dropout eliminates the majority of the weights in a feed-forward neural network without significant loss of quality. We apply this technique to sparsify recurrent neural networks. To account for recurrent specifics we also rely on Binary Variational Dropout for RNN. We report 99.5% sparsity level on sentiment analysis task without a quality drop and up to 87% sparsity level on language modeling task with slight loss of accuracy.

研究の動機と目的

  • 自然言語処理や音声認識などの順序処理タスクにおける大規模RNNの高いメモリ使用量と計算コストを軽減すること。
  • ヒューリスティックなプルーニングや手動によるハイパーパramータチューニングの制限を克服し、原理的で自動的なスパース化をRNNに適用すること。
  • ベイジアン正則化と変分推論を用いて、高いスパースさを達成しながらもモデル性能を維持すること。
  • RNNに適したベイジアンドロップアウトの原則を統合することで、スパースVDフレームワークを再帰的アーキテクチャに適応すること(Gal & Ghahramani, 2016b)。
  • 精度の著しい低下を伴わずに、メモリ制限のあるモバイル端末やエッジデバイスへのRNNの効率的展開を可能にすること。

提案手法

  • 重み行列を完全に因子分解された正規事後分布 $ q(w_{ij}|m_{ij},\alpha_{ij}) = \mathcal{N}(m_{ij}, \alpha_{ij}m^{2}_{ij}) $ としてモデル化することで、RNNにスパース変分ドロップアウト(Sparse VD)を適応する。
  • 加法的再パラメータ化 $ w_{ij} = m_{ij} + \epsilon_{ij}, \epsilon_{ij} \sim \mathcal{N}(0, \sigma^{2}_{ij}) $ を用い、$ \alpha_{ij} = \sigma^{2}_{ij}/m^{2}_{ij} $ とすることで勾配分散を低減する。
  • 局所的再パラメータ化トリックを適用し、重みではなく前活性化にノイズを適用することで、学習効率と勾配安定性を向上させる。
  • 重みの大きさに一様対数事前分布 $ p(|w_{ij}|) \propto 1/|w_{ij}| $ を採用し、トレーニング中に自動的にスパース性を学習可能にする。
  • RNNの再帰的接続を適切に扱うために、RNN用のベイジアンドロップアウト(Gal & Ghahramani, 2016b)を統合し、勾配消失やメモリ損失を回避する。
  • 変分下界 $ \mathcal{L} $ を $ \{M, \log\sigma\} $ に関して最適化し、KLダイバージェンスを微分可能で解析的な形で近似:$ k(\alpha) \approx 0.64\sigma(1.87 + 1.49\log\alpha) - 0.5\log(1 + \alpha^{-1}) + C $。

実験結果

リサーチクエスチョン

  • RQ1スパース変分ドロップアウトは、モデル性能を保持したまま、再帰的ニューラルネットワークに効果的に拡張可能か?
  • RQ2バイアスタンスパース化を用いることで、顕著な精度低下を伴わずにRNNでどの程度のスパースさを達成できるか?
  • RQ3スパースVDとRNN用のベイジアンドロップアウトを組み合わせることで、一般化性能とモデル圧縮にどのような向上が得られるか?
  • RQ4本手法は、ヒューリスティックプルーニングや標準ドロップアウトと比較して、順序処理タスクにおけるスパースさと精度のトレードオフをどのように改善するか?
  • RQ5本手法を再帰層および埋め込み層に適用することで、大規模RNNモデルのさらなる圧縮が可能か?

主な発見

  • 感情分析タスクのIMDBデータセットでは、99.5%のスパースさを達成し、精度に顕著な低下がなく、高い圧縮効率を示した。
  • 文字レベルの言語モデリングタスクでは、重み行列($W^x$, $W^h$, $W^y$)で最大87.6%のスパースさを達成し、検証データのビット/文字数は1.499から1.506にわずかに増加したにとどまった。
  • 隠れ状態から隠れ状態への重み行列($W^h$)をVBDで初期化したモデルは、ランダム初期化よりも優れた性能を示し、構造的初期化の利点を示した。
  • スパースVDで訓練されたモデルは、初期エポックでスパース性が増加するため一時的に精度が低下したが、その後回復し、性能を維持した。
  • スパースVDとRNN用のベイジアンドロップアウトを組み合わせることで、手動によるハイパーパramータチューニングを必要とせず、自動的で原理的なスパース化が可能となり、過学習が軽減され、一般化性能が向上した。
  • 本手法により、モデルサイズを著しく削減しながらも競争力のある性能を維持できるため、メモリ制限のあるデバイスへの大規模RNNの展開が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。