[論文レビュー] Selfish Sparse RNN Training
本稿では、固定されたパラメータ数を維持したまま、スパースな再帰的ニューラルネットワーク(RNN)をスクラッチから訓練するための手法 Selfish-RNN を提案する。新しいスパース最適化手法(SNT-ASGD)と非一様なゲート単位の重み再配分を用い、正則化を向上させる。Penn TreeBank および Wikitext-2 において、スパース化のための密度からスパースへのプルーニング手法を上回る最先端の性能を達成する。
Sparse neural networks have been widely applied to reduce the computational demands of training and deploying over-parameterized deep neural networks. For inference acceleration, methods that discover a sparse network from a pre-trained dense network (dense-to-sparse training) work effectively. Recently, dynamic sparse training (DST) has been proposed to train sparse neural networks without pre-training a dense model (sparse-to-sparse training), so that the training process can also be accelerated. However, previous sparse-to-sparse methods mainly focus on Multilayer Perceptron Networks (MLPs) and Convolutional Neural Networks (CNNs), failing to match the performance of dense-to-sparse methods in the Recurrent Neural Networks (RNNs) setting. In this paper, we propose an approach to train intrinsically sparse RNNs with a fixed parameter count in one single run, without compromising performance. During training, we allow RNN layers to have a non-uniform redistribution across cell gates for better regularization. Further, we propose SNT-ASGD, a novel variant of the averaged stochastic gradient optimizer, which significantly improves the performance of all sparse training methods for RNNs. Using these strategies, we achieve state-of-the-art sparse training results, better than the dense-to-sparse methods, with various types of RNNs on Penn TreeBank and Wikitext-2 datasets. Our codes are available at https://github.com/Shiweiliuiiiiiii/Selfish-RNN.
研究の動機と目的
- 既存の動的スパース訓練(DST)手法が RNN で性能が劣ることに対処すること。これは、密度からスパースへのアプローチに劣る。
- 事前学習された密度モデルを経由せずに、固定されたパラメータ数を維持したまま、エンド・ツー・エンドのスパース RNN 訓練を可能にすること。
- LSTMセルのゲート間で非一様に重みを再配分することで、スパース RNN の一般化性能と性能を向上させること。
- スパース訓練に適した、収束性と性能を向上させる SNT-ASGD と呼ばれる新しい最適化手法の開発。
- スパース接続のトポロジカル構造を分析し、RNN における重み増加とスパースネス分布に関して直感に反する知見を明らかにすること。
提案手法
- SNT-ASGD を導入する。これは、非単調な平均化を特徴とする、平均化された確率的勾配降下法のスパース版であり、スパース RNN 訓練に特化している。
- 訓練中に LSTM セルのゲート(入力、忘れ、セル、出力)間で非一様に重みを再配分することで、正則化を強化する。
- 訓練全体を通して固定されたスパースネスレベルを維持し、繰り返しのプルーニングや成長フェーズを回避する。
- グラフ理論的指標を用いて、異なるスパース接続パターン間のトポロジカル距離を定量化する。
- ゼロ重みパラメータの計算をスキップするバックワードパス機構を採用し、非存在の勾配を保存せずに FLOPs を削減する。
- RNN における、さまざまなスパースネス分布(均一、Erdős-Rényi、ERK)と重み増加戦略(ランダム vs. 勾配ベース)を評価する。
実験結果
リサーチクエスチョン
- RQ1動的スパース訓練は、密度からスパースへの手法に匹敵する最先端の性能を RNN で達成できるか?
- RQ2LSTM セルのゲート間で非一様に重みを再配分することは、一般化性能とモデル性能を向上させるか?
- RQ3スパースネス分布の選択(均一 vs. Erdős-Rényi)が、スパース RNN の性能に与える影響は何か?
- RQ4なぜランダムベースの重み増加戦略が、スパース RNN 訓練において勾配ベースの戦略を上回るのか?
- RQ5低損失のスパース RNN アーキテクチャのトポロジカル多様性は何か?また、それらはどのように相違するのか?
主な発見
- Selfish-RNN は Penn TreeBank および Wikitext-2 で最先端の性能を達成し、密度からスパースへのプルーニング手法および既存の DST 手法を上回る。
- すべての RNN モデルにおいて、忘れゲートの重みが一貫して最もスパースになる。一方、セルおよび出力ゲートの重みは平均よりも密度が高い。
- CNN や MLP とは対照的に、ランダムベースの重み増加戦略がスパース RNN 訓練で勾配ベースの戦略を上回る。
- Erdős-Rényi(ER)分布の理論的利点にもかかわらず、RNN では均一なスパースネス分布が ER 分布よりも優れた性能を示す。
- 性能の良い低損失のスパース RNN は多数存在し、それらはトポロジカルに異なるため、有効なスパースアーキテクチャの豊かな多様性が存在することが示された。
- SNT-ASGD は、すべてのスパース訓練手法において RNN の性能を顕著に向上させ、汎用最適化手法としての有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。