Skip to main content
QUICK REVIEW

[論文レビュー] Selfish Sparse RNN Training

Shiwei Liu, Decebal Constantin Mocanu|arXiv (Cornell University)|Jan 22, 2021
Advanced Neural Network Applications参考文献 57被引用数 12
ひとこと要約

本稿では、固定されたパラメータ数を維持したまま、スパースな再帰的ニューラルネットワーク(RNN)をスクラッチから訓練するための手法 Selfish-RNN を提案する。新しいスパース最適化手法(SNT-ASGD)と非一様なゲート単位の重み再配分を用い、正則化を向上させる。Penn TreeBank および Wikitext-2 において、スパース化のための密度からスパースへのプルーニング手法を上回る最先端の性能を達成する。

ABSTRACT

Sparse neural networks have been widely applied to reduce the computational demands of training and deploying over-parameterized deep neural networks. For inference acceleration, methods that discover a sparse network from a pre-trained dense network (dense-to-sparse training) work effectively. Recently, dynamic sparse training (DST) has been proposed to train sparse neural networks without pre-training a dense model (sparse-to-sparse training), so that the training process can also be accelerated. However, previous sparse-to-sparse methods mainly focus on Multilayer Perceptron Networks (MLPs) and Convolutional Neural Networks (CNNs), failing to match the performance of dense-to-sparse methods in the Recurrent Neural Networks (RNNs) setting. In this paper, we propose an approach to train intrinsically sparse RNNs with a fixed parameter count in one single run, without compromising performance. During training, we allow RNN layers to have a non-uniform redistribution across cell gates for better regularization. Further, we propose SNT-ASGD, a novel variant of the averaged stochastic gradient optimizer, which significantly improves the performance of all sparse training methods for RNNs. Using these strategies, we achieve state-of-the-art sparse training results, better than the dense-to-sparse methods, with various types of RNNs on Penn TreeBank and Wikitext-2 datasets. Our codes are available at https://github.com/Shiweiliuiiiiiii/Selfish-RNN.

研究の動機と目的

  • 既存の動的スパース訓練(DST)手法が RNN で性能が劣ることに対処すること。これは、密度からスパースへのアプローチに劣る。
  • 事前学習された密度モデルを経由せずに、固定されたパラメータ数を維持したまま、エンド・ツー・エンドのスパース RNN 訓練を可能にすること。
  • LSTMセルのゲート間で非一様に重みを再配分することで、スパース RNN の一般化性能と性能を向上させること。
  • スパース訓練に適した、収束性と性能を向上させる SNT-ASGD と呼ばれる新しい最適化手法の開発。
  • スパース接続のトポロジカル構造を分析し、RNN における重み増加とスパースネス分布に関して直感に反する知見を明らかにすること。

提案手法

  • SNT-ASGD を導入する。これは、非単調な平均化を特徴とする、平均化された確率的勾配降下法のスパース版であり、スパース RNN 訓練に特化している。
  • 訓練中に LSTM セルのゲート(入力、忘れ、セル、出力)間で非一様に重みを再配分することで、正則化を強化する。
  • 訓練全体を通して固定されたスパースネスレベルを維持し、繰り返しのプルーニングや成長フェーズを回避する。
  • グラフ理論的指標を用いて、異なるスパース接続パターン間のトポロジカル距離を定量化する。
  • ゼロ重みパラメータの計算をスキップするバックワードパス機構を採用し、非存在の勾配を保存せずに FLOPs を削減する。
  • RNN における、さまざまなスパースネス分布(均一、Erdős-Rényi、ERK)と重み増加戦略(ランダム vs. 勾配ベース)を評価する。

実験結果

リサーチクエスチョン

  • RQ1動的スパース訓練は、密度からスパースへの手法に匹敵する最先端の性能を RNN で達成できるか?
  • RQ2LSTM セルのゲート間で非一様に重みを再配分することは、一般化性能とモデル性能を向上させるか?
  • RQ3スパースネス分布の選択(均一 vs. Erdős-Rényi)が、スパース RNN の性能に与える影響は何か?
  • RQ4なぜランダムベースの重み増加戦略が、スパース RNN 訓練において勾配ベースの戦略を上回るのか?
  • RQ5低損失のスパース RNN アーキテクチャのトポロジカル多様性は何か?また、それらはどのように相違するのか?

主な発見

  • Selfish-RNN は Penn TreeBank および Wikitext-2 で最先端の性能を達成し、密度からスパースへのプルーニング手法および既存の DST 手法を上回る。
  • すべての RNN モデルにおいて、忘れゲートの重みが一貫して最もスパースになる。一方、セルおよび出力ゲートの重みは平均よりも密度が高い。
  • CNN や MLP とは対照的に、ランダムベースの重み増加戦略がスパース RNN 訓練で勾配ベースの戦略を上回る。
  • Erdős-Rényi(ER)分布の理論的利点にもかかわらず、RNN では均一なスパースネス分布が ER 分布よりも優れた性能を示す。
  • 性能の良い低損失のスパース RNN は多数存在し、それらはトポロジカルに異なるため、有効なスパースアーキテクチャの豊かな多様性が存在することが示された。
  • SNT-ASGD は、すべてのスパース訓練手法において RNN の性能を顕著に向上させ、汎用最適化手法としての有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。