Skip to main content
QUICK REVIEW

[論文レビュー] Why Random Pruning Is All We Need to Start Sparse

Advait Gadhikar, Sohum Mukherjee|arXiv (Cornell University)|Oct 5, 2022
Music and Audio Processing被引用数 4
ひとこと要約

本稿は、特にランダムにマスクされた(ER)ネットワークであるランダムにプルーニングされたニューラルネットワークが、スパースモデルの学習のための効果的で計算コストが低い初期化として機能できることを示している。性能は、ドメインネットワークや最先端のロットリート・スパース化と同等であり、理論的には、逆スパース性の対数的要因で広いランダムネットワークが任意のターゲットネットワークを近似できることを証明しており、これにより、ドメイン初期化を回避し、計算コストを削減する「スパースからスパースへの学習」が可能になる。

ABSTRACT

Random masks define surprisingly effective sparse neural network models, as has been shown empirically. The resulting sparse networks can often compete with dense architectures and state-of-the-art lottery ticket pruning algorithms, even though they do not rely on computationally expensive prune-train iterations and can be drawn initially without significant computational overhead. We offer a theoretical explanation of how random masks can approximate arbitrary target networks if they are wider by a logarithmic factor in the inverse sparsity $1 / \log(1/ ext{sparsity})$. This overparameterization factor is necessary at least for 3-layer random networks, which elucidates the observed degrading performance of random networks at higher sparsity. At moderate to high sparsity levels, however, our results imply that sparser networks are contained within random source networks so that any dense-to-sparse training scheme can be turned into a computationally more efficient sparse-to-sparse one by constraining the search to a fixed random mask. We demonstrate the feasibility of this approach in experiments for different pruning methods and propose particularly effective choices of initial layer-wise sparsity ratios of the random source network. As a special case, we show theoretically and experimentally that random source networks also contain strong lottery tickets.

研究の動機と目的

  • イテレーティブプルーニングや再訓練を伴わないにもかかわらず、初期化段階でのランダムプルーニングが実際には驚くほどうまく機能する理由を説明すること。
  • 制御された過パラメータ化の下で、ランダムスパースネットワークの普遍的近似能力に理論的基盤を提供すること。
  • 初期化にドメインネットワークを用いない「スパースからスパースへの学習」が、ドメインからスパースへの学習と同等またはそれ以上の性能を達成できることを示すこと。
  • 強いロットリート・チケット(SLT)がスパースなランダムソースネットワーク内に存在し、探索コストを低減できることを示すこと。
  • 性能と効率を最大化するための、最適なレイヤーごとのスパースリティ比を提案すること。

提案手法

  • 理論的分析により、3層のランダムネットワークが、ターゲットネットワークの幅が逆スパース性の対数的要因 O(1/log(1/sparsity)) だけ大きい場合に、任意のターゲットネットワークを近似できることを証明し、必要な過パラメータ化条件を確立する。
  • 1隠れ層のランダムネットワークに必要な幅の下限を導出し、普遍的近似のためには対数的過パラメータ化が必要であることを示す。
  • 「スパースからスパースへの学習」を提案:固定されたランダムスパースマスク(ER)で初期化し、IMP や連続的スパース化といったプルーニングアルゴリズムを適用する。
  • 複数のアーサテクチャとデータセットで検証された、初期ランダムネットワークにおけるレイヤーごとのスパースリティ比を提案し、性能と効率を向上させる。
  • 反復的マグニチュードプルーニング(IMP)やその他の手法を用いて、ImageNet、GCN、アルゴリズム的データ、表形式データの上で、実験的に評価する。
  • 強いロットリート・チケット(SLT)がスパースなランダムネットワーク内に存在し、初期化フリーの学習が可能であることを示す。

実験結果

リサーチクエスチョン

  • RQ1ランダムスパースネットワークは任意のターゲットネットワークを近似可能か? また、そのために必要な過パラメータ化の程度は?
  • RQ2なぜ初期化段階でのランダムプルーニングが、より複雑なプルーニング方式よりも実際には優れているのか?
  • RQ3ドメインネットワークから出発しないで、スパースモデルを効果的に学習することは可能か?
  • RQ4強いロットリート・チケットはスパースなランダムソースネットワーク内に存在するか? また、それらは効率的に発見可能か?
  • RQ5初期ランダムネットワークの最適なレイヤーごとのスパースリティ比は何か? これにより性能と効率を最大化できるか?

主な発見

  • O(1/log(1/sparsity)) の要因で広いランダムネットワークは、任意のターゲットネットワークを近似でき、ランダムプルーニングの有効性を理論的に裏付ける。
  • 必要な過パラメータ化は3層のランダムネットワークにおいて必須であり、非常に高いスパース性では性能の低下が生じる理由を説明する。
  • 固定されたランダムマスクを用いたスパースからスパースへの学習は、CIFAR-10、ImageNet、GCNにおいて、ドメインからスパースへの学習と同等またはそれ以上の性能を達成する。
  • ResNet-50 を用いたImageNet実験では、50% スパースなランダムネットワークから出発しても、80% スパースなモデルを71.73% の精度で学習可能であり、ドメイン初期化と同等の性能を示す。
  • GCNの実験では、40% スパースな初期ネットワークから出発した場合、70% スパースなモデルで81.9% の精度を達成し、ドメイン初期化の83.33% とわずかに下回るにとどまる。
  • アルゴリズム的データおよび表形式データでは、スパースからスパースへの学習がドメインからスパースへの学習と同一の性能を達成しており、分野を越えた堅牢性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。