Skip to main content
QUICK REVIEW

[論文レビュー] Logarithmic Pruning is All You Need

Laurent Orseau, Marcus Hütter|arXiv (Cornell University)|Jun 22, 2020
Advanced Neural Network Applications参考文献 15被引用数 8
ひとこと要約

この論文は、大きなランダム初期化されたReLUネットワークが、対象の重みを高精度で近似する部分ネットワークを含み得ることを示しており、過パラメータ化は対数的である——具体的には、対象の重み1つあたりO(log(n_max/ε))個のニューロンで十分——したがって、訓練なしに強力な性能を達成するにはプルーニングが十分であることが証明され、従来の多項式バウンドを著しく改善する。

ABSTRACT

The Lottery Ticket Hypothesis is a conjecture that every large neural network contains a subnetwork that, when trained in isolation, achieves comparable performance to the large network. An even stronger conjecture has been proven recently: Every sufficiently overparameterized network contains a subnetwork that, at random initialization, but without training, achieves comparable accuracy to the trained large network. This latter result, however, relies on a number of strong assumptions and guarantees a polynomial factor on the size of the large network compared to the target function. In this work, we remove the most limiting assumptions of this previous work while providing significantly tighter bounds:the overparameterized network only needs a logarithmic factor (in all variables but depth) number of neurons per weight of the target subnetwork.

研究の動機と目的

  • 訓練なしに、大きなネットワークが対象ネットワークを近似する部分ネットワークを含むために必要な過パラメータ化の理論的バウンドをより厳密に確立すること。
  • 従来の研究で強い仮定(例:重みや入力のノルムが有界であること)を排除しつつ、主な変数におけるスケーリングを多項式から対数的へ改善すること。
  • 重み1つあたり対数的過パラメータ化が、高精度な近似に十分であることを示し、プルーニングが過パラメータ化ネットワークにおける学習の中心的メカニズムであるという考えを支持すること。
  • 『ラッキーチケット』の存在を理論的に裏付けることで、ラッキーチケット仮説の理論的基盤を提供すること。

提案手法

  • 重みを双曲的(1/v)分布からサンプリングすることで、対数的近似が可能になるように、大きな全結合ReLUネットワークを構築する。
  • 黄金比分解戦略を用いて、任意の対象重みを幾何的に間隔を空けた区間からのサンプル重みの少数の和として表現する。
  • 各区間が少なくとも1つのサンプル重みを含む確率を確率的議論でバウンドし、高確率での成功を保証する。
  • 濃度不等式を用いて、m = O(k′ log(k′/δ)) 個のサンプルで十分であることを示し、ここでk′ = log_{3/2}(3w_max/(2ε)) は分解における区間数である。
  • 高確率(1−δ)で、高々k′個の活性ニューロンを持つ部分ネットワークが、任意の対象重みをεの精度内で近似できることを証明する。
  • 1/v分布のスケール不変性を活用して、異なる重みの大きさにわたり一般化可能であり、正規化制約を必要としない。

実験結果

リサーチクエスチョン

  • RQ1訓練なしに、対象ネットワークを近似する部分ネットワークを探索するための過パラメータ化を、対象ネットワークサイズの多項式的スケーリングから対数的スケーリングに低減できるか?
  • RQ2重みや入力のノルムが有界であると仮定しない状況でも、ランダム初期化されたネットワークに『ラッキーチケット』が存在するか?
  • RQ3対象重み1つあたり対数的数のニューロンで十分に高精度な近似がプルーニングによって達成できるか?
  • RQ4任意の対象重みをεの精度内で和として表現するための最小サンプル重み数は何か?
  • RQ5重みのサンプリング分布の選択(例:1/v vs. 均一分布)が、近似のための必要過パラメータ化にどのように影響するか?

主な発見

  • 重みと入力のノルムが有界であると仮定すると、必要なニューロン数は対象重み1つあたり Õ(log(n_max/ε)) にスケーリングされ、従来の多項式バウンドに比べ顕著に改善される。
  • ノルムの有界性仮定を外した場合、必要なニューロン数は Õ(ℓ log(n_max/ε)) にスケーリングされ、深さℓの依存性が避けられないことが示される。
  • 双曲的重み分布(1/v)は、スケール不変性と対数的区間における均一なカバーを保証することで、対数的近似を可能にする。
  • 高確率(1−δ)で、サイズ Õ(log(1/ε) · log(1/δ)) の部分ネットワークが、わずか数個の活性ニューロンで任意の対象重みをεの精度内で近似可能である。
  • 訓練を必要とせず、最小限の過パラメータ化で、ランダム初期化時から『ラッキーチケット』が存在することを示している。
  • 理論的枠組みは、確率的勾配降下法が主にプルーニング機構として機能し、グローバル最適解に近い部分ネットワークを露わにするのだと示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。