[論文レビュー] On Sparsity in Overparametrised Shallow ReLU Networks
本稿では、過パラメータ化された浅いReLUネットワークにおけるラベルノイズによる暗黙的正則化と、明示的な変動ノルム正則化の両方が、ネットワーク幅にかかわらず、有限個のニューロンのみが活性化される、つまりスパースなサポートを持つ解をもたらすことを示している。主な結果は、これらの正則化が無限次元最適化問題を有限次元線形計画問題に写像することであり、過パラメータ化領域における理論的保証を可能にする。
The analysis of neural network training beyond their linearization regime remains an outstanding open question, even in the simplest setup of a single hidden-layer. The limit of infinitely wide networks provides an appealing route forward through the mean-field perspective, but a key challenge is to bring learning guarantees back to the finite-neuron setting, where practical algorithms operate. Towards closing this gap, and focusing on shallow neural networks, in this work we study the ability of different regularisation strategies to capture solutions requiring only a finite amount of neurons, even on the infinitely wide regime. Specifically, we consider (i) a form of implicit regularisation obtained by injecting noise into training targets [Blanc et al.~19], and (ii) the variation-norm regularisation [Bach~17], compatible with the mean-field scaling. Under mild assumptions on the activation function (satisfied for instance with ReLUs), we establish that both schemes are minimised by functions having only a finite number of neurons, irrespective of the amount of overparametrisation. We study the consequences of such property and describe the settings where one form of regularisation is favorable over the other.
研究の動機と目的
- 過パラメータ化された浅いReLUネットワークにおける正則化戦略が、無限大の幅を持ちながらも有限個のニューロンに制限されたサポートを持つ解をもたらす仕組みを理解すること。
- 無限幅の平均場解析と有限幅の実用的ニューラルネットワークの間のギャップを埋めるために、スパース解が出現する条件を同定すること。
- スパarsityを促進する観点で、ラベルノイズによる暗黙的正則化と明示的な変動ノルム正則化の有効性および構造的性質を比較すること。
- これらの正則化下での最適化問題が、過パラメータ化極限においても有限次元線形計画問題に還元されることを示すこと。
- 勾配ベースの学習が有限幅ネットワークで成功する理論的根拠を、スパースで低複雑性の解に結びつけること。
提案手法
- ネットワークパラメータ上の確率測度を用いて、平均場的枠組みにおける浅いReLUネットワークを分析する。
- ラベルノイズに起因する暗黙的正則化と変動ノルム(TV)正則化を含む一般化された正則化ファミリーを導入する。
- 活性化関数にやや弱い仮定(例:ReLU)を課した場合、これらの正則化された目的関数の最小化解がパラメータ空間上でスパースなサポートを持つことを証明する。
- 射影空間における超平面アレンジメントの構造を用いて、元の無限次元問題と同等の有限次元線形計画問題を定義する。
- リプレーサー定理を適用し、得られる線形計画問題の解がスパースであることを示し、サポートサイズはデータポイント数以下であることを示す。
- 凸解析と曲率特性を活用して、過パラメータ化設定下で勾配降下法がこれらのスパース最小化解に収束できることを議論する。
実験結果
リサーチクエスチョン
- RQ1過パラメータ化されたReLUネットワークにおけるラベルノイズによる暗黙的正則化は、有限個のニューロンに制限されたサポートを持つ解をもたらすか?
- RQ2浅いReLUネットワークの平均場極限において、変動ノルム正則化は過パラメータ化にかかわらずスパース解を生じるか?
- RQ3スパarsityおよび不変性の観点から、暗黙的正則化と明示的正則化の構造的性質にはどのような相違があるか?
- RQ4過パラメータ化ネットワークにおける無限次元最適化問題は、どの程度まで有限次元線形計画問題に還元可能か?
- RQ5射影空間におけるデータに起因する超平面アレンジメントから導かれる指数的サイズの線形計画問題は、どのようなデータ条件下で計算的に扱えるか?
主な発見
- 過パラメータ化された浅いReLUネットワークにおける、ラベルノイズによる暗黙的正則化と、明示的な変動ノルム正則化の両方が、ネットワーク幅にかかわらずスパースなサポートを持つ最小化解をもたらす。
- 正則化が誘導する凸性のおかげで、無限大幅極限においても、正則化学習問題の最小化解は有限個のニューロンに限定されたサポートを持つ。
- リプレーサー定理のおかげで、問題は高々n個の非ゼロ係数(nはデータポイント数)を持つ有限次元線形計画問題に還元される。
- 射影空間におけるデータに起因する超平面アレンジメントの細胞数が、線形計画問題のサイズを決定し、これは次元に対して指数関数的に増加する。
- 変動ノルム正則化はバイアスパラメータに対して平行移動不変性を満たさず、バイアス依存性を排除するとスパース性の結果は成立しなくなる。
- 理論的結果から、最小化解がサポート周辺で局所的凸性と正の曲率を示すため、勾配降下法の収束に有利な幾何的性質があると示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。