Skip to main content
QUICK REVIEW

[論文レビュー] The Efficacy of $L_1$ Regularization in Two-Layer Neural Networks

Gen Li, Yuantao Gu|arXiv (Cornell University)|Oct 2, 2020
Neural Networks and Applications被引用数 4
ひとこと要約

本稿では、2層ニューラルネットワークにおける$L_1$正則化が、隠れニューロン数の明示的選択なしにモデルの複雑さを制御することにより、近似的にミニマックス最適な一般化誤差バウンドを達成できることを示している。出力層の係数に$L_1$正則化を適用することで、リスクバウンドは$O((d/n)^{1/2})$のレート(対数要因を除く)を達成する。一方、入力層に$L_1$正則化を適用すると、入力次元$d$に依存しない次元フリーのバウンドが得られ、高次元設定におけるスパarsityとロバスト性を実現する。

ABSTRACT

A crucial problem in neural networks is to select the most appropriate number of hidden neurons and obtain tight statistical risk bounds. In this work, we present a new perspective towards the bias-variance tradeoff in neural networks. As an alternative to selecting the number of neurons, we theoretically show that $L_1$ regularization can control the generalization error and sparsify the input dimension. In particular, with an appropriate $L_1$ regularization on the output layer, the network can produce a statistical risk that is near minimax optimal. Moreover, an appropriate $L_1$ regularization on the input layer leads to a risk bound that does not involve the input data dimension. Our analysis is based on a new amalgamation of dimension-based and norm-based complexity analysis to bound the generalization error. A consequent observation from our results is that an excessively large number of neurons do not necessarily inflate generalization errors under a suitable regularization.

研究の動機と目的

  • 2層ニューラルネットワークにおけるモデルの複雑さと統計的リスクの課題、特に最適な隠れニューロン数の選択の難しさに対処すること。
  • $L_1$正則化が一般化誤差を制御するための明示的アーキテクチャ選択の代替手段として機能するかを調査すること。
  • 高次元入力次元に強く、ニューロン数に起因するバイアス-バリアンストレードオフを回避する、タイトな統計的リスクバウンドを導出すること。
  • 過剰に大きなニューロン数が、適切な$L_1$正則化のもとで一般化誤差を必ずしも増加させないことを確立すること。
  • 一般化誤差バウンドのための次元ベースとノルムベースのアプローチを統合する包括的な複雑さ解析を構築すること。

提案手法

  • 出力重みに対して$\|a\|_1 \leq V$を満たす関数クラス上での制約付き$L_1$推定器を提案し、入力重みに対して$\sup_j (\|w_j\|_1 + |b_j|) \leq \eta$を満たすようにすることで、統合的な正則化を可能にする。
  • 一般化誤差バウンドを導くために、次元ベースとノルムベースの複雑さ解析を組み合わせた新規な統合的手法を導入し、ラダマッハ複雑さとノルムベースの測度を併用する。
  • $L_1$トレーニング損失のもとでリスクバウンドを導出し、適切な正則化のもとで、ミニマックス最適な$O((d/n)^{1/2})$に近い収束レートを示す。
  • 入力層重みに$L_1$制約を課すことで、入力次元$d$に依存しない次元フリーのリスクバウンドを達成し、真のスパarsityレベル$k$にのみ依存する。
  • 有界な入力ドメインの仮定を用いて、$d$および$r$に依存しないリスクバウンドを導出し、$\mathcal{R}(\hat{f}_n) \lesssim C\delta_\eta + \frac{V\eta + \tau}{\sqrt{n}}$を得る。
  • ReLUまたはシグモイド活性化関数を用い、サブガウスノイズを仮定することで、集中不等式を用いて高確率リスクバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1出力層に$L_1$正則化を適用することで、パラメトリックレート$O((d/n)^{1/2})$に近い統計的リスクバウンドを達成できるか?
  • RQ2入力層に$L_1$正則化を適用することで、入力次元$d$に依存しないリスクバウンドが得られ、高次元設定におけるスパarsityが実現可能か?
  • RQ3複数のアーキテクチャ(異なるニューロン数)を用いたモデル選択と比較して、$L_1$正則化を施した1つの巨大なニューラルネットワークが性能を上回るか?
  • RQ4過剰に大きな隠れニューロン数が、$L_1$正則化と組み合わせた場合に一般化誤差を増加させるか?
  • RQ5入力次元$d \gg n$の高次元入力環境下でも、提案手法が次元フリーのリスクバウンドを達成できるか?

主な発見

  • 出力層に$L_1$正則化を施した推定器は、$\mathcal{R}(\hat{f}_n) \lesssim \sqrt{\{d\log(dn)\}/n}$のリスクバウンドを達成し、$L_1$トレーニング損失のもとでミニマックス最適レート$O((d/n)^{1/2})$に近づく。
  • 入力層に$L_1$正則化を適用すると、リスクバウンドは$\mathcal{R}(\hat{f}_n) \lesssim \sqrt{\{k\log(dn)\}/n}$にまで低下し、$d$に依存しない($k$は真のスパarsityレベル)。
  • 出力層および入力層の両方に正則化を施した場合、リスクバウンド$\mathcal{R}(\hat{f}_n) \lesssim C\delta_\eta + \frac{V\eta + \tau}{\sqrt{n}}$は、$d$および$r$に依存しなくなる($r$が十分に大きい場合)。
  • $\sigma(x) = 1/(1+e^{-x})$および$\eta \asymp (n\log^2 n)^{1/3}$の下で、リスクバウンドは$\mathcal{R}(\hat{f}_n) \lesssim V(\log n / n)^{1/3}$にまで改善され、$d \gg n$のときには$O(n^{-1/2})$よりタイトになる。
  • 解析により、$L_1$正則化のもとで、ニューロン数が多すぎても一般化誤差が必ずしも増加しないことが示され、正則化が有効なモデル複雑さを制御していることが明らかになった。
  • 提案手法は、$d \gg n$であっても、対数要因を除いてミニマックス最適な次元フリーのリスクバウンドを達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。