Skip to main content
QUICK REVIEW

[論文レビュー] A law of robustness for two-layers neural networks

Sébastien Bubeck, Yuanzhi Li|arXiv (Cornell University)|Sep 30, 2020
Neural Networks and Applications参考文献 22被引用数 8
ひとこと要約

本稿では、一般データを完璧にフィットさせるために、2層ニューラルネットワークはリプシッツ定数が $\sqrt{n/k}$ のオーダーである必要があるという予想を提示している。これは、ロバストネスの実現にはオーバーパrametrization(過剰パラメータ化)が必要であることを示唆しており、特に $O(1)$ リプシッツ連続性を達成するには $k \approx n$ 個のニューロンが必要である。一方、単なるデータフィッティングには $k \approx n/d$ 個のニューロンで十分である。著者らは、スペクトルノルムの境界、高次元的状況($n \approx d$)、多項式活性化関数の設定において、この予想の弱化版を証明しており、実験により最大勾配と $\sqrt{n/k}$ の間には線形関係が存在することが示されている。

ABSTRACT

We initiate the study of the inherent tradeoffs between the size of a neural network and its robustness, as measured by its Lipschitz constant. We make a precise conjecture that, for any Lipschitz activation function and for most datasets, any two-layers neural network with $k$ neurons that perfectly fit the data must have its Lipschitz constant larger (up to a constant) than $\sqrt{n/k}$ where $n$ is the number of datapoints. In particular, this conjecture implies that overparametrization is necessary for robustness, since it means that one needs roughly one neuron per datapoint to ensure a $O(1)$-Lipschitz network, while mere data fitting of $d$-dimensional data requires only one neuron per $d$ datapoints. We prove a weaker version of this conjecture when the Lipschitz constant is replaced by an upper bound on it based on the spectral norm of the weight matrix. We also prove the conjecture in the high-dimensional regime $n \approx d$ (which we also refer to as the undercomplete case, since only $k \leq d$ is relevant here). Finally we prove the conjecture for polynomial activation functions of degree $p$ when $n \approx d^p$. We complement these findings with experimental evidence supporting the conjecture.

研究の動機と目的

  • ニューラルネットワークのサイズとロバストネス(リプシッツ定数によって測定)の間の根本的トレードオフを調査すること。
  • 一般データ上で学習された2層ReLUネットワークにおいて、オーバーパラメータ化がロバストネスに必要かどうかを特定すること。
  • ネットワークサイズ $k$、データサイズ $n$、および達成可能な最小リプシッツ定数との関係を形式化し、部分的な証明を行うこと。
  • ロバストネスに必要なパラメータ数が、単なるデータフィッティングに必要な数よりも著しく多いという理論的・実験的証拠を提供すること。

提案手法

  • 任意の2層ネットワークが一般データを完璧にフィットさせる場合、リプシッツ活性化関数を前提に、リプシッツ定数が $\Omega(\sqrt{n/k})$ 以上であると述べる予想を提示する。
  • 重み行列のスペクトルノルムを用いてリプシッツ定数の境界を設定することで、予想の弱化版を証明する。
  • 高次元的状況($n \approx d$)において、集中法とテンソル分解技術を用いて予想を確立する。
  • 多項式活性化関数(次数 $p$)に対して、$n \approx d^p$ のとき、マークフ・ブラザーズの不等式とテンソルノルムの下界を活用して予想を証明する。
  • ミニバッチ正則化とAdam最適化を用いたReLUネットワークの実験的訓練により、最大勾配をリプシッツ定数の代理として測定する。
  • 2つの実験を実施する:(1) $n/k$ を変化させ、$\sqrt{n/k}$ スケーリングの妥当性を検証する。 (2) $k=n$ と $k=10n/d$ を比較し、ロバストネスとネットワークサイズのトレードオフを検証する。

実験結果

リサーチクエスチョン

  • RQ1一般データ上で学習された2層ニューラルネットワークにおいて、ロバストネスの実現にはオーバーパラメータ化が必要か?
  • RQ2$k$ 個のニューロンを用いて $n$ 個のデータポイントを完璧にフィットさせる2層ネットワークの最小達成可能リプシッツ定数は何か?
  • RQ3データサイズ $n$ と入力次元 $d$ が増加するに従い、$O(1)$ リプシッツ連続性を達成するためのネットワークサイズはどのようにスケーリングされるか?
  • RQ4多項式活性化関数や高次元的状況といった特定の条件下で、予想される $\sqrt{n/k}$ のリプシッツ定数下界を証明できるか?
  • RQ5ReLUネットワークの実験的訓練により、最大勾配と $\sqrt{n/k}$ の間の予測された線形依存関係が確認されるか?

主な発見

  • 予想により、ロバストネスの実現には $k \approx n$ 個のニューロンが必要であるが、データフィッティングのみでは $k \approx n/d$ 個で十分であり、ロバストネスの実現には次元 $d$ 倍の過剰パラメータ化が必要であることが示唆される。
  • 多項式活性化関数(次数 $p$)に対しては、$n \approx d^p$ のとき、リプシッツ定数の下界が $\Omega(\sqrt{n/k})$ に保証される。
  • 高次元的状況($n \approx d$)では、予想が証明されており、$O(1)$ リプシッツ連続性を達成するには $k \approx n$ 個のニューロンが必要であることが示されている。
  • スペクトルノルムに基づく境界により、弱化版の予想が証明され、$k$ 秩の行列がデータをフィットさせる場合、$\|T\|_{\mathrm{op}} \geq c \frac{\sqrt{nd}}{k}$ が成り立つ。
  • 実験により、最大勾配(リプシッツ定数の代理)と $\sqrt{n/k}$ の間には線形的傾向が確認され、予想の実験的裏付けが得られた。
  • $k = n$ の場合、$\sqrt{d}$ が増加しても最大勾配は概ね一定に保たれるが、$k = 10n/d$ の場合、勾配は $\sqrt{d}$ に線形に増加する。これは理論的トレードオフを裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。