Skip to main content
QUICK REVIEW

[論文レビュー] Mildly Overparametrized Neural Nets can Memorize Training Data Efficiently

Rong Ge, Runzhe Wang|arXiv (Cornell University)|Sep 26, 2019
Stochastic Gradient Optimization Techniques参考文献 38被引用数 14
ひとこと要約

この論文は、多項式活性化関数を備えた2層および3層のニューラルネットワークが、訓練データを記憶可能であり、訓練サンプル数に対して定数倍のパラメータ増加で十分であり、わずかな過パラメータ化によって完全な記憶が達成できることを示している。局所的最小値がすべてグローバルに最適であることを証明することで、摂動付き勾配降下法が訓練誤差0に収束することを示しており、隠れ層サイズが訓練サンプル数に対して非線形に増加する場合でも成立する。

ABSTRACT

It has been observed \citep{zhang2016understanding} that deep neural networks can memorize: they achieve 100\% accuracy on training data. Recent theoretical results explained such behavior in highly overparametrized regimes, where the number of neurons in each layer is larger than the number of training samples. In this paper, we show that neural networks can be trained to memorize training data perfectly in a mildly overparametrized regime, where the number of parameters is just a constant factor more than the number of training samples, and the number of neurons is much smaller.

研究の動機と目的

  • パラメータ数が訓練サンプル数に対して定数倍であるような、わずかに過パラメータ化されたニューラルネットワークにおける記憶の理論的理解のギャップを埋める。
  • 従来の研究が極めて過パラメータ化された設定を必要としていたのに対し、単純な最適化アルゴリズム(例:摂動付き勾配降下法)がこのような状況でも完全な記憶を達成できることを示す。
  • 入力が一般位置にある場合に、2層ネットワーク(2次活性化関数)および3層ネットワーク(多項式活性化関数)の最適化の地形に偽の局所的最小値が存在しないことを確立する。
  • 滑らか化解析(入力の確率的摂動)および決定的一般位置条件の両方の下で理論的保証を提供する。
  • パラメータ数が訓練サンプル数に対して線形に増加することを示し、従来の研究が二次関数的以上に必要なパラメータ数を大幅に改善する。

提案手法

  • 訓練サンプル数 $n \leq \binom{d+1}{2}$ の場合に、2層ネットワーク(2次活性化関数)を提案し、隠れ層サイズを $2d+2$ とする。
  • 中間層の重みに対して摂動付き勾配降下法(PGD)を用い、グローバル最小値への収束と訓練誤差0の達成を保証する。
  • 最適化の地形を解析し、すべての局所的最小値がグローバルに最適であることを証明する。その根拠として、変換されたデータ行列の特異値の下界を用いる。
  • 入力データを高次多項式特徴に変換するための確率的特徴マッピングを導入し、$r_i \sim \mathcal{N}(0, I)$ として定義する。これにより、ネットワークの挙動を線形化できる。
  • 行列濃度不等式と特異値解析を用い、合成特徴行列 $(Q \otimes Q)X$ の最小特異値を下から抑え、弱い条件下でも逆行列が存在することを保証する。
  • 特徴マップの最小特異値およびノルムに関する確率的境界を確立し、高い確率で最適化の地形が良好に条件付けられていることを示す。

実験結果

リサーチクエスチョン

  • RQ1訓練サンプル数に対して定数倍のパラメータ数を有するニューラルネットワークが、任意の訓練データを記憶できるか?
  • RQ2隠れ層サイズが $n$ に対して非線形に増加するようなわずかに過パラメータ化された設定において、摂動付き勾配降下法が訓練誤差0に収束するか?
  • RQ3このようなネットワークの最適化の地形に、偽の局所的最小値が存在しないことを保証できるか?
  • RQ4多項式活性化関数と単純な最適化アルゴリズムを用いた場合、記憶に必要な最小パラメータ数は何か?
  • RQ5入力分布(例:摂動付きまたは一般位置)は、一般化性能および最適化の保証にどのように影響するか?

主な発見

  • 一般位置にある $n \leq \binom{d+1}{2}$ 個の訓練サンプルに対して、2次活性化関数を備えた2層のReLUに類似したネットワークで、隠れニューロン数 $2d+2$ を用いることで、$O(d^2)$ のパラメータ数でデータを記憶可能である。
  • 偽の局所的最小値が存在しないため、中間層の重みに対する摂動付き勾配降下法は、高い確率で訓練誤差0に収束する。
  • 入力が $n \leq d^p$ の場合、多項式活性化関数を備えた3層ネットワークで、各層に $O_p(\sqrt{n})$ 個のニューロンを用いることで、任意のデータを記憶可能であり、パラメータ数は $n$ に対して線形に増加する。
  • 変換されたデータ行列 $(Q \otimes Q)X$ の最小特異値は、高い確率で $\Omega_p(\delta^{2/((\alpha-1)D_d^p)} / k^{(p+1)/(\alpha-1)}) \sigma_{\min}(X)$ で下から抑えられ、逆行列の存在を保証する。
  • 特徴マップのノルムは $\sqrt{k}(2B\sqrt{d\ln(kd\delta^{-1/2})})^p$ で上から抑えられ、最適化中の安定性が保証される。
  • 摂動半径 $\sqrt{v}$ の滑らか化解析のもとで、結果が成り立つ。保証は $v$ に対して逆多項式的に依存し、ネットワークサイズとは無関係である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。