Skip to main content
QUICK REVIEW

[論文レビュー] A Corrective View of Neural Networks: Representation, Memorization and Learning

Guy Bresler, Nagaraj, Dheeraj|arXiv (Cornell University)|Feb 1, 2020
Neural Networks and Applications参考文献 44被引用数 8
ひとこと要約

本稿では、ReLUおよび滑らかなReLUユニットをグループ化して逐次層で誤差を是正することで、関数近似を反復的に改善する是正ニューラルネットワークフレームワークを提案する。2層ネットワークが任意のデータを Õ(n/θ⁴) 個のユニットで記憶可能であり、低次の多項式を多項式的でない標本複雑度で学習可能であることが示され、滑らかな関数の表現や学習に深さが必須であるという仮定に疑問を呈する。

ABSTRACT

We develop a corrective mechanism for neural network approximation: the total available non-linear units are divided into multiple groups and the first group approximates the function under consideration, the second group approximates the error in approximation produced by the first group and corrects it, the third group approximates the error produced by the first and second groups together and so on. This technique yields several new representation and learning results for neural networks. First, we show that two-layer neural networks in the random features regime (RF) can memorize arbitrary labels for arbitrary points under under Euclidean distance separation condition using $ ilde{O}(n)$ ReLUs which is optimal in $n$ up to logarithmic factors. Next, we give a powerful representation result for two-layer neural networks with ReLUs and smoothed ReLUs which can achieve a squared error of at most $ε$ with $O(C(a,d)ε^{-1/(a+1)})$ for $a \in \mathbb{N}\cup\{0\}$ when the function is smooth enough (roughly when it has $Θ(ad)$ bounded derivatives). In certain cases $d$ can be replaced with effective dimension $q \ll d$. Previous results of this type implement Taylor series approximation using deep architectures. We also consider three-layer neural networks and show that the corrective mechanism yields faster representation rates for smooth radial functions. Lastly, we obtain the first $O(\mathrm{subpoly}(1/ε))$ upper bound on the number of neurons required for a two layer network to learn low degree polynomials up to squared error $ε$ via gradient descent. Even though deep networks can express these polynomials with $O(\mathrm{polylog}(1/ε))$ neurons, the best learning bounds on this problem require $\mathrm{poly}(1/ε)$ neurons.

研究の動機と目的

  • ニューラルネットワーク近似のための是正機構を開発し、表現力と学習効率を向上させること。
  • 深さが滑らかな関数の表現に本当に必要であるかを検証し、ディープラーニング理論における一般的な仮定に疑問を呈すること。
  • 2層ランダム特徴量ネットワークにおける勾配降下法を用いて低次の多項式の学習保証を提供すること。
  • ReLUベースのネットワークを用いて、高次元空間における任意ラベルの記憶の最適バウンドを確立すること。
  • 滑らかなReLUユニットが、標準ReLUと比較して滑らかな関数の近似効率を顕著に向上させることを示すこと。

提案手法

  • 非線形ユニットを順序付きのグループに分割:最初のグループが目的関数を近似し、2番目のグループがその誤差を是正し、以降同様に是正の階層を形成する。
  • ReLUおよび滑らかなReLU活性化関数を用いたランダム特徴量の枠組みを採用し、一般化と記憶のバウンドを達成する。
  • フーリエ解析とソボレフ空間の仮定を用いて、関数の滑らかさと微分の減衰に基づく近似誤差のバウンドを導出する。
  • 高次元関数を効率的に推定するために、低次元部分空間における確率的サンプリング手順を採用する。
  • 集中不等式と期待値バウンドを用いて、複数のランダムネットワークの平均化が一般化誤差を低減することを示す。
  • バンプ関数と直交射影を用いて、次元 q ≪ d の有効部分空間上で局所化され、滑らかに近似されるようにする。

実験結果

リサーチクエスチョン

  • RQ12層ニューラルネットワークがReLUおよび滑らかなReLUユニットを用いて、部分的最適な幅スケーリングで任意のラベルを最適に記憶可能か?
  • RQ2滑らかな関数の効率的表現に深さが本当に必要なのか?それとも浅いネットワークでも深層ネットワークの性能を再現可能か?
  • RQ32層ランダム特徴量ネットワークにおける再結合重みに対する勾配降下法が、低次の多項式の学習において多項式的でない(subpoly(1/ε))標本数で実現可能か?
  • RQ4有効次元 q < d が、有界な微分を持つ関数の近似効率にどのように影響するか?
  • RQ5是正学習スキームを用いた滑らかな関数の近似において、ネットワーク幅と近似誤差の最適なトレードオフは何か?

主な発見

  • 2層ReLUネットワークは、ℝᵈ内に存在するn個の任意の点を Õ(n/θ⁴) 個のユニットで記憶可能であり、θは最小点間距離である。このバウンドは対数要因を除いて最適である。
  • Θ(ad) の有界な微分を持つ関数に対して、2層ネットワークがReLUおよび滑らかなReLUユニットを用いて、ε-近似を O(C(a,d)ε⁻¹ᐟ⁽ᵃ⁺¹⁾) 個のユニットで達成可能であり、d は有効次元 q ≪ d にまで低減可能である。
  • 2層ランダム特徴量ネットワークにおける再結合重みに対する勾配降下法は、二乗誤差εを用いて低次の多項式を学習可能であり、多項式的でない(subpoly(1/ε))数のユニットで実現可能であり、これは初めての保証である。
  • 理論的結果から、滑らかな関数の効率的表現に深さは必要ではないことが示され、ディープラーニング理論における一般的な仮定に反する。
  • 滑らかなReLUユニットの使用により、よりタイトな近似バウンドと一般化性能の向上が可能となり、特に有効次元が低く、次元が高次元である状況で顕著である。
  • 低次元部分空間への射影と局所化バンプ関数の使用により、大幅に減少したパrameter数で高精度な近似が達成可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。