Skip to main content
QUICK REVIEW

[論文レビュー] Network size and weights size for memorization with two-layers neural networks

Sébastien Bubeck, Ronen Eldan|arXiv (Cornell University)|Jun 4, 2020
Neural Networks and Applications参考文献 33被引用数 18
ひとこと要約

本稿では、ℝ^d 内の n 個のデータポイントを近似的に記憶する二層ReLUネットワークにおける、複素数値再結合法の新規な手法を提案する。この手法は、O(n/(dε)) 個のニューロンとほぼ最適な総重み Õ(√n) を用いて、従来の Baum および Neural Tangent Kernel (NTK) ネットワークの非効率な重みスケーリングを著しく改善する。この方法は調和解析と複素数埋め込みを活用し、やや弱いデータ分散仮定のもとで、低複雑性かつ効率的な記憶を実現する。

ABSTRACT

In 1988, Eric B. Baum showed that two-layers neural networks with threshold activation function can perfectly memorize the binary labels of $n$ points in general position in $\mathbb{R}^d$ using only $\ulcorner n/d \urcorner$ neurons. We observe that with ReLU networks, using four times as many neurons one can fit arbitrary real labels. Moreover, for approximate memorization up to error $ε$, the neural tangent kernel can also memorize with only $O\left(\frac{n}{d} \cdot \log(1/ε) ight)$ neurons (assuming that the data is well dispersed too). We show however that these constructions give rise to networks where the magnitude of the neurons' weights are far from optimal. In contrast we propose a new training procedure for ReLU networks, based on complex (as opposed to real) recombination of the neurons, for which we show approximate memorization with both $O\left(\frac{n}{d} \cdot \frac{\log(1/ε)}ε ight)$ neurons, as well as nearly-optimal size of the weights.

研究の動機と目的

  • 既存の二層ReLUネットワークにおける記憶のための非最適な重みスケーリング、特に高次元設定下での問題に対処すること。
  • 任意の実数ラベルに対する近似的な記憶を実現する際、ネットワークサイズと総重みの両方を最小化する構成を開発すること。
  • しきい値ベース(Baum)およびカーネルベース(NTK)のアプローチに起因する制限を克服すること。これらはニューロン数は効率的であるが、重みの大きさが著しく悪化する。
  • 複素数値ニューロン再結合と調和解析を用いた新しい理論枠組みを確立し、近似的に最適な一般化複雑度を達成すること。

提案手法

  • 各ニューロンが複素数重みベクトル w + iw′ でパラメータ化される、複素数値再結合に基づく調和ネットワーク構成を導入する。
  • 実数関数の表現として、複素解析関数 φ(w·x + iw′·x) の実部を用い、複素数埋め込みによる多項式近似を可能にする。
  • インデックス j ∈ {0, ..., m} に対する確率的スケームを用いて、Sψ((w + jw′)·x − B) 形式のReLU活性化を確率的に組み合わせる。ここで S ∈ {−1, 1} であり、B は compactly supported 関数の2階微分に関連する分布から抽出されるバイアスである。
  • 近似をコンact領域に局在化させるためにバムプ関数 χ_M を適用し、結果として得られる関数が ε の誤差内でターゲットを近似することを保証する。
  • 近似係数が複素パラメータ z に対して連続的であることを導出し、構成の滑らかさと安定性を保証する。
  • 現在の関数とターゲットラベル間の内積制御に従い、残差誤差に一致するニューロンを逐次追加するブースティング風の反復的手順を用いて、完全なネットワークを構築する。

実験結果

リサーチクエスチョン

  • RQ1やや弱いデータ仮定のもとで、二層ReLUネットワークが近似的な記憶を、近似的に最適なニューロン数と近似的に最適な総重みの両方で達成できるか?
  • RQ2記憶ネットワークの総重みは n, d, ε に関してどのようにスケーリングされるか?また、Baum や NTK ネットワークで観察される n√n スケーリングを超えて改善可能か?
  • RQ3高次元における十分に分散されたデータ上に、任意の実数ラベルをもつ場合に、O(n/(dε)) 個のニューロンと Õ(√n) の総重みを持つReLUネットワークを構築可能か?
  • RQ4ニューロンの複素数値再結合が、重み複雑度を低減させつつ近似精度を維持する上で果たす役割は何か?
  • RQ5調和解析と複素数埋め込みを用いて、サンプル効率的かつ重み効率的なReLUネットワークの普遍的近似枠組みを導出可能か?

主な発見

  • 提案された調和ネットワークは、k = Õ(n/(dε)) 個のニューロンと総重み W(f) = Õ(√n) を用いて近似的な記憶を達成し、これは Ω̃(√n) がランダムデータにおける下界であるため、ほぼ最適である。
  • 調和ネットワーク構成は、Baum ネットワークおよび NTK ネットワークよりも総重みにおいて優れている。両者ともランダムデータ上では Ω(n√n) の重みを必要とし、これは著しく非効率である。
  • 対象となるデータポイントが単位球面上にあり、ペアワイズ内積が Õ(1/√d) で有界である場合、調和ネットワークは平均二乗誤差が高確率で ε 以下であることを保証する。
  • この手法は、Re(w·x + iw′·x) を通じた関数の連続的・複素数値表現に依存しており、確率的再結合を用いたReLU活性化による多項式近似を可能にする。
  • 構成はやや弱いデータ分散仮定に対して頑健であり、有界な内積を除き、強い分布的仮定は必要としない。
  • 理論的解析により、調和ネットワークの重みスケーリングが対数要因を除き最適であることが確認された。これは、ランダムラベル設定下で √n が総重みの下界であるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。