Skip to main content
QUICK REVIEW

[論文レビュー] Approximation of functions with one-bit neural networks

C. Si̇nan Güntürk, Weilin Li|arXiv (Cornell University)|Dec 16, 2021
Neural Networks and Applications被引用数 5
ひとこと要約

本稿では、重みが±1または±1/2に制限された1ビットニューラルネットワークが、単位立方体上での任意のホルダー滑らか関数を、誤差εで近似可能であり、2次ネットワークではO(ε^{-2d/s})パラメータ、ReLUネットワークではO(ε^{-2d/s} log(1/ε))パラメータで実現できることを示している。主な貢献は、ベルンシュタイン多項式とノイズ形状量子化を用いた新規構成法であり、量子化ネットワークにおける最適近似レートの証明を達成している。

ABSTRACT

The celebrated universal approximation theorems for neural networks roughly state that any reasonable function can be arbitrarily well-approximated by a network whose parameters are appropriately chosen real numbers. This paper examines the approximation capabilities of one-bit neural networks -- those whose nonzero parameters are $\pm a$ for some fixed $a ot=0$. One of our main theorems shows that for any $f\in C^s([0,1]^d)$ with $\|f\|_\infty<1$ and error $\varepsilon$, there is a $f_{NN}$ such that $|f(\boldsymbol{x})-f_{NN}(\boldsymbol{x})|\leq \varepsilon$ for all $\boldsymbol{x}$ away from the boundary of $[0,1]^d$, and $f_{NN}$ is either implementable by a $\{\pm 1\}$ quadratic network with $O(\varepsilon^{-2d/s})$ parameters or a $\{\pm \frac 1 2 \}$ ReLU network with $O(\varepsilon^{-2d/s}\log (1/\varepsilon))$ parameters, as $\varepsilon o0$. We establish new approximation results for iterated multivariate Bernstein operators, error estimates for noise-shaping quantization on the Bernstein basis, and novel implementation of the Bernstein polynomials by one-bit quadratic and ReLU neural networks.

研究の動機と目的

  • 重みが小さな有限集合に制限されたニューラルネットワークの近似能力を調査すること、特に1ビット重み(固定されたa ≠ 0に対して±a)の極端な場合を対象とすること。
  • C^s([0,1]^d)関数を、±1または±1/2の重みのみを用いて誤差ε以内に近似するための最小ネットワークサイズ(パラメータ数)を特定すること。
  • 1ビットニューラルネットワークを用いた多変量ベルンシュタイン多項式の実装法を新たに開発し、高精度な関数近似を可能とすること。
  • ベルンシュタイン基底におけるノイズ形状量子化の理論的誤差境界を確立し、近似理論と量子化ニューラルネットワーク設計を結びつけること。

提案手法

  • ReLUおよび2次活性化関数を用いて、多変量ベルンシュタイン基底多項式の1ビットニューラルネットワーク実装を構築する。
  • ベルンシュタイン多項式の係数を±1または±1/2に量子化する際の近似誤差を制御するため、ノイズ形状量子化戦略を採用する。
  • 誤差境界をテレスコーピング級数を用いて導出するため、近似乗算および和分層を備えた再帰的ネットワークアーキテクチャを用いる。
  • 各次元を同一のサブネットワークで並列処理し、その後、近似積ネットワークを用いて結合する、d次元テンソル積構成を適用する。
  • 最終的に、2次ネットワークではO(ε^{-2d/s})パラメータ、ReLUネットワークではO(ε^{-2d/s} log(1/ε))パラメータのネットワークが得られ、境界付近を除き一様誤差≤εを達成する。
  • 各層がパスカルの三角形の1行(ベルンシュタイン係数)を計算するレイヤード構成を採用し、δ-近似乗算ネットワークにより誤差を制御する。

実験結果

リサーチクエスチョン

  • RQ1重みが±1または±1/2に制限された1ビットニューラルネットワークは、[0,1]^d 上の任意の滑らかな関数を、与えられた誤差εで近似可能か?
  • RQ2このような近似に必要な最小パラメータ数は何か? また、滑らかさsおよび次元dとどのようにスケーリングされるか?
  • RQ3古典的なベルンシュタイン多項式近似は、1ビットニューラルネットワークを用いて効率的に実装可能か?
  • RQ4係数が有限アルファベットに量子化される際、ノイズ形状量子化は近似誤差にどのように影響するか?

主な発見

  • 任意のf ∈ C^s([0,1]^d)で||f||_∞ < 1、誤差ε > 0に対して、O(ε^{-2d/s} log(1/ε))パラメータを有する1ビットReLUネットワークが存在し、境界付近を除き一様にε以内でfを近似可能である。
  • O(ε^{-2d/s})パラメータを有する1ビット2次ネットワークが存在し、同じ近似誤差を達成できることを示しており、活性化関数の種別とパラメータ数のトレードオフが明確に示されている。
  • 構築されたネットワークの近似誤差はεで抑えられており、[0,1]^d の境界から離れたコンact集合上で一様に成り立つ。
  • 有界重みを持つニューラルネットワークの近似において、O(ε^{-2d/s})の収束レートが達成されており、既知の理論的限界と一致している。
  • 誤差をノイズ形状量子化により制御する新規な多変量ベルンシュタイン多項式の1ビットReLUおよび2次ネットワークを用いた実装に依拠している。
  • 次数nの近似において、層数はO(n log(n/ε))、ノード数はO(n² log(n/ε) + n^d log(1/ε))にスケーリングする。ここでn ~ ε^{-s/(2d)}である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。