Skip to main content
QUICK REVIEW

[论文解读] Approximation of functions with one-bit neural networks

C. Si̇nan Güntürk, Weilin Li|arXiv (Cornell University)|Dec 16, 2021
Neural Networks and Applications被引用 5
一句话总结

该论文证明,使用±1或±1/2权重的一比特神经网络可利用O(ε^{-2d/s})个参数近似单位立方体上任意Hölder光滑函数,误差为ε,其中二次网络的参数量为O(ε^{-2d/s}),ReLU网络的参数量为O(ε^{-2d/s} log(1/ε))。关键贡献在于提出了一种基于Bernstein多项式与噪声整形量化的新构造方法,证明了量化网络在逼近精度上的最优率。

ABSTRACT

The celebrated universal approximation theorems for neural networks roughly state that any reasonable function can be arbitrarily well-approximated by a network whose parameters are appropriately chosen real numbers. This paper examines the approximation capabilities of one-bit neural networks -- those whose nonzero parameters are $\pm a$ for some fixed $a ot=0$. One of our main theorems shows that for any $f\in C^s([0,1]^d)$ with $\|f\|_\infty<1$ and error $\varepsilon$, there is a $f_{NN}$ such that $|f(\boldsymbol{x})-f_{NN}(\boldsymbol{x})|\leq \varepsilon$ for all $\boldsymbol{x}$ away from the boundary of $[0,1]^d$, and $f_{NN}$ is either implementable by a $\{\pm 1\}$ quadratic network with $O(\varepsilon^{-2d/s})$ parameters or a $\{\pm \frac 1 2 \}$ ReLU network with $O(\varepsilon^{-2d/s}\log (1/\varepsilon))$ parameters, as $\varepsilon o0$. We establish new approximation results for iterated multivariate Bernstein operators, error estimates for noise-shaping quantization on the Bernstein basis, and novel implementation of the Bernstein polynomials by one-bit quadratic and ReLU neural networks.

研究动机与目标

  • 研究权重被限制在小有限集合(特别是±a,a ≠ 0为固定值)的神经网络的逼近能力,尤其是极端情况——一比特权重(±1或±1/2)。
  • 确定仅使用±1或±1/2权重时,逼近任意C^s([0,1]^d)函数至误差ε所需的最小网络规模(参数数量)。
  • 开发一种使用一比特神经网络实现多变量Bernstein多项式的新方法,以实现高精度函数逼近。
  • 建立噪声整形量化在Bernstein基上的理论误差界,将逼近理论与量化神经网络设计相联系。

提出的方法

  • 利用ReLU和二次激活函数,构建一比特神经网络以实现多变量Bernstein基多项式。
  • 采用噪声整形量化策略,在将Bernstein多项式系数量化为±1或±1/2时控制逼近误差。
  • 使用递归网络结构,通过近似乘法与求和层计算Bernstein基函数,利用错位求和法推导误差界。
  • 采用d维张量积构造,各维度并行处理,使用相同子网络,再通过近似乘积网络组合。
  • 最终网络的参数量为O(ε^{-2d/s})(二次网络)或O(ε^{-2d/s} log(1/ε))(ReLU网络),在边界附近外实现一致误差≤ε。
  • 采用分层结构,每一层通过δ-近似乘法网络计算Pascal三角形的一行(即Bernstein系数),并控制误差。

实验结果

研究问题

  • RQ1一比特神经网络(权重限制为±1或±1/2)能否在[0,1]^d上以给定误差ε逼近任意光滑函数?
  • RQ2此类逼近所需的最小参数数量是多少?其随光滑度s和维度d的缩放关系如何?
  • RQ3经典Bernstein多项式逼近能否通过一比特神经网络高效实现?
  • RQ4当系数被量化为有限字母表时,噪声整形量化对逼近误差有何影响?

主要发现

  • 对于任意f ∈ C^s([0,1]^d)且||f||_∞ < 1,以及ε > 0,存在一个一比特ReLU网络,其参数量为O(ε^{-2d/s} log(1/ε)),可在边界附近外一致逼近f,误差不超过ε。
  • 存在一个一比特二次网络,其参数量为O(ε^{-2d/s}),可达到相同的逼近误差,表明激活函数类型与参数数量之间存在权衡。
  • 所构造网络的逼近误差被控制在ε以内,且在[0,1]^d的紧子集(边界除外)上一致成立。
  • 该方法实现了具有有界权重的神经网络逼近的最优收敛率O(ε^{-2d/s}),与已知理论极限一致。
  • 该构造依赖于一种新颖的一比特ReLU和二次网络实现多变量Bernstein多项式的方法,误差通过噪声整形量化控制。
  • 对于n次逼近,层数为O(n log(n/ε)),节点数为O(n² log(n/ε) + n^d log(1/ε)),其中n ~ ε^{-s/(2d)}。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。