Skip to main content
QUICK REVIEW

[论文解读] The Representation Power of Neural Networks: Breaking the Curse of Dimensionality

Moise Blanchard, Mohammed Amine Bennouna|arXiv (Cornell University)|Dec 9, 2020
Machine Learning and Algorithms被引用 5
一句话总结

本文证明,当近似具有有界二阶混合导数的Korobov空间中的函数时,浅层和深层神经网络均可打破维度灾难,其参数复杂度分别为 $O(\epsilon^{-1} \log^{(3d-1)/2}(1/\epsilon))$(浅层网络)和 $O(\epsilon^{-1/2} \log^{(3d-1)/2}(1/\epsilon))$(深层网络)。这些界几乎达到任何连续函数近似器所必需的理论最小值,证明神经网络在此类函数中近乎最优。

ABSTRACT

In this paper, we analyze the number of neurons and training parameters that a neural networks needs to approximate multivariate functions of bounded second mixed derivatives -- Korobov functions. We prove upper bounds on these quantities for shallow and deep neural networks, breaking the curse of dimensionality. Our bounds hold for general activation functions, including ReLU. We further prove that these bounds nearly match the minimal number of parameters any continuous function approximator needs to approximate Korobov functions, showing that neural networks are near-optimal function approximators.

研究动机与目标

  • 分析神经网络近似具有有界二阶混合导数的多元函数时所需的神经元数量和训练参数数量。
  • 确定浅层和深层神经网络是否能够克服Korobov空间这一通用且结构化的函数类的维度灾难。
  • 建立所需参数数量的紧致上下界,证明神经网络作为函数近似器的近乎最优性。
  • 比较该函数类下浅层与深层网络的表示能力,表明两者均可实现与维度无关的近似效率。

提出的方法

  • 作者基于紧支撑的尖峰函数构造,构建了用于近似Korobov函数的基,利用其可分性和光滑性。
  • 他们应用DeVore关于连续函数近似器的一般理论,推导出在 $\epsilon$ 误差范围内近似所需参数数量的下界。
  • 对于浅层网络,他们证明ReLU激活的两层网络可实现 $O(\epsilon^{-1} \log^{(3d-1)/2}(1/\epsilon))$ 个神经元和 $O(\epsilon^{-1/2} \log^{(3d-1)/2}(1/\epsilon))$ 个训练参数,以近似Korobov函数。
  • 对于深层网络,他们构建了一个深度为 $\lceil \log_2 d \rceil + 1$(与 $\epsilon$ 无关)的网络,采用 $\mathcal{C}^2$ 激活函数,实现 $O(\epsilon^{-1/2} \log^{(3d-1)/2}(1/\epsilon))$ 个神经元和参数。
  • 他们证明,任何连续函数近似器的参数下界为 $\Theta(\epsilon^{-1/2} \log^{(d-1)/2}(1/\epsilon))$,几乎与神经网络的上界匹配。
  • 该分析依赖于Sobolev范数控制和插值不等式,以控制基函数的导数并将其与近似误差关联。

实验结果

研究问题

  • RQ1浅层神经网络能否在Korobov空间的函数上打破维度灾难?
  • RQ2深层神经网络在近似Korobov函数时,是否比以往构造具有更高的参数效率?
  • RQ3神经网络在该近似任务中所需的参数数量是否在所有连续函数近似器中几乎是最小的?
  • RQ4浅层与深层网络的参数界与近似理论中的已知下界相比如何?

主要发现

  • 浅层ReLU网络可通过 $O(\epsilon^{-1} \log^{(3d-1)/2}(1/\epsilon))$ 个神经元和 $O(\epsilon^{-1/2} \log^{(3d-1)/2}(1/\epsilon))$ 个训练参数,以 $\epsilon$ 误差近似Korobov函数,打破维度灾难。
  • 采用 $\mathcal{C}^2$ 激活函数的深层网络实现了与浅层网络相同的参数复杂度,但其深度与 $\epsilon$ 无关,具体为 $\lceil \log_2 d \rceil + 1$ 层。
  • 所提出的深层网络构造优于Montanelli和Du的先前工作,将深度从 $O(\log(1/\epsilon) \log d)$ 降低至 $O(\log d)$,并将神经元数量减少了一个 $\log(1/\epsilon)$ 因子。
  • 任何连续函数近似器的参数下界为 $\Theta(\epsilon^{-1/2} \log^{(d-1)/2}(1/\epsilon))$,几乎与浅层和深层网络的上界匹配,证明了近似最优性。
  • 该结果适用于ReLU以外的多种激活函数,包括具有足够光滑性的函数,如定理3.9所示。
  • 该分析证实,神经网络不仅对Korobov函数有效,而且在连续函数近似器类别中理论上近乎最优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。