Skip to main content
QUICK REVIEW

[论文解读] Optimal rates of approximation by shallow ReLU$^k$ neural networks and applications to nonparametric regression

Yunfei Yang, Ding‐Xuan Zhou|arXiv (Cornell University)|Apr 4, 2023
Mathematical Approximation and Integration参考文献 61被引用 4
一句话总结

该论文通过分析 Hölder 空间单位球中函数的变分范数,建立了浅层 ReLU$^k$ 神经网络的最优逼近率。证明了浅层网络在 Hölder 光滑函数的非参数回归中实现了极小极大最优收敛率,并将这些结果扩展到过参数化和卷积神经网络,获得了近乎最优的率。

ABSTRACT

We study the approximation capacity of some variation spaces corresponding to shallow ReLU$^k$ neural networks. It is shown that sufficiently smooth functions are contained in these spaces with finite variation norms. For functions with less smoothness, the approximation rates in terms of the variation norm are established. Using these results, we are able to prove the optimal approximation rates in terms of the number of neurons for shallow ReLU$^k$ neural networks. It is also shown how these results can be used to derive approximation bounds for deep neural networks and convolutional neural networks (CNNs). As applications, we study convergence rates for nonparametric regression using three ReLU neural network models: shallow neural network, over-parameterized neural network, and CNN. In particular, we show that shallow neural networks can achieve the minimax optimal rates for learning Hölder functions, which complements recent results for deep neural networks. It is also proven that over-parameterized (deep or shallow) neural networks can achieve nearly optimal rates for nonparametric regression.

研究动机与目标

  • 建立浅层 ReLU$^k$ 神经网络在神经元数量方面的最优逼近率。
  • 分析与浅层 ReLU$^k$ 网络相关的变分空间的逼近能力。
  • 推导三种神经网络模型(浅层、过参数化、卷积)在非参数回归中的收敛率。
  • 证明浅层网络在 Hölder 光滑函数上实现了极小极大最优率,补充了现有深层网络的结果。
  • 将分析扩展到深层和卷积网络,利用推导出的逼近界。

提出的方法

  • 将函数类 $\mathcal{F}_{\sigma_k}(M)$ 定义为具有有界总变差测度 $\mu$ 的无限宽度浅层 ReLU$^k$ 网络集合,即 $\|\mu\| \leq M$。
  • 利用球谐函数的积分表示和 Maurey 类型的随机采样论证,基于变分范数界定逼近误差。
  • 在 $\alpha < (d+2k+1)/2$ 时,建立逼近率 $\|h - f\|_{L^\infty} \lesssim M^{-2\alpha/(d+2k+1-2\alpha)}$,其中 $h \in \mathcal{H}^\alpha$。
  • 将变分范数逼近结果与 [55, 57] 中的随机逼近界结合,推导出有限宽度浅层网络的最优率。
  • 应用逼近界,通过截断的最小化经验风险推导出非参数回归的一般化误差界。
  • 使用伪维数和覆盖数论证控制网络类的复杂度,特别是针对 CNN 和过参数化模型。

实验结果

研究问题

  • RQ1对于 Hölder 空间 $\mathcal{H}^\alpha$ 中的函数,浅层 ReLU$^k$ 神经网络可实现的最优逼近率是什么?
  • RQ2浅层 ReLU$^k$ 网络能否在非参数回归中对 Hölder 光滑函数实现极小极大最优收敛率?
  • RQ3浅层网络的逼近率如何推广到深层和卷积神经网络?
  • RQ4过参数化神经网络能否在非参数回归中实现近乎最优的率?
  • RQ5激活函数的幂 $k$ 在决定逼近率和平滑阈值方面起什么作用?

主要发现

  • 当 $\alpha < (d+2k+1)/2$ 时,浅层 ReLU$^k$ 网络在 $L^\infty$ 范数下的逼近误差以 $\mathcal{O}(M^{-2\alpha/(d+2k+1-2\alpha)})$ 的速率衰减,其中 $M$ 是测度的总变差。
  • 当 $\alpha < (d+2k+1)/2$ 时,浅层 ReLU$^k$ 网络对 $\mathcal{H}^\alpha$ 实现了最优逼近率 $\mathcal{O}(N^{-\alpha/d})$,将 Mhaskar 的结果推广到 ReLU$^k$。
  • 浅层神经网络在学习 Hölder 函数时实现了极小极大最优收敛率,达到了非参数回归中最佳可能的速率。
  • 过参数化(深层或浅层)神经网络在非参数回归中实现了近乎最优的收敛率,误差界为 $\mathcal{O}(n^{-\alpha/(d+\alpha)}(\log n)^4)$。
  • 具有 ReLU 激活函数($k=1$)的卷积神经网络对 $\mathcal{F}_\sigma(1)$ 实现了 $\mathcal{O}(n^{-(d+3)/(3d+3)}(\log n)^4)$ 的收敛率,略优于现有结果。
  • 逼近结果可推广至 Sobolev 范数,表明其在其他光滑性空间中具有潜在推广性,尽管这留待未来工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。