Skip to main content
QUICK REVIEW

[论文解读] Error bounds for approximations with deep ReLU networks

Dmitry Yarotsky|arXiv (Cornell University)|Oct 3, 2016
Neural Networks and Applications被引用 7
一句话总结

本文在Sobolev空间中建立了深度ReLU网络逼近复杂度的严格上下界,证明深度网络在逼近光滑函数方面显著优于浅层网络。研究证明,深度为6的自适应ReLU网络可实现1D利普希茨函数的逼近,复杂度为$ O(1/(\epsilon \epsilon)) $,优于标准浅层架构,并挑战了非线性宽度理论中的经典下界。

ABSTRACT

We study expressive power of shallow and deep neural networks with piece-wise linear activation functions. We establish new rigorous upper and lower bounds for the network complexity in the setting of approximations in Sobolev spaces. In particular, we prove that deep ReLU networks more efficiently approximate smooth functions than shallow networks. In the case of approximations of 1D Lipschitz functions we describe adaptive depth-6 network architectures more efficient than the standard shallow architecture.

研究动机与目标

  • 量化深度ReLU网络相较于浅层网络在Sobolev空间中的表达能力。
  • 分析架构选择(固定与自适应、深度约束)对逼近复杂度的影响。
  • 为逼近$ \mathcal{W}^{n,\infty}([0,1]^d) $中的函数,建立紧致的上下界。
  • 研究连续与不连续权重选择对逼近效率的影响。
  • 比较深度ReLU网络与使用光滑激活函数的浅层网络在逼近复杂度方面的表现。

提出的方法

  • 形式化定义ReLU网络模型,以深度、宽度和权重数量作为复杂度度量。
  • 证明ReLU可被任意连续分段线性激活函数替代,复杂度仅相差常数因子(命题1)。
  • 构建深度为$ O(\ln(1/\epsilon)) $的网络,用于逼近$ x^2 $并实现近似乘法(命题2–3)。
  • 设计深度为6的自适应ReLU网络架构,实现1D利普希茨函数的$ O(1/(\epsilon \ln(1/\epsilon))) $复杂度(定理2)。
  • 应用连续非线性宽度方法,在连续权重选择下推导下界(子节4.1)。
  • 利用不连续权重选择与受控子网络复用技术(受布尔电路理论启发),实现改进的上界(定理2)。

实验结果

研究问题

  • RQ1深度ReLU网络在Sobolev空间中逼近复杂度与浅层网络相比如何?
  • RQ2与固定架构相比,自适应网络架构能否显著降低逼近复杂度?
  • RQ3逼近1D利普希茨函数所需的最小深度与复杂度是多少?
  • RQ4不连续权重选择在多大程度上可提升逼近效率?
  • RQ5深度ReLU网络的逼近界与使用光滑激活函数的浅层网络相比如何?

主要发现

  • 深度ReLU网络可对$[0,1]^d$上的$ C^n $-函数实现复杂度$ O(\epsilon^{-d/n} \ln(1/\epsilon)) $的逼近,与浅层光滑网络的已知界仅在对数因子上存在差异。
  • 对于1D利普希茨函数,深度为6的自适应ReLU网络实现$ O(1/(\epsilon \ln(1/\epsilon))) $复杂度,低于一般$ d,n $下的下界$ \Omega(\epsilon^{-d/(9n)}) $,表明效率显著提升。
  • 在固定架构与连续权重选择下,$ \mathcal{W}^{1,\infty}([0,1]) $的下界为$ \Omega(\epsilon^{-1}) $,而上界为$ O(\epsilon^{-1} \ln(1/\epsilon)) $,表明上下界在对数因子内紧密匹配。
  • 当深度被限制为$ O(\ln^p(1/\epsilon)) $时,无约束权重选择下的下界为$ \Omega(\epsilon^{-d/n} \ln^{-2p-1}(1/\epsilon)) $,与上界仅相差对数因子。
  • 在自适应架构设置下,上下界差距仍然较大:上界为$ O(1/(\epsilon \ln(1/\epsilon))) $,而最佳已知下界为$ \Omega(\epsilon^{-d/(9n)}) $,表明仍有改进空间。
  • 在有限深度架构中复用子网络,可实现低于经典非线性宽度边界的复杂度,证明了深度网络中架构自适应性的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。