QUICK REVIEW
[论文解读] Bounds on the Approximation Power of Feedforward Neural Networks
Mohammad Mehrabi, Aslan Tchamkerten|arXiv (Cornell University)|Jun 29, 2018
Neural Networks and Applications被引用 3
一句话总结
本文建立了具有分段线性激活函数(特别是ReLU)的前馈神经网络近似能力的更紧致边界。它推导出在给定误差范围内近似函数所需的网络规模(深度和宽度)的改进下界,并提出了一种新上界,用于衡量具有相同权重但不同激活函数的两个网络之间的差异,表明该差异随深度呈指数增长,但受激活函数相似性和网络宽度的控制。
ABSTRACT
The approximation power of general feedforward neural networks with piecewise linear activation functions is investigated. First, lower bounds on the size of a network are established in terms of the approximation error and network depth and width. These bounds improve upon state-of-the-art bounds for certain classes of functions, such as strongly convex functions. Second, an upper bound is established on the difference of two neural networks with identical weights but different activation functions.
研究动机与目标
- 建立前馈神经网络在指定误差范围内近似给定函数所需的规模(深度和宽度)的更紧致下界。
- 通过基于断点计数的网络容量分析,改进特定函数类(如强凸函数)的现有最先进边界。
- 推导出具有相同权重但不同激活函数的两个网络之间差异的上界,量化激活函数选择对网络输出的影响。
- 分析深度与宽度在近似能力方面的权衡,表明与宽度相比,深度能提供指数级的表征容量增益。
提出的方法
- 利用Raghu等人(2017)提出的神经元状态转移分析,推导出网络可生成的线性段(断点)数量的更紧致上界。
- 在断点数量的边界估计上,相较于先前工作(Yarotsky,2017)实现了$ d^d $倍的改进,其中$ d $为网络深度。
- 将改进后的断点边界与依赖误差和维度的下界相结合,推导出近似所需的深度、宽度、误差和输入维度的必要条件。
- 对具有相同权重但不同激活函数$ \rho $-Lipschitz且在$ L^\natural $-范数下$ \rho $-接近的两个网络的隐藏单元输出差异进行递归分析。
- 推导出递推关系$ \varepsilon_{i+1}(\boldsymbol{x}) \leq \varepsilon + \delta A \sum_{j=1}^i \omega_j \varepsilon_j(\boldsymbol{x}) $,以限制每层的最大输出差异。
- 利用该递推关系,推导出最终边界:$ |f_1(\boldsymbol{x}) - f_2(\boldsymbol{x})| \leq \frac{||\sigma_1 - \sigma_2||_\infty}{\delta} \left( (\delta A \omega_f + 1)^{d_f} - 1 \right) $,表明其对深度具有指数依赖性。
实验结果
研究问题
- RQ1网络深度与宽度如何联合约束分段线性前馈网络的近似误差?
- RQ2能否通过断点计数方法,为特定函数类(如强凸函数)推导出更紧致的网络规模下界?
- RQ3具有相同权重但不同激活函数的两个网络之间的最大差异是多少?其随深度和宽度如何变化?
- RQ4激活函数的选择如何影响其他方面完全相同的网络的输出差异?该差异能否独立于网络规模进行有界控制?
- RQ5激活函数的平滑性与Lipschitz常数在控制具有不同激活函数的两个网络之间偏差方面起什么作用?
主要发现
- 与Yarotsky(2017)相比,本文在ReLU网络可生成的线性段(断点)数量的上界上实现了$ d^d $倍的改进,显著收紧了对网络容量的理论理解。
- 对于强凸函数,推导出的网络规模(深度与宽度)下界比先前最先进结果更紧,表明对于此类函数,更深的网络更具效率。
- 建立了具有相同权重但不同激活函数的两个网络之间差异的上界:$ |f_1(\boldsymbol{x}) - f_2(\boldsymbol{x})| \leq \frac{||\sigma_1 - \sigma_2||_\infty}{\delta} \left( (\delta A \omega_f + 1)^{d_f} - 1 \right) $,表明其对深度具有指数依赖性。
- 输出差异的边界随深度$ d_f $呈指数增长,但受激活函数相似性(以$ ||\sigma_1 - \sigma_2||_\infty $衡量)和网络宽度$ \omega_f $的控制,表明在深层网络中,激活函数的微小变化可能导致输出的巨大差异。
- 分析表明,与宽度相比,深度能为表征容量带来指数级增益,因为深度导致线性段数量呈指数增长,而宽度仅带来多项式增长。
- 所推导的边界对某些函数类(如高曲率函数)是紧致的,其中所需网络规模的下界与基于断点计数推导出的上界相匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。