[论文解读] Complexity Measures for Neural Networks with General Activation Functions Using Path-based Norms
本文提出一种基于路径的范数框架,通过使用两层ReLU网络近似一般激活函数,以控制具有通用激活函数的神经网络的复杂度。该方法推导出结合完整路径与部分路径贡献的新路径范数,从而为两层网络和深度残差网络建立Rademacher复杂度界与先验泛化误差估计,将先前仅针对ReLU网络的结果扩展至更广泛的激活函数。
A simple approach is proposed to obtain complexity controls for neural networks with general activation functions. The approach is motivated by approximating the general activation functions with one-dimensional ReLU networks, which reduces the problem to the complexity controls of ReLU networks. Specifically, we consider two-layer networks and deep residual networks, for which path-based norms are derived to control complexities. We also provide preliminary analyses of the function spaces induced by these norms and a priori estimates of the corresponding regularized estimators.
研究动机与目标
- 将基于范数的复杂度控制从ReLU网络扩展至具有通用激活函数的神经网络。
- 构建一个统一的复杂度控制框架,保持大小无关性,并适用于过参数化模型。
- 表征由新路径范数诱导的函数空间,并为正则化估计器推导先验估计。
- 建立使用有限路径范数ReLU网络对一维函数逼近能力的保证。
提出的方法
- 使用两层ReLU网络近似任意通用激活函数,将原始网络转换为参数更多但等价的ReLU网络。
- 定义一种改进的基于路径的范数,结合标准路径范数与一个额外项,以反映激活函数近似误差的影响。
- 利用新路径范数为两层网络和深度残差网络推导Rademacher复杂度界。
- 引入一种改进的加权路径范数,涵盖所有路径(包括从中间层开始的路径),而不仅限于完整长度的路径。
- 利用覆盖数与Rademacher复杂度分析,为正则化估计器建立泛化误差界。
- 表征一维ReLU网络在有界路径范数下的逼近能力,证明满足∫|f''(x)|(|x|+1)dx < ∞的函数可在L∞(ℝ)范数下被逼近。
实验结果
研究问题
- RQ1基于范数的复杂度度量能否从ReLU网络推广至通用激活函数?
- RQ2控制具有通用激活函数的神经网络复杂度的路径范数结构是什么?
- RQ3使用ReLU网络近似通用激活函数如何影响最终的复杂度度量?
- RQ4新路径范数诱导的函数空间是什么?其与逼近性质有何关系?
- RQ5能否在新范数下为正则化估计器推导先验泛化误差估计?
主要发现
- 所提出的通用激活函数路径范数包含两项:标准路径范数与来自激活函数近似的附加项,后者依赖于所有路径(包括从中间层出发的路径)。
- 对于两层网络,Rademacher复杂度被有界为新路径范数的常数倍,且该界依赖于激活函数的近似质量。
- 对于深度残差网络,改进的路径范数确保正则化估计器的泛化误差在期望下有界,且该界依赖于参数范数与数据分布。
- 若函数满足∫|f''(x)|(|x|+1)dx < ∞,则一维函数可用有界路径范数的ReLU网络逼近,且路径范数被该积分的倍数有界。
- 新范数框架实现了与大小无关的复杂度控制,避免了在过参数化设置下的平凡界。
- 该方法支持为正则化估计器提供先验误差估计,将现有ReLU网络结果推广至通用激活函数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。