QUICK REVIEW
[论文解读] An Improved Bound on the VC-Dimension of Neural Networks with Polynomial Activation Functions
J. Maurice Rojas, M. Vidyasagar|ArXiv.org|Dec 19, 2001
Neural Networks and Applications参考文献 4被引用 3
一句话总结
本文通过利用Rojas(2000)提出的改进半代数几何结果,对具有多项式激活函数的前馈神经网络的VC维给出了更紧的上界。通过分析网络各层权重参数的次数分布,并使用相对熵量化改进程度,作者推导出的上界严格优于经典的Goldberg-Jerrum上界,在数值示例中估计值最高可降低12.5%。
ABSTRACT
In this note, we derive an improved upper bound for the VC-dimension of neural networks with polynomial activation functions. This improved bound is based on a result of Rojas on the number of connected components of a semi-algebraic set.
研究动机与目标
- 改进具有多项式激活函数的神经网络的VC维经典上界。
- 解决基于Milnor定理推导的先前上界过于松散的问题,该定理仅依赖于总次数和变量数量。
- 将各层权重参数的次数分布信息纳入VC维分析。
- 通过基于各层参数计数与次数导出的概率向量之间的相对熵,量化上界改进的程度。
- 证明新上界在神经网络架构方面既更紧致又具有直观可解释性。
提出的方法
- 利用Rojas(2000)关于半代数集连通分支数量的结果,该结果依赖于多项式的次数及其变量分组方式。
- 将神经网络建模为权重空间中多项式不等式与等式的布尔组合。
- 为每个权重向量 $\mathbf{w}_i$ 定义各层特定的次数上界 $d_i$,以捕捉涉及 $\mathbf{w}_i$ 的单项式最大总次数。
- 使用多项式系数与阶乘的乘积 $k! \prod_{i=1}^l \frac{d_i^{k_i}}{k_i!}$ 对临界值集合的体积进行上界估计。
- 利用Stirling近似推导出包含两个概率向量 $\mathbf{v}$ 与 $\mathbf{u}$ 之间相对熵 $H(\mathbf{v}|\mathbf{u})$ 的闭式上界。
- 将改进的体积上界与定理1结合,推导出最终的VC维上界:$2k(\lg(4ed) - H(\mathbf{v}|\mathbf{u}))$。
实验结果
研究问题
- RQ1能否通过利用各层的次数分布,更紧地界定具有多项式激活函数的神经网络的VC维?
- RQ2归一化后的各层次数向量与归一化后的各层参数计数向量之间的相对熵,如何影响VC维上界?
- RQ3当使用每层多项式次数的更精细信息时,经典Milnor型上界最多能改进多少?
- RQ4上界改进在数量上是否显著,并且在神经网络架构层面是否具有可解释性?
- RQ5在何种条件下,新上界相比Goldberg-Jerrum上界能实现非平凡的降低?
主要发现
- 所提出的上界通过整合权重参数的各层特定次数分布,优于经典的Goldberg-Jerrum上界。
- 改进程度量化为 $2k \cdot H(\mathbf{v}|\mathbf{u})$,其中 $H(\mathbf{v}|\mathbf{u})$ 是归一化次数向量 $\mathbf{v}$ 与归一化参数计数向量 $\mathbf{u}$ 之间的相对熵。
- 在 $k_1=50$,$k_2=20$,$d_1=3$,$d_2=1$ 的数值示例中,上界比先前估计值约紧12.5%。
- 在所有情况下,该上界均严格优于Goldberg-Jerrum上界,仅当各层的次数与参数分布完全一致时才无改进。
- 该方法提供了一种系统性方式,将网络架构(各层大小与激活函数次数)与泛化能力通过VC维联系起来。
- 最终上界表达为 $\mathrm{VCDIM}(\Phi) \leq 2k(\lg(4ed) - H(\mathbf{v}|\mathbf{u}))$,当 $H(\mathbf{v}|\mathbf{u}) > 0$ 时,该上界严格优于 $2k\lg(4ed)$。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。