[论文解读] Survey of Expressivity in Deep Neural Networks
本文通过引入三种度量——跃迁、激活模式和二分法——研究深度神经网络的表达能力,这些度量随网络深度呈指数增长,但与宽度无关。研究发现轨迹长度是导致这种深度敏感性的根本原因,表明早期层由于剩余深度更大,对表达能力的影响更显著,该结论已在MNIST和CIFAR-10数据集的实验中得到验证。
We survey results on neural network expressivity described in "On the Expressive Power of Deep Neural Networks". The paper motivates and develops three natural measures of expressiveness, which all display an exponential dependence on the depth of the network. In fact, all of these measures are related to a fourth quantity, trajectory length. This quantity grows exponentially in the depth of the network, and is responsible for the depth sensitivity observed. These results translate to consequences for networks during and after training. They suggest that parameters earlier in a network have greater influence on its expressive power -- in particular, given a layer, its influence on expressivity is determined by the remaining depth of the network after that layer. This is verified with experiments on MNIST and CIFAR-10. We also explore the effect of training on the input-output map, and find that it trades off between the stability and expressivity.
研究动机与目标
- 理解深度和宽度在随机初始化后对深度神经网络功能表达能力的影响。
- 识别与架构无关的一般性表达能力度量,且独立于特定的权重配置。
- 研究训练过程中表达能力与稳定性的权衡,特别是权重初始化如何影响这一平衡。
- 基于每层之后的剩余深度,考察早期层对网络表达能力的影响。
- 通过MNIST和CIFAR-10数据集的实证实验验证理论发现。
提出的方法
- 使用三种功能丰富度度量衡量表达能力:线性区域数量(跃迁)、全局激活模式和固定输入集上的二分法。
- 引入轨迹长度作为统一量:1D曲线在通过网络时的弧长,证明其随深度呈指数增长。
- 通过使用正态分布的随机权重初始化,推导出轨迹长度增长的理论下界:$\mathbb{E}[l(z^{(d)})] \geq O\left(\left(\frac{\sigma_w}{(\sigma_w^2 + \sigma_b^2)^{1/4}} \cdot \frac{\sqrt{k}}{\sqrt{\sqrt{\sigma_w^2 + \sigma_b^2} + k}}\right)^d\right) l(x(t))$。
- 通过使用hard-tanh激活函数,实证验证在不同网络宽度$k$和权重方差$\sigma_w^2$下轨迹长度的指数增长。
- 通过测量在MNIST和CIFAR-10上训练前后轨迹长度和跃迁数,分析训练动态,比较随机数据与真实数据插值的结果。
- 通过训练单个层而冻结其余所有层,测量准确率随层位置的变化,评估剩余深度的影响。
实验结果
研究问题
- RQ1深度神经网络的表达能力如何随深度和宽度变化,特别是在随机初始化后?
- RQ2轨迹长度在驱动跃迁和激活模式等功能复杂度度量指数增长中起到什么作用?
- RQ3训练过程如何影响输入-输出映射中稳定性和表达能力之间的权衡?
- RQ4某一层的表达能力在多大程度上取决于其后的剩余深度,而非其位置或宽度?
- RQ5能否通过受控训练实验定量测量并验证早期层对网络表达能力的影响?
主要发现
- 所有三种表达能力度量——跃迁、激活模式和二分法——均随网络深度呈指数增长,但与宽度无关。
- 轨迹长度随深度呈指数增长,是导致观察到的表达能力指数增长的根本机制。
- 当使用大权重方差初始化($\sigma_w^2 = 16$)时,训练会减少轨迹长度和跃迁数,从而提高稳定性,但以降低表达能力为代价。
- 当使用小权重方差初始化($\sigma_w^2 = 3$)时,训练会增加轨迹长度和跃迁数,从而增强表达能力以更好地拟合数据。
- 第一层在训练过程中倾向于增加轨迹长度,表明其主要用于数据拟合,而深层网络则用于稳定映射。
- 在MNIST和CIFAR-10上的实验确认,某一层的表达能力由其后的剩余深度决定,早期层因具有更高的残余深度而具有更大的影响力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。