Skip to main content
QUICK REVIEW

[论文解读] Deep ReLU Networks Preserve Expected Length

Boris Hanin, Ryan Jeong|arXiv (Cornell University)|Feb 21, 2021
Adversarial Robustness in Machine Learning参考文献 26被引用 7
一句话总结

本文表明,采用标准He初始化的深层ReLU网络在深度增加时不会出现指数级长度失真;相反,期望长度失真保持有界,并随深度略有减小。作者利用随机矩阵理论与高斯权重初始化,推导出期望长度和体积失真的精确上界,表明失真在初始化时得到良好控制,与以往认为其呈指数增长的假设相反。

ABSTRACT

Assessing the complexity of functions computed by a neural network helps us understand how the network will learn and generalize. One natural measure of complexity is how the network distorts length - if the network takes a unit-length curve as input, what is the length of the resulting curve of outputs? It has been widely believed that this length grows exponentially in network depth. We prove that in fact this is not the case: the expected length distortion does not grow with depth, and indeed shrinks slightly, for ReLU networks with standard random initialization. We also generalize this result by proving upper bounds both for higher moments of the length distortion and for the distortion of higher-dimensional volumes. These theoretical results are corroborated by our experiments.

研究动机与目标

  • 为解决长期以来认为深层ReLU网络在深度增加时长度失真呈指数级增长的假设。
  • 为初始化阶段深层ReLU网络中期望长度失真的紧致理论界提供支持。
  • 将这些界推广至更高阶矩的失真以及更高维体积失真。
  • 通过实证验证,先前松散的界无法捕捉细微的网络结构依赖关系,而新界则与观测行为高度吻合。
  • 澄清先前研究中的误解,特别是由于早期研究中一个关键拼写错误导致对指数增长的错误断言。

提出的方法

  • 作者使用链式法则与基于雅可比矩阵的分析,将变换后曲线的长度表示为雅可比矩阵作用于切向量范数的形式。
  • 他们推导出平方雅可比矩阵范数 $||J_x u||^2$ 的分布,将其表示为独立缩放卡方分布的乘积,利用高斯权重初始化。
  • 通过卡方分布的期望,他们计算出 $\mathbb{E}[||J_x u||^2] = \frac{n_L}{n_0}$,从而为期望长度失真提供上界。
  • 他们将该分析推广至更高阶矩的长度失真以及更高维体积失真,采用类似的矩方法。
  • 通过在初始化阶段的深层ReLU网络上进行实验,验证其理论预测,并与先前松散的界进行比较。
  • 他们纠正了先前研究中的一个关键拼写错误,该错误错误地声称存在指数增长,表明缺失的因子2使得原始结论不成立。

实验结果

研究问题

  • RQ1在标准He初始化下,深层ReLU网络的期望长度失真是否随深度呈指数级增长?
  • RQ2在初始化阶段,深层ReLU网络中期望长度失真的紧致上界及其高阶矩为何?
  • RQ3ReLU网络中更高维体积的失真如何随深度变化?
  • RQ4为何先前对长度失真理论界无法与实证观测结果匹配?
  • RQ5在标准初始化下,长度失真的观测行为是否对网络宽度与深度敏感?

主要发现

  • 采用He初始化($\sigma_w = \sqrt{2}$)的深层ReLU网络中,期望长度失真上界为1,且随深度增加而略有减小。
  • 期望平方雅可比矩阵范数的精确表达式为 $\mathbb{E}[||J_x u||^2] = \frac{n_L}{n_0}$,该式为期望长度失真提供了紧致上界。
  • 长度失真的高阶矩受到良好控制,并存在以高概率成立的上界,表明失真分布具有稳定性。
  • 更高维体积的失真同样受到有界控制,理论可推广至输入的$k$-维子流形。
  • 实证结果证实,新理论界与观测行为高度吻合,而先前的界则过于松散,无法捕捉网络结构的细微依赖关系。
  • 先前研究中一个关键拼写错误——指数中遗漏因子2——导致错误地断言存在指数增长,作者通过严谨分析对此进行了更正。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。