Skip to main content
QUICK REVIEW

[论文解读] Towards Understanding the Importance of Shortcut Connections in Residual Networks

Tianyi Liu, Minshuo Chen|arXiv (Cornell University)|Sep 10, 2019
Domain Adaptation and Few-Shot Learning被引用 22
一句话总结

本文对残差网络(ResNets)为何在非凸优化景观下仍能高效训练提供了理论分析。结果表明,当跳跃连接的权重层采用适当的归一化和零初始化时,梯度下降可避免虚假局部最优解,并在多项式时间内收敛至全局最优解,从而揭示了跳跃连接在实现收敛中的关键作用。

ABSTRACT

Residual Network (ResNet) is undoubtedly a milestone in deep learning. ResNet is equipped with shortcut connections between layers, and exhibits efficient training using simple first order algorithms. Despite of the great empirical success, the reason behind is far from being well understood. In this paper, we study a two-layer non-overlapping convolutional ResNet. Training such a network requires solving a non-convex optimization problem with a spurious local optimum. We show, however, that gradient descent combined with proper normalization, avoids being trapped by the spurious local optimum, and converges to a global optimum in polynomial time, when the weight of the first layer is initialized at 0, and that of the second layer is initialized arbitrarily in a ball. Numerical experiments are provided to support our theory.

研究动机与目标

  • 理解残差网络(ResNets)高效训练的理论原因,尽管其优化问题为非凸,但实证结果优于标准前馈卷积神经网络。
  • 研究ResNets中的跳跃连接是否有助于在简化两层非重叠卷积ResNet的优化景观中避免虚假局部最优解。
  • 分析在学生网络架构与教师网络一致的可实现设定下,梯度下降的收敛行为。
  • 建立梯度下降在适当归一化和初始化条件下以多项式时间收敛至全局最优解的条件。

提出的方法

  • 本研究分析了一个带有ReLU激活函数的两层非重叠卷积ResNet,其输出定义为 $ f(w,a,Z) = a^{ op}\sigma\left(Z^{ op}(\frac{\mathds{1}}{\sqrt{p}} + w)\right) $,其中通过 $ v = \frac{\mathds{1}}{\sqrt{p}} + w $ 强制满足 $ \norm{v}_2 = 1 $。
  • 优化问题被表述为最小化学生网络与教师网络输出之间的期望平方误差:$ \mathbb{E}_Z[ f(w,a,Z) - g(v^*,a^*,Z) ]^2 $,其中 $ v^* $ 和 $ a^* $ 为真实参数。
  • 采用梯度下降法,使用独立的学习率 $ \eta_a $ 和 $ \eta_w $,分析聚焦于 $ w = 0 $ 且 $ a $ 位于有界球内的初始化设置。
  • 理论分析证明,通过适当的归一化和初始化,梯度下降可避免虚假局部最优解,并在多项式时间内收敛至全局最优解。
  • 该方法引入了两阶段收敛过程:第一阶段为 $ a_t $ 与 $ a^* $ 对齐,$ w_t $ 缓慢演化;第二阶段为 $ w_t $ 和 $ a_t $ 快速收敛至全局最优解。
  • 数值实验验证了理论结果,表明未采用跳跃连接特异性归一化的标准梯度下降会陷入虚假局部最优解,而所提设置则可避免该问题。

实验结果

研究问题

  • RQ1在简化两层ResNet中,跳跃连接的存在是否可防止梯度下降陷入虚假局部最优解?
  • RQ2何种初始化条件可使梯度下降在存在虚假局部最优解的非凸ResNet优化问题中收敛至全局最优解?
  • RQ3适当的归一化和学习率选择如何影响ResNet训练中梯度下降的收敛行为?
  • RQ4简化ResNet模型中梯度下降的理论收敛性是否可与深层ResNets的实际训练成功相联系?
  • RQ5跳跃连接权重层的初始化(特别是 $ w = 0 $)在避免不良局部极小值中起到何种作用?

主要发现

  • 在 $ w = 0 $ 且 $ a $ 位于有界球内的初始化条件下,结合适当的归一化,梯度下降即使在存在虚假局部最优解的情况下,仍可在多项式时间内收敛至全局最优解。
  • 该算法表现出两阶段收敛过程:初始阶段 $ a_t $ 与 $ a^* $ 对齐,$ w_t $ 缓慢演化;随后 $ w_t $ 和 $ a_t $ 快速收敛至全局最优解。
  • 若缺乏跳跃连接特异性归一化和初始化,梯度下降会陷入虚假局部最优解,该结论得到数值实验的验证。
  • 理论分析表明,跳跃连接通过确保当 $ a_t $ 初始与 $ a^* $ 不对齐时梯度流仍具有效性,使梯度下降能够避开虚假局部最优解。
  • 只要 $ a $ 的初始化位于有界球内,收敛对 $ a $ 的初始化具有鲁棒性,而 $ w $ 在零处的初始化对避免不良局部极小值至关重要。
  • 结果与实际训练中的常见做法(如热身学习率和差异学习率)一致,为深度学习中常用训练启发式方法提供了理论依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。