Skip to main content
QUICK REVIEW

[论文解读] Asymmetric Valleys: Beyond Sharp and Flat Local Minima

Haowei He, Gao Huang|arXiv (Cornell University)|Feb 2, 2019
Stochastic Gradient Optimization Techniques参考文献 43被引用 35
一句话总结

本文提出损失景观中的非对称谷,证明偏向平坦一边的 SGD 解更具泛化性,并显示 SGD 平均化(如 SWA)自然产生此类偏置解,BN 单元促成不对称性。

ABSTRACT

Despite the non-convex nature of their loss functions, deep neural networks are known to generalize well when optimized with stochastic gradient descent (SGD). Recent work conjectures that SGD with proper configuration is able to find wide and flat local minima, which have been proposed to be associated with good generalization performance. In this paper, we observe that local minima of modern deep networks are more than being flat or sharp. Specifically, at a local minimum there exist many asymmetric directions such that the loss increases abruptly along one side, and slowly along the opposite side--we formally define such minima as asymmetric valleys. Under mild assumptions, we prove that for asymmetric valleys, a solution biased towards the flat side generalizes better than the exact minimizer. Further, we show that simply averaging the weights along the SGD trajectory gives rise to such biased solutions implicitly. This provides a theoretical explanation for the intriguing phenomenon observed by Izmailov et al. (2018). In addition, we empirically find that batch normalization (BN) appears to be a major cause for asymmetric valleys.

研究动机与目标

  • 在深度网络中存在的非对称损失谷超越平坦/尖锐极小值的存在性动机。
  • 形式地定义非对称方向和非对称谷,并确立它们在现代架构中的普遍性。
  • 理论上证明在经验损失与总体损失之间存在温和的移位时,向平坦一侧偏置的解具有更好的泛化性。
  • 证明对 SGD 迭代进行平均(包括 SWA)会引入向平坦一侧的期望偏置。
  • 研究批归一化在形成非对称谷中的作用以及 BN 定向平均的有效性。

提出的方法

  • 给出精确定义来形式化非对称方向和非对称谷(定义 1 与定义 2)。
  • 引入 (δ, R) 移位差来联系总体损失与经验损失(定义 3),并给出两个假设(随机移位、局部非对称)。
  • 在这些假设下证明一个偏置/泛化定理:向平坦一侧偏置的解比经验极小化解具有更好的泛化性(定理 1)。
  • 在 CIFAR 数据集上对 ResNet/DenseNet 的移位差和不对称性进行实证验证(图 3、图 4)。
  • 证明对 SGD 迭代进行平均会产生向平坦一侧偏置的解,并提供理论支持(定理 2)与实证验证(图 5–9)。
  • 分析 SWA 与大/小批量影响,阐明改进的泛化性来自非对称谷中的偏置,而不仅仅是宽度(图 8–11)。
  • 考察批归一化在形成非对称方向中的作用,并展示 BN 定向平均的好处(第 7 章)。

实验结果

研究问题

  • RQ1现代深度网络的损失景观中是否存在非对称谷?
  • RQ2向非对称谷的平坦一侧偏置的解是否比精确的经验最小化解具有更好的泛化性?
  • RQ3Sgd 平均化(如 SWA)是否能够隐式找到此类偏置解?
  • RQ4批归一化在形成非对称性以及平均化效果中的作用?
  • RQ5来自小批量训练或 SWA 的改进是否源于向平坦方向的偏置,而非单纯的平坦性/宽度?

主要发现

  • 在像 ResNet 和 DenseNet 这样的现代网络的损失景观中,非对称谷很普遍,尤其在 CIFAR 数据集上。
  • 在总体损失与经验损失之间存在温和移位时,向平坦一侧偏置的解比经验最小化解具有更好的泛化性(定理 1)。
  • 对 SGD 轨迹进行简单平均会产生向平坦一侧偏置的解,支持通向更好泛化性的实用算法路径(定理 2)。
  • 实际中对 SGD 迭代进行平均(如 SWA)会产生向平坦一侧偏置的解,并在测试性能上获得提升,尽管训练损失有时更高(图 8 及相关讨论)。
  • Batch Normalization 有助于创建不对称方向,对 BN 参数进行平均化尤其有效(在启用 BN 的网络中,SWA-BN 优于 SWA-Non-BN)。
  • 可视化显示在高维景观中,不同的吸引盆可以因为不对称性而显得更宽/更浅,而非真正的宽度差(第 6 节)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。