Skip to main content
QUICK REVIEW

[论文解读] Using Mode Connectivity for Loss Landscape Analysis

Akhilesh Deepak Gotmare, Nitish Shirish Keskar|arXiv (Cornell University)|Jun 18, 2018
Generative Adversarial Networks and Image Synthesis参考文献 15被引用 7
一句话总结

本文研究了模式连通性——一种通过低损失曲线连接神经网络极小值的方法——在不同训练设置下的鲁棒性,证明其对不同优化器、初始化方式和超参数具有强健性。作者将该框架应用于分析余弦退火与重启的随机梯度下降(SGDR),发现尽管SGDR穿过了损失屏障,但并未如先前所声称的那样收敛并逃逸多个局部极小值。

ABSTRACT

Mode connectivity is a recently introduced frame- work that empirically establishes the connected- ness of minima by finding a high accuracy curve between two independently trained models. To investigate the limits of this setup, we examine the efficacy of this technique in extreme cases where the input models are trained or initialized differently. We find that the procedure is resilient to such changes. Given this finding, we propose using the framework for analyzing loss surfaces and training trajectories more generally, and in this direction, study SGD with cosine annealing and restarts (SGDR). We report that while SGDR moves over barriers in its trajectory, propositions claiming that it converges to and escapes from multiple local minima are not substantiated by our empirical results.

研究动机与目标

  • 评估模式连通性在不同训练方案(包括不同优化器、初始化方式和超参数)下的鲁棒性。
  • 探究SGDR是否如先前研究所述,真正收敛并逃逸多个局部极小值。
  • 将模式连通性作为分析深度学习中损失曲面和优化轨迹的工具。
  • 探讨高精度连接曲线对泛化能力和集成方法的影响。
  • 基于对损失景观的实证分析,挑战将SGDR解释为在不同极小值之间移动的既有理解。

提出的方法

  • 使用模式连通性通过参数空间中的分段线性曲线连接两个独立训练得到的模型(极小值)。
  • 使用具有单一拐点的多边形链参数化连接曲线,并通过在曲线上对期望损失进行随机梯度下降来优化该拐点。
  • 使用SGD最小化期望损失 ℓ(θ) = E[t∼U(0,1)]ℒ(ϕθ(t)),其中梯度使用小批量估计。
  • 将拐点 θ 初始化为两个模型参数的中点:θ₀ = ½(wₐ + w_b)。
  • 将SGDR优化轨迹投影到由三个关键模型(如 w₇₀, w₁₅₀, w₇₀₋₁₅₀)定义的二维子空间中,以可视化损失曲面行为。
  • 比较连接曲线和SGDR轨迹上的训练损失与验证损失,以评估泛化性能和跨越屏障的行为。

实验结果

研究问题

  • RQ1模式连通性是否能可靠地连接使用不同优化器、学习率调度和正则化设置训练得到的极小值?
  • RQ2SGDR是否真的收敛并逃逸多个局部极小值,如先前假设所述?
  • RQ3模式连接曲线上的损失景观与SGDR的实际训练轨迹相比如何?
  • RQ4模式连通性能为连接曲线上模型的泛化特性提供了哪些见解?
  • RQ5模式连通性框架在孤立极小值之外,多大程度上揭示了损失曲面的结构性特征?

主要发现

  • 模式连通性在各种训练方案中均保持有效,包括不同的优化器(Adam、SGD)、学习率调度、批量大小和初始化方式。
  • SGDR轨迹穿过了损失屏障,表现为连接中间模型与最终模型的线段上训练损失高于端点,证明了屏障的存在。
  • 尽管穿过了屏障,SGDR并未真正收敛并逃逸多个独立的局部极小值,与先前的主张相矛盾。
  • w₇₀ 与 w₁₅₀ 之间的连接曲线的训练损失低于最终的SGDR模型(ℒ(w₁₅₀) > ℒ(w₇₀₋₁₅₀)),表明在训练表面上可能存在更优的解。
  • 连接曲线上的模型泛化性能劣于SGDR的迭代点,表现为更高的验证损失,表明SGD中的随机性有助于泛化。
  • 二维损失曲面投影显示,w₇₀ 与 w₁₅₀ 之间的区域具有更低的训练损失但更高的验证损失,暗示了为何通过循环学习率等方法对迭代点进行平均能提升泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。