Skip to main content
QUICK REVIEW

[论文解读] When Do Flat Minima Optimizers Work?

Jean Kaddour, Linqing Liu|arXiv (Cornell University)|Feb 1, 2022
Advanced Neural Network Applications被引用 7
一句话总结

本文对随机权重平均(Stochastic Weight Averaging, SWA)和尖锐度感知最小化(Sharpness-Aware Minimization, SAM)这两种主流的平坦极小值优化器,在计算机视觉、自然语言处理(NLP)和图表示学习(GRL)等42项任务中进行了全面的实证比较。尽管SAM通过Hessian分析找到了更平坦的极小值,但SWA在泛化性能上通常表现更优,尤其是在图表示学习任务中;对SAM的迭代过程进行平均可得到最平坦的解,且性能差异高度依赖于模型架构和数据集。

ABSTRACT

Recently, flat-minima optimizers, which seek to find parameters in low-loss neighborhoods, have been shown to improve a neural network's generalization performance over stochastic and adaptive gradient-based optimizers. Two methods have received significant attention due to their scalability: 1. Stochastic Weight Averaging (SWA), and 2. Sharpness-Aware Minimization (SAM). However, there has been limited investigation into their properties and no systematic benchmarking of them across different domains. We fill this gap here by comparing the loss surfaces of the models trained with each method and through broad benchmarking across computer vision, natural language processing, and graph representation learning tasks. We discover several surprising findings from these results, which we hope will help researchers further improve deep learning optimizers, and practitioners identify the right optimizer for their problem.

研究动机与目标

  • 系统性地比较SWA与SAM在计算机视觉、自然语言处理(NLP)和图表示学习等多样化深度学习领域中的表现。
  • 探究模型架构和数据集特性如何影响平坦极小值优化器的有效性。
  • 利用Hessian特征值和线性插值方法,分析SWA与SAM所找到的损失曲面几何结构及极小值平坦度。
  • 识别平坦极小值优化器提升泛化性能的条件,以及其失效的情形。
  • 为未来研究和实践者提供可复现的基准,包括开源的代码和超参数。

提出的方法

  • 在涵盖图像分类、自然语言处理(NLP)和图学习的42项多样化任务中,采用标准化训练协议,对SWA和SAM进行模型训练。
  • 通过模型权重之间的线性插值可视化损失曲面几何结构,并量化平坦度。
  • 计算Hessian特征值,以定量比较SWA与SAM所找到极小值的平坦度。
  • 采用严格的模型选择流程,针对每项任务和模型架构进行超参数调优。
  • 应用WASAM(加权平均SAM)以探索结合SWA与SAM的混合优化策略。
  • 在标准基准上报告结果(如NLP的GLUE、GRL的OGB),并使用标准评估指标。

实验结果

研究问题

  • RQ1SWA与SAM在多样化深度学习任务中的泛化性能表现如何比较?
  • RQ2SAM是否始终能找到比SWA更平坦的极小值?这种平坦性是否转化为更好的泛化性能?
  • RQ3模型架构和数据集类型如何影响SWA与SAM的相对性能?
  • RQ4通过Hessian测量的损失曲面平坦度与实际测试准确率之间存在何种关系?
  • RQ5对SAM的迭代过程进行平均,能否进一步提升平坦度和泛化性能,超越标准SAM?

主要发现

  • 尽管SAM基于Hessian特征值分析找到的极小值比SWA更平坦,但SWA在泛化性能上通常更优,尤其在图表示学习(GRL)任务中表现突出。
  • 在自然语言处理(NLP)任务中,SAM在大多数情况下优于SWA,表明在该领域平坦性更具优势。
  • 在GRL任务中,SWA始终优于SAM,表明仅具备平坦极小值不足以提升泛化性能。
  • 对SAM的迭代过程进行平均(通过WASAM)可得到所有方法中最平坦的极小值,表明集成平均能增强平坦度。
  • 当平坦极小值优化器未能提升性能时,训练过程中损失和准确率曲线的形状会出现明显差异。
  • SWA与SAM的有效性高度依赖于模型架构和数据集,不存在在所有场景下均占优的单一优化器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。