[论文解读] Adaptive Inertia: Disentangling the Effects of Adaptive Learning Rate and Momentum
本文解耦了Adam中自适应学习率与动量的影响,表明自适应学习率可加速逃离鞍点,但倾向于选择尖锐极小值;而动量则有助于逃离鞍点,对极小值选择影响甚微。为改善泛化性能,作者提出新型优化器Adai(自适应惯性),该优化器对每个参数自适应调整动量,理论上可偏好平坦极小值,且在泛化性能上优于Adam与SGD,同时保持快速收敛速度。
Adaptive Moment Estimation (Adam), which combines Adaptive Learning Rate and Momentum, would be the most popular stochastic optimizer for accelerating the training of deep neural networks. However, it is empirically known that Adam often generalizes worse than Stochastic Gradient Descent (SGD). The purpose of this paper is to unveil the mystery of this behavior in the diffusion theoretical framework. Specifically, we disentangle the effects of Adaptive Learning Rate and Momentum of the Adam dynamics on saddle-point escaping and flat minima selection. We prove that Adaptive Learning Rate can escape saddle points efficiently, but cannot select flat minima as SGD does. In contrast, Momentum provides a drift effect to help the training process pass through saddle points, and almost does not affect flat minima selection. This partly explains why SGD (with Momentum) generalizes better, while Adam generalizes worse but converges faster. Furthermore, motivated by the analysis, we design a novel adaptive optimization framework named Adaptive Inertia, which uses parameter-wise adaptive inertia to accelerate the training and provably favors flat minima as well as SGD. Our extensive experiments demonstrate that the proposed adaptive inertia method can generalize significantly better than SGD and conventional adaptive gradient methods.
研究动机与目标
- 理解为何Adam比SGD收敛更快但泛化性能更差,尤其从极小值选择与鞍点逃离的角度。
- 利用扩散理论解耦Adam动力学中自适应学习率与动量的独立作用。
- 解释为何Adam在收敛更快的同时,仍会找到比SGD更尖锐的极小值这一经验现象。
- 设计一种新优化框架,在保留Adam快速收敛的同时,通过偏好更平坦极小值来提升泛化性能。
- 从理论与实证两方面验证:Adaptive Inertia(Adai)可快速逃离鞍点并选择更平坦的极小值,其泛化性能与SGD相当。
提出的方法
- 作者在扩散框架下,使用随机微分方程(SDE)对Adam的动力学进行建模,将优化过程视为连续时间的Langevin过程。
- 将Adam分解为两部分:自适应学习率(建模为各向异性扩散)与动量(建模为漂移项),并分别分析其对鞍点逃离与极小值选择的影响。
- 基于Fokker-Planck方程与扩散矩阵分析,证明自适应学习率可实现快速鞍点逃离,但不偏好平坦极小值;而动量提供漂移效应以辅助逃离,对极小值尖锐度影响可忽略。
- 基于此分析,提出Adaptive Inertia(Adai),用参数级自适应动量(惯性)替代自适应学习率,其中惯性系数根据梯度幅值的移动平均进行调整。
- Adai被表述为一种带有时变、参数特异性惯性项的改进动量更新,其推导基于优化动力学的牛顿运动类比。
- 该方法实现了稳定且解耦权重衰减的变体(AdaiS/AdaiW),确保与标准训练实践兼容。
实验结果
研究问题
- RQ1Adam中的自适应学习率与动量各自如何影响鞍点逃离与平坦极小值选择?
- RQ2为何Adam收敛速度优于SGD,但泛化性能更差,尽管SGD具有更优的泛化表现?
- RQ3能否将Adam的动力学解耦,以分离出自适应学习率与动量对优化行为的独立贡献?
- RQ4能否设计一种新优化框架,结合自适应学习率带来的快速收敛与平坦极小值选择带来的良好泛化性能?
- RQ5参数级自适应动量机制(自适应惯性)是否能理论证明偏好平坦极小值,同时保持快速的鞍点逃离能力?
主要发现
- 自适应学习率可实现快速逃离鞍点,但不偏好平坦极小值,解释了为何Adam会找到比SGD更尖锐的极小值。
- 动量通过提供漂移效应促进鞍点逃离,但对平坦与尖锐极小值的选择影响极小。
- 自适应惯性(Adai)可理论证明快速逃离鞍点并选择更平坦的极小值,其泛化行为与SGD相当。
- 大量实验表明,Adai在CIFAR-10、CIFAR-100与ImageNet上,使用ResNet与Vision Transformer架构时,泛化性能显著优于Adam与SGD。
- 极小值尖锐度的期望分析表明,Adai与SGD学习到的极小值比Adam更平坦,且Adai对权重扰动表现出更强鲁棒性。
- Adai在收敛速度上优于SGD,同时在泛化性能上达到或超越SGD,且在多个基准测试中测试准确率超过Adam。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。