[论文解读] Does Adam optimizer keep close to the optimal point?
本文表明,当由于第二moment估计过小导致有效学习率过大时,Adam在单点凸区域中无法保持在最优解附近。为解决此问题,作者提出AdaFix,该方法在第二moment估计稳定后将其固定,从而确保在最优解附近的收敛性与稳定性,在MNIST和CIFAR-10上优于Adam及其他自适应方法。
The adaptive optimizer for training neural networks has continually evolved to overcome the limitations of the previously proposed adaptive methods. Recent studies have found the rare counterexamples that Adam cannot converge to the optimal point. Those counterexamples reveal the distortion of Adam due to a small second momentum from a small gradient. Unlike previous studies, we show Adam cannot keep closer to the optimal point for not only the counterexamples but also a general convex region when the effective learning rate exceeds the certain bound. Subsequently, we propose an algorithm that overcomes Adam's limitation and ensures that it can reach and stay at the optimal point region.
研究动机与目标
- 识别为何Adam在某些情况下虽收敛却无法保持在最优解附近。
- 分析Adam在最优解为局部凸的单点凸区域中的不稳定性。
- 推导第二moment估计的理论边界,以防止其偏离最优区域。
- 设计一种新型自适应优化器AdaFix,确保在最优解附近的收敛性与稳定性。
- 在标准视觉基准上验证AdaFix相较于Adam、AMSGrad和AdaBound的优越性。
提出的方法
- 作者在单点凸性假设下分析Adam的行为,此时梯度始终指向最优解。
- 推导第二moment估计 $\hat{v}_t$ 的理论边界,以防止有效学习率 $\eta / \sqrt{\hat{v}_t}$ 过大。
- AdaFix在 $\hat{v}_t$ 达到稳定且足够小的值后将其固定,防止因小梯度导致的爆炸性学习率。
- 算法通过梯度差与参数更新的比值近似训练轨迹上的L-利普希茨常数 $L$。
- 固定后的 $\hat{v}_t$ 用于维持稳定的有效学习率,避免发散与欠拟合。
- AdaFix在MNIST和CIFAR-10上使用多种架构进行评估,与Adam、AMSGrad、AdaBound和SGDM进行比较。
实验结果
研究问题
- RQ1即使Adam已收敛,它能否在单点凸区域中保持靠近最优解?
- RQ2为何Adam在理论上收敛时仍会从最优区域发散?
- RQ3第二moment估计的何种理论边界可防止Adam逃离最优区域?
- RQ4如何稳定自适应学习率,以确保在最优解附近的收敛性与稳定性?
- RQ5修改后的自适应优化器能否在标准视觉基准上超越Adam及其变体?
主要发现
- 在MNIST上使用两层MLP,AdaFix取得98.75% ± 0.02的测试准确率,优于Adam的98.70% ± 0.03。
- 在CIFAR-10上不使用数据增强时,AdaFix在DenseNet53上达到90.25% ± 0.19,超过Adam的90.07% ± 0.04。
- 使用数据增强后,AdaFix在DenseNet53上达到93.51% ± 0.17,与SGDM及其他自适应方法持平或更优。
- 图2显示,Adam的 $||v||_2$ 变得极小,导致有效学习率爆炸并引发测试准确率振荡,而AdaFix则稳定了学习率。
- AMSGrad虽可防止学习率爆炸,但存在有效学习率过小的问题,而AdaFix在稳定性和效率之间实现了良好平衡。
- 理论分析表明,当 $\delta \ll L$ 时,有效学习率的边界近似为 $L\eta$,这证明了在 $\hat{v}_t$ 稳定后固定它的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。