[论文解读] Training Deep Neural Networks with Adaptive Momentum Inspired by the Quadratic Optimization
本文提出了一种用于训练深度神经网络的自适应动量方法,其灵感来源于二次优化中的最优动量选择。通过根据梯度和参数变化动态调整动量系数,该方法在SGD和Adam中均提升了收敛速度、对学习率的鲁棒性以及泛化性能,并在凸与非凸设置下提供了理论收敛保证。
Heavy ball momentum is crucial in accelerating (stochastic) gradient-based optimization algorithms for machine learning. Existing heavy ball momentum is usually weighted by a uniform hyperparameter, which relies on excessive tuning. Moreover, the calibrated fixed hyperparameter may not lead to optimal performance. In this paper, to eliminate the effort for tuning the momentum-related hyperparameter, we propose a new adaptive momentum inspired by the optimal choice of the heavy ball momentum for quadratic optimization. Our proposed adaptive heavy ball momentum can improve stochastic gradient descent (SGD) and Adam. SGD and Adam with the newly designed adaptive momentum are more robust to large learning rates, converge faster, and generalize better than the baselines. We verify the efficiency of SGD and Adam with the new adaptive momentum on extensive machine learning benchmarks, including image classification, language modeling, and machine translation. Finally, we provide convergence guarantees for SGD and Adam with the proposed adaptive momentum.
研究动机与目标
- 消除SGD和Adam中动量超参数的手动调优需求。
- 开发一种基于优化动态的系统性自适应动量方案,实现动态调整。
- 提升训练对大学习率的鲁棒性,并增强泛化性能。
- 为所提出的自适应动量在凸与非凸优化设置下提供理论收敛保证。
提出的方法
- 自适应动量系数 $\beta_{k+1}$ 通过从二次优化中的最优动量推导出的公式计算:$\beta_{k+1} = \text{Proj}_{[0,1-\delta]}\left(\left[1 - \sqrt{\gamma \frac{\|\mathbf{g}^k - \mathbf{g}^{k-1}\|}{\|\mathbf{x}^k - \mathbf{x}^{k-1}\|}}\right]^2\right)$,其中 $k \geq 2$。
- 该方法利用梯度与参数差值的 $\ell_2$ 范数来估计曲率,从而实现动量的动态调整。
- 该方法被整合进标准SGD与Adam中,将固定的 $\beta$ 替换为自适应的 $\beta_{k+1}$。
- 投影算子确保 $\beta_{k+1} \in [0, 1 - \delta]$,实验中 $\delta = 10^{-3}$。
- 理论分析建立了自适应动量在凸与非凸设置下的收敛性,包括近端HB与Adam变体。
- 该方法在图像分类、语言建模与机器翻译基准上得到验证。
实验结果
研究问题
- RQ1我们能否设计一种自适应动量,以消除SGD与Adam中动量超参数 $\beta$ 的手动调优?
- RQ2所提出的自适应动量是否能提升深度神经网络训练的收敛速度与泛化性能?
- RQ3该自适应动量在各类机器学习任务中对大学习率是否具有鲁棒性?
- RQ4我们能否为采用所提出自适应动量的SGD与Adam提供理论收敛保证?
主要发现
- 在所有评估的基准上,采用所提自适应动量的SGD与Adam均比其基线方法收敛更快。
- 自适应动量方法的泛化性能优于标准SGD与Adam,尤其在大学习率下表现更优。
- 该方法对学习率超参数表现出更强的鲁棒性,在学习率非最优时仍能保持良好性能。
- 理论收敛性在凸与非凸设置下均得到证明,包括近端HB与Adam变体。
- 在图像分类、语言建模与机器翻译任务上的实证结果证实了性能的持续提升。
- 该自适应动量方案在多个标准基准上实现了最先进性能,且无需对 $\beta$ 进行手动调优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。