[论文解读] Stochastic Gradient Descent with Nonlinear Conjugate Gradient-Style Adaptive Momentum
该论文提出FRSGD,一种基于非线性共轭梯度(NCG)风格自适应动量的随机梯度下降方法,消除了手动调整动量超参数的需要。通过根据梯度历史动态调整动量,该方法支持更大的学习率,加速训练过程,并在ResNet模型中同时提升干净样本和对抗样本的准确率,将CIFAR-10测试误差从5.25%降低至4.64%,CIFAR-100从23.75%降低至20.03%。
Momentum plays a crucial role in stochastic gradient-based optimization algorithms for accelerating or improving training deep neural networks (DNNs). In deep learning practice, the momentum is usually weighted by a well-calibrated constant. However, tuning hyperparameters for momentum can be a significant computational burden. In this paper, we propose a novel \emph{adaptive momentum} for improving DNNs training; this adaptive momentum, with no momentum related hyperparameter required, is motivated by the nonlinear conjugate gradient (NCG) method. Stochastic gradient descent (SGD) with this new adaptive momentum eliminates the need for the momentum hyperparameter calibration, allows a significantly larger learning rate, accelerates DNN training, and improves final accuracy and robustness of the trained DNNs. For instance, SGD with this adaptive momentum reduces classification errors for training ResNet110 for CIFAR10 and CIFAR100 from $5.25\%$ to $4.64\%$ and $23.75\%$ to $20.03\%$, respectively. Furthermore, SGD with the new adaptive momentum also benefits adversarial training and improves adversarial robustness of the trained DNNs.
研究动机与目标
- 解决在深度神经网络(DNN)训练中SGD方法因调整动量超参数带来的计算负担。
- 在不增加计算成本的前提下,提升DNN的训练收敛速度和最终模型准确率。
- 通过一种新颖的自适应动量机制,增强DNN的对抗鲁棒性。
- 开发一种简单有效的现有自适应优化方法(如Adam或Nesterov动量)的替代方案。
提出的方法
- 提出一种受非线性共轭梯度(NCG)方法启发的新自适应动量项,用动态计算的值替代固定的动量系数β。
- 动量更新采用源自NCG的公式,依赖于当前和前一时刻的梯度,确保下降方向的自适应性。
- 在保持固定学习率的同时,由于收敛特性改善,可显著增大步长。
- 该算法设计为与标准SGD向后兼容,仅需极少代码修改。
- 通过使用简化且高效的NCG动量更新近似方法,避免了线搜索,适用于小批量训练。
- 该方法作为常数β的替代品集成到SGD中,无需额外调优超参数。
实验结果
研究问题
- RQ1基于NCG启发的自适应动量机制是否能提升DNN训练中随机梯度下降的训练速度与收敛性?
- RQ2消除动量超参数β是否能在不增加计算成本的前提下,提升DNN的泛化能力和鲁棒性?
- RQ3该自适应动量能否在保持或提升模型准确率的同时支持更大的学习率?
- RQ4与使用Nesterov动量的SGD及Adam相比,该方法在干净样本和对抗样本准确率方面表现如何?
- RQ5该自适应动量能否在各种对抗攻击下提升DNN的对抗鲁棒性?
主要发现
- FRSGD将ResNet110在CIFAR-10上的测试误差从5.25%降低至4.64%,相对提升11.6%。
- 在CIFAR-100上,测试误差从23.75%降至20.03%,相对提升15.6%。
- 在延长训练(400个周期)下,FRSGD在CIFAR-10上实现4.26%的测试误差,在CIFAR-100上为19.89%,优于SGD和SGD+Nesterov动量。
- 在CIFAR-10上使用PreResNet290训练时,FRSGD的训练损失为0.00138,显著低于SGD的0.0048和SGD+NM的0.0052。
- 在对抗训练中,FRSGD在IFGSM-100攻击下于CIFAR-10上实现52.15%的鲁棒准确率,优于SGD+NM的51.08%,表明其鲁棒性更强。
- 在所有测试攻击(FGSM、IFGSM、C&W)下,FRSGD均一致优于基线SGD和SGD+NM,显著提升对抗鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。