[论文解读] S-SGD: Symmetrical Stochastic Gradient Descent with Weight Noise Injection for Reaching Flat Minima
本文提出对称随机梯度下降(S-SGD),一种正则化方法,通过在训练过程中向深度神经网络权重注入固定幅度的对称噪声,以促进收敛至平坦极小值。通过在两个扰动权重点处评估损失,S-SGD 稳定了训练过程并提升了泛化性能,在卷积神经网络(CNNs)、循环神经网络(RNNs)和语音识别任务中,其表现优于标准SGD、Dropout和DropConnect,且在准确率上保持一致的提升。
The stochastic gradient descent (SGD) method is most widely used for deep neural network (DNN) training. However, the method does not always converge to a flat minimum of the loss surface that can demonstrate high generalization capability. Weight noise injection has been extensively studied for finding flat minima using the SGD method. We devise a new weight-noise injection-based SGD method that adds symmetrical noises to the DNN weights. The training with symmetrical noise evaluates the loss surface at two adjacent points, by which convergence to sharp minima can be avoided. Fixed-magnitude symmetric noises are added to minimize training instability. The proposed method is compared with the conventional SGD method and previous weight-noise injection algorithms using convolutional neural networks for image classification. Particularly, performance improvements in large batch training are demonstrated. This method shows superior performance compared with conventional SGD and weight-noise injection methods regardless of the batch-size and learning rate scheduling algorithms.
研究动机与目标
- 通过促进收敛至平坦极小值,解决深度神经网络(DNN)训练中的过拟合和泛化性能差的问题。
- 通过一种新型正则化技术显式测量损失曲面平坦度,提升训练稳定性和泛化性能。
- 开发一种简单、灵活且高效的方法,适用于全连接层、卷积层和循环层。
- 通过利用与Hessian相关的梯度更新,设计一种增强对权重和数据扰动鲁棒性的训练算法。
提出的方法
- S-SGD 在每次更新时向网络权重注入固定幅度的对称噪声,同时计算扰动权重点和原始权重点的损失。
- 该算法在两个对称点处评估损失:w + ε 和 w - ε,其中 ε 为固定噪声向量,用于估计损失曲面的平坦度。
- 权重更新基于两个扰动点的平均梯度计算,从而在更新规则中有效引入Hessian信息。
- 该方法通过在高曲率区域增加损失变化,惩罚尖锐极小值,从而倾向于选择平坦极小值。
- 其与标准SGD兼容,可无需架构修改地应用于全连接层、卷积层和循环层。
- 该方法通过使用对称扰动的有限差分近似,避免了Hessian计算的计算开销。
实验结果
研究问题
- RQ1通过促进收敛至平坦极小值,对称权重噪声注入是否能提升DNN训练的泛化性能?
- RQ2与传统的正则化技术(如Dropout和DropConnect)相比,S-SGD在测试准确率和鲁棒性方面表现如何?
- RQ3与随机噪声注入相比,使用固定幅度对称噪声是否能增强训练稳定性和损失曲面平坦度?
- RQ4S-SGD在包括CNNs、RNNs和门控卷积网络在内的多种架构中,性能提升的幅度如何?
- RQ5S-SGD能否有效避免尖锐极小值和过拟合?这是否可通过损失曲面可视化和Hessian特征值分析得到证实?
主要发现
- 在使用ResNet20的CIFAR-10数据集上,S-SGD实现了92.62%的测试准确率,优于SGD(92.17%)和DropConnect(92.18%)的相同设置。
- 在CIFAR-100上,S-SGD在125个周期后达到69.63%的测试准确率,超过SGD(68.51%)和微调后的SGD(68.51%)。
- 损失曲面可视化显示,S-SGD收敛至损失盆地中心附近的平坦区域,避免了与尖锐极小值相关的陡峭壁。
- Hessian特征值分析证实,S-SGD训练的模型表现出更低的最大特征值,表明极小值更平坦,泛化性能更优。
- 在端到端语音识别任务中使用门控卷积网络(Gated ConvNet),S-SGD在性能上持续优于基线SGD和噪声注入方法。
- S-SGD表现出更优的稳定性和鲁棒性,其训练损失远离陡峭的损失壁,表明过拟合程度更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。