[论文解读] AdaS: Adaptive Scheduling of Stochastic Gradients
AdaS 提出了一种用于随机梯度下降(SGD)的自适应学习率调度方法,该方法基于卷积层权重低秩分解所导出的‘知识增益’率变化动态调整学习率。通过监控知识增益和各层的映射条件,AdaS 在无需验证集进行早停的情况下,实现了比自适应优化器(如Adam)更快的收敛速度和更优的泛化性能。
The choice of step-size used in Stochastic Gradient Descent (SGD) optimization is empirically selected in most training procedures. Moreover, the use of scheduled learning techniques such as Step-Decaying, Cyclical-Learning, and Warmup to tune the step-size requires extensive practical experience--offering limited insight into how the parameters update--and is not consistent across applications. This work attempts to answer a question of interest to both researchers and practitioners, namely extit{"how much knowledge is gained in iterative training of deep neural networks?"} Answering this question introduces two useful metrics derived from the singular values of the low-rank factorization of convolution layers in deep neural networks. We introduce the notions of extit{"knowledge gain"} and extit{"mapping condition"} and propose a new algorithm called Adaptive Scheduling (AdaS) that utilizes these derived metrics to adapt the SGD learning rate proportionally to the rate of change in knowledge gain over successive iterations. Experimentation reveals that, using the derived metrics, AdaS exhibits: (a) faster convergence and superior generalization over existing adaptive learning methods; and (b) lack of dependence on a validation set to determine when to stop training. Code is available at \url{https://github.com/mahdihosseini/AdaS}.
研究动机与目标
- 解决固定学习率和调度学习率在SGD中的局限性,后者常导致收敛性差和泛化能力弱。
- 引入新度量——知识增益和映射条件,以量化单个卷积层内学习的质量。
- 开发一种自适应学习率调度框架,提升收敛速度和泛化能力,且不依赖验证数据。
- 通过实现层特定的自动学习率自适应,减少对人工超参数调优的依赖。
提出的方法
- 该方法对卷积层权重矩阵进行低秩分解,提取奇异值,并推导出‘知识增益’度量,表示网络中信息累积的速率。
- ‘映射条件’被定义为分解中最大与最小奇异值的比值,用以表示层的输入-输出变换的条件性。
- 学习率根据知识增益随迭代变化的速率自适应调度,确保当知识增益快速增加时执行更大的更新。
- 该算法对每个卷积块独立进行学习率调度,从而实现对层特定学习动态的细粒度适应。
- 在整个训练过程中持续监控知识增益和映射条件,以指导学习率调整并确定训练终止时机。
- 该方法与带有动量的SGD兼容,并可与现有自适应优化器(如Adam)集成,以增强鲁棒性。
实验结果
研究问题
- RQ1如何量化深度神经网络迭代训练过程中所获得的知识量?
- RQ2权重变换的条件性(映射条件)在泛化和收敛中起到何种作用?
- RQ3基于知识增益的学习率调度是否能相比固定或启发式调度,提升收敛速度和测试性能?
- RQ4是否可以通过使用内在训练度量,消除对验证集进行早停的需求?
- RQ5基于层特定知识增益的自适应学习率调度,如何影响不同优化器下的泛化性能?
主要发现
- AdaS 在CIFAR-10上使用ResNet-18实现了95.16%的测试准确率,优于Adam(93.22%)和使用循环学习率的SGD(94.13%)。
- AdaS 将训练损失降低至8.69e-4,显著低于Adam(5.66e-3)和RMSProp(6.35e-3),表明收敛速度更快。
- 在β=0.95时,AdaS 的知识增益达到0.2938,高于Adam(0.2973)和RMSProp(0.3011),表明其信息累积更高效,学习更有效。
- AdaS 中的映射条件κ在所有设置下均保持在9以下,表明层变换的条件性更优,优于Adam(18.484),这与泛化性能的提升相关。
- AdaS 在无需验证集的情况下实现了更优的泛化性能,因为训练终止由训练损失直接根据所推导度量确定。
- 该方法对初始学习率的选择具有鲁棒性,并可与Adam等自适应优化器结合,实现进一步的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。