[论文解读] Scalable Gradient-Based Tuning of Continuous Regularization Hyperparameters
本文提出了一种可扩展的、基于梯度的方法,用于在单次训练过程中联合训练深度神经网络参数和连续正则化超参数(例如L2权重衰减、输入噪声)。通过使用独立的训练集和验证集来计算模型和超参数的梯度,该方法仅带来30%的计算开销,即可实现接近最优的正则化水平,显著优于朴素的超参数搜索方法,同时避免了昂贵的Hessian矩阵计算。
Hyperparameter selection generally relies on running multiple full training trials, with selection based on validation set performance. We propose a gradient-based approach for locally adjusting hyperparameters during training of the model. Hyperparameters are adjusted so as to make the model parameter gradients, and hence updates, more advantageous for the validation cost. We explore the approach for tuning regularization hyperparameters and find that in experiments on MNIST, SVHN and CIFAR-10, the resulting regularization levels are within the optimal regions. The additional computational cost depends on how frequently the hyperparameters are trained, but the tested scheme adds only 30% computational overhead regardless of the model size. Since the method is significantly less computationally demanding compared to similar gradient-based approaches to hyperparameter optimization, and consistently finds good hyperparameter values, it can be a useful tool for training neural network models.
研究动机与目标
- 解决传统超参数调优方法计算成本过高的问题,这些方法需要在固定超参数下进行多次完整的训练运行。
- 开发一种方法,能够在训练过程中根据验证集表现实时自动调整正则化超参数。
- 在保持高模型泛化性能的同时,降低超参数优化的计算负担。
- 探究在训练过程中动态调优超参数是否能获得与穷举搜索相当的结果,而不会过度拟合验证集。
提出的方法
- 该方法称为T1-T2,通过在两个独立数据划分(T1:训练集,T2:验证集)上使用随机梯度下降,同时优化模型参数和超参数。
- 模型参数通过在训练损失上的标准反向传播进行更新,而超参数则通过未正则化模型在验证损失上的梯度进行更新。
- 该方法通过使用一阶近似避免计算Hessian矩阵或其逆矩阵,从而大幅降低内存和计算开销。
- 引入批量归一化和自适应学习率以稳定训练过程,并在超参数更新过程中提升收敛性。
- 超参数在训练过程中持续更新,实现对学习轨迹的动态适应,而无需重新完整训练。
- 该方法实现了端到端可微分的超参数调优,将超参数视为可学习参数,并从验证集反向传播梯度。
实验结果
研究问题
- RQ1基于梯度的方法是否能在训练过程中以极低计算开销调优正则化超参数?
- RQ2T1-T2方法是否能在不进行多次完整训练运行的情况下,找到接近最优配置的超参数值?
- RQ3采用动态调优超参数训练的模型性能与使用固定超参数的模型相比如何?
- RQ4是否存在显著的滞后效应,即在训练过程中改变超参数会影响最终模型性能,与固定超参数相比?
- RQ5该方法是否会过度拟合验证集,其在测试集上的泛化性能如何?
主要发现
- T1-T2方法在MNIST、SVHN和CIFAR-10数据集上均实现了接近最优区域的正则化水平,即使从较差的初始超参数值开始也如此。
- 该方法的计算开销仅增加30%,且与模型大小无关,显著优于以往基于梯度的超参数优化方法。
- 将模型重新运行并固定为T1-T2最终得到的超参数值后,大多数情况下性能均有所提升,表明动态调优与最终模型质量之间存在强相关性。
- 观察到滞后效应,尤其在CIFAR-10上,T1-T2调优后使用固定超参数重新训练可获得显著的性能提升。
- 即使在最多20个超参数的情况下,也未观察到对验证集的显著过拟合,表明该方法在测试集上泛化能力良好。
- 该方法能持续改善初始正则化水平,尤其当初始值远离最优时,显示出其作为自校正调优机制的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。