Skip to main content
QUICK REVIEW

[论文解读] On Optimal Early Stopping: Over-informative versus Under-informative Parametrization

Ruoqi Shen, Liyao Gao|arXiv (Cornell University)|Feb 20, 2022
Stochastic Gradient Optimization Techniques被引用 7
一句话总结

本文通过引入一个理论框架,研究了神经网络中的最优早停问题,该框架区分了过度信息性(模型维度 > 特征数量)和信息不足性参数化。研究表明,在过度信息性设置中(深度学习中常见),最优早停时间随着模型规模增大而减少,解决了与先前理论的矛盾,并与在CIFAR和MNIST上带有标签噪声的ResNet训练中的经验观察一致。

ABSTRACT

Early stopping is a simple and widely used method to prevent over-training neural networks. We develop theoretical results to reveal the relationship between the optimal early stopping time and model dimension as well as sample size of the dataset for certain linear models. Our results demonstrate two very different behaviors when the model dimension exceeds the number of features versus the opposite scenario. While most previous works on linear models focus on the latter setting, we observe that the dimension of the model often exceeds the number of features arising from data in common deep learning tasks and propose a model to study this setting. We demonstrate experimentally that our theoretical results on optimal early stopping time corresponds to the training process of deep neural networks.

研究动机与目标

  • 解决深度神经网络早停中理论预测与经验观察之间的差异。
  • 开发一个理论框架,解释在模型维度超过特征数量(即过度信息性参数化)设置下的最优早停时间。
  • 证明过度信息性参数化比先前的信息不足性模型更能反映真实的深度学习场景。
  • 为实践中随着模型宽度增加而观测到的最优早停时间减少现象,提供理论和经验上的支持。

提出的方法

  • 提出一种新的线性模型理论模型,其中参数数量超过有信息的特征数量,将此定义为过度信息性参数化。
  • 在模型维度d和样本量n的条件下分析最优早停时间,基于高斯输入假设推导其渐近行为。
  • 使用两层ReLU网络和简化的ResNet架构,通过实验验证理论预测。
  • 在CIFAR-10/100和MNIST上使用随机梯度下降、交叉熵损失和受控标签噪声(10%、20%、30%)进行标准数据增强。
  • 将最优早停时间定义为测试风险最小的训练轮次,并在不同模型宽度和深度之间进行比较。
  • 每个设置进行10次独立运行,以生成经验边界并评估方差。

实验结果

研究问题

  • RQ1在过度信息性参数化下,最优早停时间如何随模型规模d和样本量n变化?
  • RQ2为何在实践中,随着模型宽度增加,最优早停时间反而减少,这与先前理论模型的预测相反?
  • RQ3最优早停行为在过度信息性与信息不足性参数化设置下有何不同?
  • RQ4理论预测的最优早停时间与深度神经网络的实际训练动态在多大程度上吻合?
  • RQ5标签噪声如何影响不同模型宽度和深度下的最优早停时间?

主要发现

  • 在过度信息性参数化(d > p)下,最优早停时间随模型宽度d的增加而减少,与在ResNet和两层ReLU网络上的经验观察一致。
  • 在信息不足性参数化(d ≤ p)下,最优早停时间随模型大小d和样本量n的增加而增加,与先前的理论工作一致。
  • 对于过度信息性模型,最优早停时的测试风险随样本量n的增加而减少,表明更多数据可提升泛化性能。
  • 对于信息不足性模型,最优早停时的测试风险随模型大小d和样本量n的增加而减少。
  • 在CIFAR-100上使用20%标签噪声的实证结果表明,随着模型宽度增加,最优早停时间减少,与过度信息性设置下的理论预测一致。
  • 当ResNet深度从4增加到6并同时扩展宽度时,最优早停时间出现可测量的减少,证实该趋势在不同网络深度下均成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。