[论文解读] Early Stopping is Nonparametric Variational Inference
本文提出,通过随机初始化的非收敛随机梯度下降(SGD)通过优化步骤对初始分布进行变换,隐式地执行非参数变分推断。该文引入了一种基于熵追踪的可扩展、无偏变分下界估计器,实现了无需验证集的超参数优化,并为深度学习中的早停和模型集成提供了理论基础。
We show that unconverged stochastic gradient descent can be interpreted as a procedure that samples from a nonparametric variational approximate posterior distribution. This distribution is implicitly defined as the transformation of an initial distribution by a sequence of optimization updates. By tracking the change in entropy over this sequence of transformations during optimization, we form a scalable, unbiased estimate of the variational lower bound on the log marginal likelihood. We can use this bound to optimize hyperparameters instead of using cross-validation. This Bayesian interpretation of SGD suggests improved, overfitting-resistant optimization procedures, and gives a theoretical foundation for popular tricks such as early stopping and ensembling. We investigate the properties of this marginal likelihood estimator on neural network models.
研究动机与目标
- 为早停和不完全优化提供理论解释,将其视为具有隐式、非参数后验近似的变分推断。
- 通过SGD过程中的熵追踪,开发一种可扩展、无偏的对数边缘似然变分下界的估计器。
- 通过利用估计的边缘似然,实现无需验证集的超参数优化。
- 分析神经网络中通过优化动力学形成的隐式变分分布的性质。
- 探讨具有随机初始化的优化算法如何隐式定义一系列收敛于后验众数的分布序列。
提出的方法
- 将SGD的每一步优化解释为对初始参数分布的确定性变换,形成一系列隐式、非参数的变分近似。
- 追踪优化步骤中熵的变化,以估计每一步迭代时隐式变分分布的熵。
- 利用熵估计计算对数边缘似然的无偏、可扩展下界,该下界可作为模型选择的代理指标。
- 提出一种“熵友好型”SGD变体,通过修改更新规则,保持更稳定、更具信息量的隐式分布。
- 将该估计器应用于神经网络,实现基于边缘似然估计而非交叉验证的超参数调优。
- 采用反向模式微分,实现对变分参数(包括训练超参数)的基于梯度的优化。
实验结果
研究问题
- RQ1非收敛的SGD能否被解释为从非参数变分后验分布中进行采样?
- RQ2SGD形成的隐式变分分布的熵能否以可扩展且无偏的方式估计?
- RQ3基于变分下界估计的边缘似然是否与测试数据上的泛化性能相关?
- RQ4能否在无需验证集的情况下,利用边缘似然估计器优化超参数?
- RQ5优化生成的隐式分布与真实后验相比,在质量与集中度方面如何?
主要发现
- 本文确立了:具有随机初始化的SGD每一步迭代都隐式定义了一个收敛于后验众数的非参数变分分布。
- 所提出的熵估计器可对具有数百万参数的模型,实现对对数边缘似然变分下界的无偏、可扩展估计。
- 边缘似然估计器与测试性能表现出合理的相关性,表明其在神经网络中具有无验证集模型选择的潜力。
- 该方法为早停提供了理论依据:即通过调整迭代次数来优化变分下界。
- 对多个SGD运行进行模型集成,可自然地解释为从同一隐式变分后验中独立采样,解释了其经验成功。
- 熵友好型SGD变体保持了更稳定、更具信息量的隐式分布,从而提升了变分近似的质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。