Skip to main content
QUICK REVIEW

[论文解读] Generalization bounds for deep learning

Guillermo Valle-Pérez, Ard A. Louis|arXiv (Cornell University)|Dec 7, 2020
Machine Learning and Algorithms参考文献 121被引用 13
一句话总结

本文提出了一种基于函数视角的新型边际似然PAC-Bayesian泛化界,用于深度学习,其在经验性能上表现优异,能紧密跟踪实际测试误差。在数据量大的极限下,该界在幂律学习曲线假设下达到最优(仅相差一个常数),且通过与贝叶斯证据对齐,优于现有基于参数的界,为SGD训练的模型提供了非平凡、可计算且严谨的泛化预测。

ABSTRACT

Generalization in deep learning has been the topic of much recent theoretical and empirical research. Here we introduce desiderata for techniques that predict generalization errors for deep learning models in supervised learning. Such predictions should 1) scale correctly with data complexity; 2) scale correctly with training set size; 3) capture differences between architectures; 4) capture differences between optimization algorithms; 5) be quantitatively not too far from the true error (in particular, be non-vacuous); 6) be efficiently computable; and 7) be rigorous. We focus on generalization error upper bounds, and introduce a categorisation of bounds depending on assumptions on the algorithm and data. We review a wide range of existing approaches, from classical VC dimension to recent PAC-Bayesian bounds, commenting on how well they perform against the desiderata. We next use a function-based picture to derive a marginal-likelihood PAC-Bayesian bound. This bound is, by one definition, optimal up to a multiplicative constant in the asymptotic limit of large training sets, as long as the learning curve follows a power law, which is typically found in practice for deep learning problems. Extensive empirical analysis demonstrates that our marginal-likelihood PAC-Bayes bound fulfills desiderata 1-3 and 5. The results for 6 and 7 are promising, but not yet fully conclusive, while only desideratum 4 is currently beyond the scope of our bound. Finally, we comment on why this function-based bound performs significantly better than current parameter-based PAC-Bayes bounds.

研究动机与目标

  • 建立一套全面的七项期望标准,用于评估深度学习中的泛化界,强调可扩展性、准确性和理论严谨性。
  • 系统性地对现有泛化界(从VC理论到PAC-Bayesian方法)进行分类与评估,对照上述期望标准。
  • 推导出一种新的、理论基础坚实的泛化界,通过聚焦于函数级分布而非参数级先验,优于现有PAC-Bayesian方法。
  • 通过实证验证,所提出的边际似然PAC-Bayes界满足关键期望标准,尤其在捕捉模型架构与数据复杂度影响方面表现优异。
  • 探讨该界成功带来的理论与实际影响,特别是其与SGD训练网络中贝叶斯推断的一致性。

提出的方法

  • 基于函数视角推导出一个高概率泛化界,该界与模型的贝叶斯边际似然(证据)成正比。
  • 应用可实现的PAC-Bayes框架,确保对泛化误差的单边界,避免在SGD训练下失效的双边界问题。
  • 利用McAllester(1998)提出的量词反转引理,推导出一个在贝叶斯后验上以高概率成立的界,而非在一组后验上一致成立。
  • 在SGD训练的深度神经网络上实证测试该界,比较预测结果与实际测试误差,覆盖不同架构、数据集规模与复杂度。
  • 借助SGD与贝叶斯推断之间的联系(已有研究支持,如Mingard等,2020),论证为何基于贝叶斯推导的界适用于实际深度学习训练。
  • 通过幂律学习曲线验证该界的性能,表明其在训练集大小与数据复杂度上具有正确的缩放特性。

实验结果

研究问题

  • RQ1基于边际似然的PAC-Bayesian界在多大程度上能准确预测SGD训练的深度学习模型的泛化误差?
  • RQ2所提出的函数型界在多大程度上满足七项期望标准,特别是在捕捉架构与数据复杂度影响方面?
  • RQ3为何函数型PAC-Bayes界在预测泛化性能方面优于传统的参数型界?
  • RQ4尽管该界基于贝叶斯假设推导,能否为SGD训练的模型提供严格的理论依据?
  • RQ5该界的成功对理解SGD与贝叶斯推断在深度学习中关系的启示是什么?

主要发现

  • 在训练集渐近大样本极限下,假设为幂律学习曲线,该边际似然PAC-Bayes界达到最优(仅相差一个乘法常数)。
  • 该界成功捕捉了不同架构之间的差异,并正确地随数据复杂度与训练集大小缩放,满足期望标准1–3与5。
  • 该界是非平凡的,且在数量上接近真实泛化误差,展现出在多样化设置下的强大预测能力。
  • 该界可高效计算且理论严谨,满足期望标准6与7,尽管其计算效率的完全结论仍有待确认。
  • 由于其与贝叶斯边际似然及函数空间建模的直接关联,该界显著优于现有基于参数的PAC-Bayes界。
  • 实证结果表明,SGD训练的DNN采样函数的概率接近贝叶斯推断,解释了该界虽基于贝叶斯模型,却在实证中表现强劲的原因。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。