Skip to main content
QUICK REVIEW

[论文解读] PAC-Bayes with Backprop

Omar Rivasplata, Vikram M Tankasali|arXiv (Cornell University)|Aug 19, 2019
Adversarial Robustness in Machine Learning参考文献 32被引用 15
一句话总结

本文提出了两种新颖的PAC-Bayes训练目标——PAC-Bayes-lambda与PAC-Bayes-quadratic,通过反向传播训练概率性神经网络。实验表明,这些方法在MNIST上实现了约1.4%的竞争力测试误差,同时生成了显著更紧致、非平凡的风险界(约2.3%),优于以往工作,表明在具备理论保证与实际性能的自 bounding 学习方面取得了进展。

ABSTRACT

We explore the family of methods "PAC-Bayes with Backprop" (PBB) to train probabilistic neural networks by minimizing PAC-Bayes bounds. We present two training objectives, one derived from a previously known PAC-Bayes bound, and a second one derived from a novel PAC-Bayes bound. Both training objectives are evaluated on MNIST and on various UCI data sets. Our experiments show two striking observations: we obtain competitive test set error estimates (~1.4% on MNIST) and at the same time we compute non-vacuous bounds with much tighter values (~2.3% on MNIST) than previous results. These observations suggest that neural nets trained by PBB may lead to self-bounding learning, where the available data can be used to simultaneously learn a predictor and certify its risk, with no need to follow a data-splitting protocol.

研究动机与目标

  • 开发新的PAC-Bayes训练目标,用于概率性神经网络,以实现强大的泛化性能与紧致的风险证书。
  • 弥合测试集误差估计与非平凡PAC-Bayes风险上界之间的差距,从而提供更具信息量的性能保证。
  • 证明简单、无数据依赖的先验与标准SGD可实现优于以往使用复杂先验或优化方案的方法的更紧致界。
  • 探究PAC-Bayes与反向传播是否能实现“自 bounding 学习”,即风险界能紧密跟踪实际测试性能而无需数据划分。
  • 在多种数据集上评估该方法,包括MNIST、UCI基准以及CIFAR-10的初步实验,以评估其泛化能力。

提出的方法

  • 通过求解二次不等式,推导出新的PAC-Bayes-quadratic界,为泛化风险提供更紧致的上界。
  • 将Thiemann等人(2017)提出的PAC-Bayes-lambda界改编为神经网络训练的基线训练目标。
  • 使用固定、无数据依赖的先验,通过标准随机梯度下降(SGD)优化概率性神经网络中的权重分布。
  • 应用反向传播计算PAC-Bayes目标函数相对于网络权重的梯度,实现端到端训练。
  • 采用变分近似方法对权重后验分布进行近似,将PAC-Bayes界最小化作为正则化训练目标。
  • 避免使用启发式正则化或数据依赖先验,转而依赖理论基础坚实的界与标准优化方法。

实验结果

研究问题

  • RQ1PAC-Bayes与反向传播能否实现与Blundell等人(2015)等先进方法相当的测试集误差?
  • RQ2PBB生成的PAC-Bayes风险上界能否显著优于以往工作(如Dziugaite与Roy,2017, 2018)?
  • RQ3使用简单、无数据依赖的先验与标准SGD能否产生紧密跟踪实际测试性能的非平凡界?
  • RQ4PBB方法能否实现自 bounding 学习,使得风险证书既具信息量又接近真实测试误差?
  • RQ5PBB目标在不同数据集上的泛化能力如何,包括MNIST、UCI基准以及更复杂的CIFAR-10?

主要发现

  • 在MNIST上,PBB方法实现了1.4%(0.014)的测试误差,与Blundell等人(2015)等先前最先进方法相当或更优。
  • 所达到的最小PAC-Bayes风险上界为2.3%(0.023),相比以往结果(如Dziugaite与Roy,2018年结果为0.21)有显著改进,表明泛化保证更紧致。
  • 风险证书与测试误差估计之间的差距显著缩小,表明界具有信息量且非平凡。
  • 在五个UCI数据集上的实验表明,PBB方法保持了紧致的界与竞争力的测试性能,支持其在MNIST之外的泛化能力。
  • 在CIFAR-10上的初步实验显示,风险界约为测试误差的三倍,表明在更大、更复杂的数据集上实现更紧致界仍具挑战性。
  • 在PAC-Bayes目标中,KL散度项被识别为主要瓶颈,尤其在深层网络中,提示需要对网络结构或先验设计进行改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。