Skip to main content
QUICK REVIEW

[论文解读] PAC-Bayes Information Bottleneck

Zifeng Wang, Shao-Lun Huang|arXiv (Cornell University)|Sep 29, 2021
Machine Learning and Algorithms参考文献 45被引用 11
一句话总结

本文提出PAC-Bayes信息瓶颈(PIB),一种新颖的信息论框架,利用网络权重中存储的信息(IIW)来解释深度学习的泛化性能。通过使用PAC-Bayes界近似IIW,并借助SGLD实现贝叶斯推断,PIB在训练过程中识别出拟合到压缩的相变行为,持续优于标准正则化方法,并在包含噪声标签和不同小批量大小等多种设置下解释了泛化性能。

ABSTRACT

Understanding the source of the superior generalization ability of NNs remains one of the most important problems in ML research. There have been a series of theoretical works trying to derive non-vacuous bounds for NNs. Recently, the compression of information stored in weights (IIW) is proved to play a key role in NNs generalization based on the PAC-Bayes theorem. However, no solution of IIW has ever been provided, which builds a barrier for further investigation of the IIW's property and its potential in practical deep learning. In this paper, we propose an algorithm for the efficient approximation of IIW. Then, we build an IIW-based information bottleneck on the trade-off between accuracy and information complexity of NNs, namely PIB. From PIB, we can empirically identify the fitting to compressing phase transition during NNs' training and the concrete connection between the IIW compression and the generalization. Besides, we verify that IIW is able to explain NNs in broad cases, e.g., varying batch sizes, over-parameterization, and noisy labels. Moreover, we propose an MCMC-based algorithm to sample from the optimal weight posterior characterized by PIB, which fulfills the potential of IIW in enhancing NNs in practice.

研究动机与目标

  • 为解决缺乏一种实用且理论基础扎实的信息存储度量方法(即IIW)来解释神经网络权重中的泛化性能。
  • 开发一种基于PAC-Bayes的信息瓶颈(PIB)框架,提供非平凡的泛化界,并捕捉训练过程中的拟合-压缩相变行为。
  • 通过SGLD实现高效的贝叶斯推断,基于PIB框架在大规模深度网络中实现更优的泛化性能。
  • 通过实证验证,证明IIW作为模型复杂度的通用度量在多种训练条件下(包括噪声标签和不同小批量大小)均能有效反映泛化性能。

提出的方法

  • 提出一种新的信息瓶颈框架——PAC-Bayes信息瓶颈(PIB),基于网络权重与训练数据之间的互信息I(w;S),并利用PAC-Bayes泛化界。
  • 在PAC-Bayes框架内,采用变分推断方法,开发一种对难以计算的I(w;S)的高效近似方法。
  • 设计一种基于SGLD的贝叶斯推断算法,用于从PIB定义的最优后验分布中采样权重,实现实际部署。
  • 从PIB推导出一种能量函数,用于指导随机优化,实现与现有SGD训练流程的无缝集成。
  • 采用即插即用的模块化设计,可在不改变网络架构的前提下,为任意预训练神经网络添加PIB正则化。
  • 通过在CIFAR-10/100、SVHN和STL-10数据集上进行大量实验,验证框架在不同超参数、标签噪声和小批量大小下的有效性。

实验结果

研究问题

  • RQ1深度神经网络中是否存在一种普遍的两阶段训练行为(先拟合后压缩),且能否通过权重中存储的信息而非表示来捕捉这一行为?
  • RQ2存储在权重中的信息(IIW)能否作为理论基础扎实、非平凡的模型复杂度度量,以解释在多种网络架构和数据条件下的泛化性能?
  • RQ3在标签噪声、过参数化和不同小批量大小条件下,IIW与泛化差距之间有何关系?
  • RQ4PIB框架能否用于设计实用的贝叶斯推断方法,以在大规模深度网络中提升泛化性能?

主要发现

  • PIB框架成功识别出训练过程中清晰的从拟合到压缩的相变行为,该现象在ReLU、Sigmoid、Tanh和线性激活函数下均能观测到。
  • 使用PIB训练的模型在CIFAR-10上达到80.19%的测试准确率,优于原始SGD(77.03%)、L2正则化SGD(77.13%)和Dropout正则化SGD(78.95%),置信区间为(0.42)。
  • IIW在小批量大小为16时最小化,此时泛化差距最低且测试准确率最高,表明存在最优小批量大小。
  • 即使在随机标签上进行训练,IIW也能有效捕捉泛化差距:此时测试准确率保持在约10%,但IIW显著增加,表明对数据分布不匹配具有敏感性。
  • 与L2范数相比,IIW更能反映真实的模型复杂度,尤其在更深的网络中,L2范数增加而IIW保持稳定或下降,显示出更强的泛化相关性。
  • 基于SGLD的推断算法成功从PIB优化后的后验分布中采样,实现了具有改进泛化性能的实际贝叶斯深度学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。