[论文解读] Information-theoretic generalization bounds for black-box learning algorithms
本文提出了针对黑箱学习算法的信息论泛化界,通过测量模型预测中的信息而非模型权重,克服了以往基于权重的泛化界局限。所提出的泛化界对确定性算法有意义,估计更简便,并且在深度学习实验中能紧密跟踪实际泛化差距,包括在仅4,000个样本上训练300万个参数、泛化误差为1%的模型。
We derive information-theoretic generalization bounds for supervised learning algorithms based on the information contained in predictions rather than in the output of the training algorithm. These bounds improve over the existing information-theoretic bounds, are applicable to a wider range of algorithms, and solve two key challenges: (a) they give meaningful results for deterministic algorithms and (b) they are significantly easier to estimate. We show experimentally that the proposed bounds closely follow the generalization gap in practical scenarios for deep learning.
研究动机与目标
- 解决现有基于权重的信息论泛化界在确定性算法下变得无穷大或无意义的局限性。
- 开发一种通过测量预测中信息而非模型权重来估计更简便的泛化界。
- 提供一个统一的框架,适用于广泛算法,包括神经网络、贝叶斯方法、集成模型和非参数方法。
- 证明基于预测的界在实际深度学习场景中能紧密跟踪实际泛化差距。
提出的方法
- 使用预测与训练数据之间的函数条件互信息(f-CMI)推导新的泛化界,而非模型权重与训练数据之间的互信息。
- 提出一种计算高效的界,通过估计预测与表示数据是否包含在训练集中的二值指示变量之间的互信息来实现。
- 通过在多个训练数据子集和随机化操作上进行蒙特卡洛采样来估计f-CMI,从而降低估计的偏差和方差。
- 将该界应用于多种场景:集成方法、有限VC维假设类以及稳定学习算法,包括随机和确定性训练。
- 通过互信息的插补估计器估计界,其偏差为$O(1/k_2)$,方差为$O((\log k_2)^2 / k_2)$,其中$k_2$为每个数据点的样本数。
- 使用$k_1$个测试输入样本,估计输入分布上预期的泛化差距和f-CMI。
实验结果
研究问题
- RQ1能否推导出对确定性学习算法依然有意义且非平凡的信息论泛化界?
- RQ2基于预测的信息度量能否产生比基于权重的信息度量更紧致且更实用的泛化界?
- RQ3所提出的界在真实世界深度学习设置中能否紧密跟踪实际泛化差距?
- RQ4所提出的界在实践中是否能高效估计,特别是对于高维模型?
主要发现
- 所提出的基于预测的界即使在确定性学习算法下也保持有意义且非平凡,而基于权重的界则会变为无穷大或无信息。
- 与基于权重的界相比,这些界估计起来要简单得多,因为只需估计预测与数据包含指示变量之间的互信息,而非高维权重-数据集互信息。
- 在MNIST数据集上对一个4层CNN(4 vs 9)的实验中,f-CMI界紧密跟随实际泛化差距,即使在仅用4,000个样本、300万个参数和1%测试误差的情况下也成立。
- 对于在CIFAR-10上微调的ResNet-50,所提出的界保持紧致且具有信息量,证明其适用于大规模模型。
- 通过使用$k_1 = 1$到$5$个测试输入样本和每个输入$k_2 = 30$到$40$个样本进行估计,该估计过程实现了低偏差和可管理的方差,支持实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。