Skip to main content
QUICK REVIEW

[论文解读] A New Family of Generalization Bounds Using Samplewise Evaluated CMI

Fredrik Hellström, Giuseppe Durisi|arXiv (Cornell University)|Oct 12, 2022
Distributed Sensor Networks and Detection Algorithms被引用 5
一句话总结

本文提出了一类基于样本层面评估的条件互信息(e-CMI)的新信息论泛化界,该方法衡量损失之间的依赖性,而非假设之间的依赖性。通过利用训练损失与总体损失的联合凸函数,该框架得出了更紧致、更稳定的泛化界——尤其是基于二值KL散度的边界——在MNIST和CIFAR10数据集上对深度神经网络泛化能力的表征优于先前方法。

ABSTRACT

We present a new family of information-theoretic generalization bounds, in which the training loss and the population loss are compared through a jointly convex function. This function is upper-bounded in terms of the disintegrated, samplewise, evaluated conditional mutual information (CMI), an information measure that depends on the losses incurred by the selected hypothesis, rather than on the hypothesis itself, as is common in probably approximately correct (PAC)-Bayesian results. We demonstrate the generality of this framework by recovering and extending previously known information-theoretic bounds. Furthermore, using the evaluated CMI, we derive a samplewise, average version of Seeger's PAC-Bayesian bound, where the convex function is the binary KL divergence. In some scenarios, this novel bound results in a tighter characterization of the population loss of deep neural networks than previous bounds. Finally, we derive high-probability versions of some of these average bounds. We demonstrate the unifying nature of the evaluated CMI bounds by using them to recover average and high-probability generalization bounds for multiclass classification with finite Natarajan dimension.

研究动机与目标

  • 开发一个统一的框架,利用基于样本层面评估的条件互信息(e-CMI)来推导泛化界,其依赖于损失而非假设。
  • 通过用基于损失的e-CMI替代基于假设的信息度量,推导出更紧致、更稳定的泛化界。
  • 利用凸函数将现有PAC-Bayesian边界扩展至e-CMI设置,包括二值KL散度。
  • 为平均e-CMI边界提供高概率版本,以提升统计可靠性。
  • 通过恢复有限Natarajan维数下多分类问题的已知边界,展示e-CMI框架的表达能力。

提出的方法

  • 提出一个涉及训练损失与总体损失联合凸函数的一般不等式,其上界为分解后的、样本层面的e-CMI。
  • 推导出三个主要边界:平方根边界(定理1)、线性边界(定理3)和二值KL边界(定理4),均以e-CMI表示。
  • 引入一种针对独立但非同分布随机变量的新浓度不等式,以推导二值KL边界。
  • 通过定理7将框架适配为生成高概率边界,将平均边界扩展至几乎必然控制。
  • 在实际中采用插值估计器,利用多个训练数据和假设样本计算e-CMI以估算边界。
  • 在SGD和SGLD下对二值化MNIST和CIFAR10进行边界验证,对学习率、宽度和深度进行超参数搜索。

实验结果

研究问题

  • RQ1能否开发一个统一框架,将基于样本层面e-CMI的信息论泛化界统一起来?
  • RQ2用基于损失的e-CMI替代基于假设的互信息,是否能为深度神经网络带来更紧致、更稳定的泛化界?
  • RQ3在PAC-Bayesian理论中已知的紧致边界——二值KL散度——能否成功扩展至e-CMI设置并实现性能提升?
  • RQ4与现有最先进边界(如SGLD和平方根边界)相比,所提出的边界在紧致性和与测试误差的相关性方面表现如何?
  • RQ5e-CMI框架能否恢复有限Natarajan维数下多分类问题的已知高概率边界和平均边界?

主要发现

  • 基于二值KL的e-CMI边界在二值化MNIST和CIFAR10数据集上,对总体损失的表征均优于平方根边界和线性边界。
  • e-CMI边界在训练过程中保持稳定,而基于假设的边界通常随训练进程上升。
  • 在小样本量(n=75)下,边界与测试误差高度相关,并能正确识别出导致最低和最高测试误差的超参数设置。
  • 在大样本量(n=4000)下,边界的波动减小,但整体趋势仍与测试误差行为保持一致。
  • 该框架成功恢复了有限Natarajan维数下多分类问题的平均边界和高概率边界,展示了其统一能力。
  • 数值实验表明,在二值化MNIST的早期训练阶段,二值KL边界优于SGLD边界,尤其在测试误差较高时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。