Skip to main content
QUICK REVIEW

[论文解读] Distributional Generalization: A New Kind of Generalization

Preetum Nakkiran, Yamini Bansal|arXiv (Cornell University)|Sep 17, 2020
Machine Learning and Data Classification参考文献 87被引用 13
一句话总结

本文提出了分布泛化(Distributional Generalization)这一新型泛化形式,即在标签噪声存在的情况下,分类器在测试数据上的输出分布仍能与在训练数据上的输出分布保持高度一致。核心发现是:插值模型(如神经网络、核机和决策树)能够将标签噪声的统计结构从训练集保持到测试集,而经典泛化理论无法捕捉这一现象。

ABSTRACT

We introduce a new notion of generalization -- Distributional Generalization -- which roughly states that outputs of a classifier at train and test time are close *as distributions*, as opposed to close in just their average error. For example, if we mislabel 30% of dogs as cats in the train set of CIFAR-10, then a ResNet trained to interpolation will in fact mislabel roughly 30% of dogs as cats on the *test set* as well, while leaving other classes unaffected. This behavior is not captured by classical generalization, which would only consider the average error and not the distribution of errors over the input domain. Our formal conjectures, which are much more general than this example, characterize the form of distributional generalization that can be expected in terms of problem parameters: model architecture, training procedure, number of samples, and data distribution. We give empirical evidence for these conjectures across a variety of domains in machine learning, including neural networks, kernel machines, and decision trees. Our results thus advance our empirical understanding of interpolating classifiers.

研究动机与目标

  • 为解决经典泛化理论的局限性,该理论仅关注平均测试误差,而忽略了分类器输出的分布特性。
  • 形式化一种新型泛化——分布泛化,以捕捉分类器输出在输入域上的分布特性。
  • 通过实证研究证明,插值模型(如深度神经网络、核机、决策树)能够将标签噪声模式从训练集泛化到测试集。
  • 提出猜想:这种行为源于模型对条件分布 p(y|x) 的模仿能力,即使其在平均误差上并非最优。
  • 通过展示插值模型继承了数据分布的结构性质,而非仅记忆标签,从而将插值模型与非插值模型区分开来。

提出的方法

  • 定义两个关键分布:'训练分布' D_tr,即在训练输入上 (x, f(x)) 的联合分布;以及 '测试分布' D_te,即在测试输入上的分布。
  • 将分布泛化定义为:对于所有有界测试 T ∈ T,D_tr 和 D_te 下 T 的期望值近似相等。
  • 提出插值不可区分性猜想(公式3),即对于插值模型,D_tr 与 D_te 在特定测试族 T 下在统计上是接近的。
  • 通过在多种模型(WideResNet、核机、决策树)和数据集(CIFAR-10、ImageNet、UCI)上进行实证评估,验证该猜想。
  • 设计受控标签噪声实验(如30%的猫被错误标记为'Object'),以检验误差分布是否从训练集泛化到测试集。
  • 应用集成方法,并比较独立随机初始化与独立训练集上的结果,以评估分布泛化行为的鲁棒性与一致性。

实验结果

研究问题

  • RQ1在训练至插值的分类器中,能否将通过标签噪声引入的误差分布从训练集泛化到测试集?
  • RQ2即使平均测试误差较低,分类器在测试数据上的输出分布在多大程度上与在训练数据上的输出分布相似?
  • RQ3为何插值模型在平均误差未被最小化的情况下,仍能在分布意义上实现泛化?
  • RQ4分布泛化与经典泛化有何不同?在何种场景下,分布泛化能更准确地刻画模型行为?
  • RQ5插值模型中,条件分布 p(y|x) 与分类器输出分布之间达成一致的内在机制是什么?

主要发现

  • 在CIFAR-10的二分类实验中,对30%的猫样本施加标签噪声,训练至零训练误差的WideResNet在测试集中约有30%的猫被错误分类为'Object',表明误差分布实现了局部泛化。
  • 训练集上 (x, f(x)) 的联合分布与测试集上的分布几乎无法区分,表明其分布相似性远超平均误差的范畴。
  • 该现象在多种模型中均成立:神经网络、核机和决策树,表明这是插值分类器的普遍特性。
  • 尽管未最小化期望误差,模型的输出分布仍与真实条件分布 p(y|x) 高度一致。
  • 插值模型保留了数据分布的精细统计结构(如标签噪声模式),而这些特性非插值模型无法保留。
  • 对独立随机初始化进行集成,其分布行为与对独立训练集进行集成的结果相似,表明分布泛化具有鲁棒性与一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。