[论文解读] Characterizing Structural Regularities of Labeled Data in Overparameterized Models
本文提出了 C-score,一种一致性评分,用于量化深度学习模型在不同训练集大小下对单个数据实例的泛化可靠性。通过在 MNIST、CIFAR-10、CIFAR-100 和 ImageNet 上进行经验估计,作者表明该评分能有效将样本从高度规则(密集模式)排序至不规则或分布外(稀疏模式),从而实现对误标注数据和过参数化模型中结构异常的检测。
Humans are accustomed to environments that contain both regularities and exceptions. For example, at most gas stations, one pays prior to pumping, but the occasional rural station does not accept payment in advance. Likewise, deep neural networks can generalize across instances that share common patterns or structures, yet have the capacity to memorize rare or irregular forms. We analyze how individual instances are treated by a model via a consistency score. The score characterizes the expected accuracy for a held-out instance given training sets of varying size sampled from the data distribution. We obtain empirical estimates of this score for individual instances in multiple data sets, and we show that the score identifies out-of-distribution and mislabeled examples at one end of the continuum and strongly regular examples at the other end. We identify computationally inexpensive proxies to the consistency score using statistics collected during training. We show examples of potential applications to the analysis of deep-learning systems.
研究动机与目标
- 形式化一种针对单个实例的泛化度量,以捕捉数据分布中的结构规律。
- 开发一种计算上可行的方法,用于估计多样化深度学习数据集上的一致性评分。
- 识别并分析过参数化模型中规则、可泛化样本与罕见或不规则实例之间的连续谱。
- 实现实际应用,如利用 C-score 进行异常值检测和学习动态分析。
- 提供预计算的 C-score 和代码,以支持可复现性,并推动深度学习中数据规则性研究的未来发展。
提出的方法
- C-score 定义为模型在保留实例上的预测准确率的期望值,对从底层数据分布中采样的、大小递增的训练集进行平均。
- 通过在多次采样的子训练集上重复训练模型,并测量固定测试实例的预测置信度,计算一致性轮廓 C_{P,n}(x,y)。
- 通过在所有训练集大小 n 上对一致性轮廓取期望,推导出标量 C-score。
- 作者提出了计算高效的 C-score 代理方法,包括基于成对距离和基于学习速度的估计器。
- 在 MNIST、CIFAR-10、CIFAR-100 和 ImageNet 上使用标准卷积网络进行经验估计,通过不同架构之间的斯皮尔曼等级相关性验证结果。
- 以 NumPy 格式发布预计算的 C-score 和模型检查点,供公众使用和可复现性。
实验结果
研究问题
- RQ1我们如何量化过参数化深度学习模型中单个数据实例的结构规则性?
- RQ2C-score 在多大程度上能区分分布内、规则的样本与分布外或误标注的样本?
- RQ3计算高效的代理方法是否能在无需重复训练的情况下准确逼近真实的 C-score?
- RQ4C-score 在不同神经网络架构和数据集之间如何变化?
- RQ5C-score 能够在分析模型行为和数据质量方面实现哪些实际应用?
主要发现
- C-score 成功地将样本沿从高度规则(密集模式)到不规则或模糊(稀疏模式)的连续谱进行排序,ImageNet 中的样本显示出代表性样本与模糊样本之间清晰的视觉区分。
- 基于学习速度的 C-score 代理方法相较于基于距离的代理方法与真实 C-score 的相关性更高,表明其更具鲁棒性和可靠性。
- 在 CIFAR-10 上,不同架构(如 ResNet-18、VGG-11、VGG-16、Inception)计算的 C-score 之间的斯皮尔曼等级相关性超过 0.91,表明其在不同模型间具有强一致性。
- C-score 能够有效识别误标注和分布外样本,低分样本通常对应于罕见或模糊的视觉模式。
- C-score 使学习动态的详细分析成为可能,例如比较不同优化器的泛化行为。
- 作者发布了 CIFAR-10、CIFAR-100 和 ImageNet 的预计算 C-score 及代码,为未来关于数据规则性和模型泛化性的研究提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。