[论文解读] Distribution Density, Tails, and Outliers in Machine Learning: Metrics and Applications
本文提出了五种不同的度量方法,用于量化数据集中每个样本在其底层分布中的代表性或异常程度,利用对抗鲁棒性、微调稳定性、集成模型一致性以及差分隐私学习。尽管方法各异,这些度量显示出高度相关性,并揭示了关键洞察——如记忆化的训练样本和稀有子模态——从而实现了更优的课程学习与对抗鲁棒性。
We develop techniques to quantify the degree to which a given (training or testing) example is an outlier in the underlying distribution. We evaluate five methods to score examples in a dataset by how well-represented the examples are, for different plausible definitions of "well-represented", and apply these to four common datasets: MNIST, Fashion-MNIST, CIFAR-10, and ImageNet. Despite being independent approaches, we find all five are highly correlated, suggesting that the notion of being well-represented can be quantified. Among other uses, we find these methods can be combined to identify (a) prototypical examples (that match human expectations); (b) memorized training examples; and, (c) uncommon submodes of the dataset. Further, we show how we can utilize our metrics to determine an improved ordering for curriculum learning, and impact adversarial robustness. We release all metric values on training and test sets we studied.
研究动机与目标
- 开发一套度量方法,用于量化样本在数据分布中的代表性程度,而无需预先定义‘代表性’。
- 理解不同代表性定义之间的相互作用,以及它们的不一致如何揭示有意义的数据特性。
- 通过数据过滤实现更优的模型训练——识别典型样本、记忆化样本或稀有子模态样本。
- 通过基于代表性度量对训练数据进行排序,提升课程学习效果。
- 通过分析超越准确率的数据分布特性,提升对抗鲁棒性与模型可解释性。
提出的方法
- 基于对抗鲁棒性、微调稳定性、集成模型一致性以及差分隐私学习,定义五种不同的度量方法。
- 利用这些多样化但互补的方法,将每个数据点在从代表性强到异常的连续范围内进行评分。
- 在四个基准数据集(MNIST、Fashion-MNIST、CIFAR-10 和 ImageNet)上应用这些度量。
- 利用度量之间的不一致,识别典型样本、记忆化的训练实例以及不常见的子模态。
- 证明在微调过程中模型的预测稳定性与对抗距离存在强相关性,从而在复杂任务中可实现近似。
- 发布训练集与测试集的所有度量分数,以支持可复现性与未来研究。
实验结果
研究问题
- RQ1不同定义的‘代表性良好’在多种度量之间如何相关?其不一致又揭示了哪些有意义的数据特性?
- RQ2这些度量能否在真实世界数据集中识别出记忆化的训练样本或稀有子模态?
- RQ3基于代表性进行数据过滤,如何影响模型训练速度、准确率与对抗鲁棒性?
- RQ4在非线性或复杂模型中,微调稳定性在多大程度上可作为对抗距离的代理指标?
- RQ5这些度量能否通过基于代表性对训练样本进行排序,从而改善课程学习?
主要发现
- 五种度量在大多数训练与测试样本上表现出高度相关性,表明存在一致的代表性内在概念。
- 度量之间的不一致揭示了有意义的数据异常:如记忆化的训练样本以及在训练数据中代表性不足的稀有子模态。
- 仅在代表性强的样本上进行训练的模型学习速度更快,决策边界更简单,且具有略微更高的对抗鲁棒性。
- 在通过度量不一致排除错误或误导性样本后,仅对异常值进行训练,可在相同样本复杂度下实现显著更高的整体准确率。
- 微调稳定性与对抗距离存在强相关性,表明其可作为对抗鲁棒性评估的实用近似方法。
- 为 MNIST、Fashion-MNIST、CIFAR-10 和 ImageNet 发布的度量分数,为未来在数据分布分析与模型可解释性方面的研究提供了宝贵资源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。