Skip to main content
QUICK REVIEW

[论文解读] Detecting Overfitting via Adversarial Examples

Roman Werpachowski, András György|arXiv (Cornell University)|Mar 6, 2019
Adversarial Robustness in Machine Learning参考文献 33被引用 7
一句话总结

本文提出了一种非侵入式的统计检验方法,通过使用从原始测试数据生成的对抗性样本,检测模型对测试集的过拟合现象。通过比较标准测试错误率与重要性加权的对抗性错误估计值,若两者存在显著差异,则判定为过拟合;该方法在 ImageNet 上的应用未发现模型对测试集存在过拟合的证据,与近期其他研究结果一致。

ABSTRACT

The repeated community-wide reuse of test sets in popular benchmark problems raises doubts about the credibility of reported test-error rates. Verifying whether a learned model is overfitted to a test set is challenging as independent test sets drawn from the same data distribution are usually unavailable, while other test sets may introduce a distribution shift. We propose a new hypothesis test that uses only the original test data to detect overfitting. It utilizes a new unbiased error estimate that is based on adversarial examples generated from the test data and importance weighting. Overfitting is detected if this error estimate is sufficiently different from the original test error rate. We develop a specialized variant of our test for multiclass image classification, and apply it to testing overfitting of recent models to the popular ImageNet benchmark. Our method correctly indicates overfitting of the trained model to the training set, but is not able to detect any overfitting to the test set, in line with other recent work on this topic.

研究动机与目标

  • 为应对基准测试集上模型性能因反复重用而可能受到过拟合影响的日益增长的担忧。
  • 开发一种非侵入式统计检验方法,无需协议变更或外部数据,仅依赖原始测试集。
  • 基于对抗性样本构建一个无偏、低方差的错误估计器,以检测模型与测试集之间的依赖关系。
  • 在真实世界基准(尤其是 ImageNet)上评估该方法,以判断当前最先进模型是否对测试集存在过拟合。
  • 探索在视觉及其他领域中,使用可计算重要性权重的对抗性扰动进行泛化性测试的可行性。

提出的方法

  • 提出一种新的假设检验,将标准测试错误率与从扰动测试样本中推导出的重要性加权对抗性错误估计值进行比较。
  • 利用小幅度平移(如 (5,-5))生成对抗性样本,以保持数据密度并支持重要性权重的计算。
  • 应用重要性加权以校正对抗性扰动引入的协变量偏移,确保在模型与测试集独立的前提下,错误估计器保持无偏。
  • 采用成对独立性检验,通过标准错误率与对抗性错误估计值之间的差异,拒绝模型与测试集独立的原假设。
  • 将方法扩展至模型架构级别的测试,通过整合多个独立训练模型的结果(N-model 检验)。
  • 使用特定的 AEG(对抗性样本生成器),如“最强”、“最近”和随机基线,以评估测试的鲁棒性与检验效能。

实验结果

研究问题

  • RQ1是否存在一种统计检验方法,可在不依赖独立测试数据或协议强制的情况下,检测模型对测试集的过拟合?
  • RQ2所提出的对抗性错误估计器是否无偏,且对过拟合的敏感性是否高于标准错误估计?
  • RQ3该方法是否能检测到最先进 ImageNet 模型对测试集的过拟合,特别是在测试集被重复使用的情况下?
  • RQ4不同类型的对抗性攻击(如最强扰动与最小扰动)如何影响检验的效能与可靠性?
  • RQ5该方法是否可推广至图像分类以外的其他机器学习任务,如自然语言处理或语音识别?

主要发现

  • 当使用完整训练集和最强对抗性扰动时,该方法成功检测到模型与 ImageNet 训练集之间的过拟合,p 值为 0.000006(置信度 99.9994%)。
  • 该检验未能拒绝模型与 ImageNet 测试集之间独立的原假设,p 值为 0.96,表明未检测到对测试集的过拟合。
  • 对于 ResNet-50 模型,即使使用 120 个独立训练的模型,N-model 检验的 p 值仍为 1.0,进一步支持测试集无过拟合的结论。
  • ‘最强扰动’ AEG 在检测训练数据过拟合方面表现有效,而较弱或随机扰动则无效,凸显了扰动强度的重要性。
  • 当应用于训练集时,该方法的性能劣于简单的置信区间比较,表明所提出的检验设计具有更优的统计效能。
  • 结果与其他近期研究一致,表明对 ImageNet 测试集的过拟合程度极低,可能归因于高计算成本以及所开发模型架构数量有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。