Skip to main content
QUICK REVIEW

[论文解读] Model Similarity Mitigates Test Set Overuse

Horia Mania, J. J. Miller|arXiv (Cornell University)|May 29, 2019
Machine Learning and Data Classification参考文献 17被引用 4
一句话总结

本文提出,模型相似性——即模型在预测上高度相关——可缓解对测试集的过拟合,从而使得测试集的重用次数远超传统泛化界所允许的范围。通过引入一种考虑相似性的泛化界,作者表明,高模型相似性可使安全的测试集重用次数最多提升四个数量级,解释了为何ImageNet等基准测试在广泛重用后仍保持有效性。

ABSTRACT

Excessive reuse of test data has become commonplace in today's machine learning workflows. Popular benchmarks, competitions, industrial scale tuning, among other applications, all involve test data reuse beyond guidance by statistical confidence bounds. Nonetheless, recent replication studies give evidence that popular benchmarks continue to support progress despite years of extensive reuse. We proffer a new explanation for the apparent longevity of test data: Many proposed models are similar in their predictions and we prove that this similarity mitigates overfitting. Specifically, we show empirically that models proposed for the ImageNet ILSVRC benchmark agree in their predictions well beyond what we can conclude from their accuracy levels alone. Likewise, models created by large scale hyperparameter search enjoy high levels of similarity. Motivated by these empirical observations, we give a non-asymptotic generalization bound that takes similarity into account, leading to meaningful confidence bounds in practical settings.

研究动机与目标

  • 解释为何在理论预期会出现过拟合的情况下,ImageNet等测试集仍能保持有效性。
  • 调查在主流基准和超参数搜索中,模型相似性的经验程度。
  • 开发一种将模型相似性纳入考量的新泛化界,以提供更紧密、更实用的置信区间。
  • 量化模型相似性在自适应与非自适应设置下,对安全测试集重用次数的提升程度。
  • 探索模型之间的结构依赖关系是否能进一步降低过拟合风险。

提出的方法

  • 通过1,000多个ImageNet和CIFAR-10模型(包括随机超参数搜索和神经架构搜索的模型)进行经验测量,计算成对预测相似性。
  • 基于测试样本上预测的一致性定义相似性度量,且该度量与准确率无关。
  • 提出一种新的非渐近泛化界,通过模型族的覆盖数来考虑模型相似性。
  • 推导出一种改进的联合界,用依赖于相似性的项替代标准的√(log k / n)项,从而降低过拟合风险。
  • 将该界应用于估计在给定误差容忍度下,可安全评估的模型最大数量。
  • 将基于相似性的界与标准联合界及朴素贝叶斯近似进行比较,结果在实际场景中显示出显著改进。

实验结果

研究问题

  • RQ1在ImageNet和CIFAR-10上训练的模型,其预测相似性在多大程度上超出其准确率所暗示的程度?
  • RQ2在自适应测试集重用场景中,模型相似性如何影响泛化误差界?
  • RQ3与标准界相比,基于相似性的泛化界是否能显著提升安全测试集重用次数?
  • RQ4在大规模超参数搜索和神经架构搜索中,即使模型是自适应选择的,高模型相似性是否仍能持续存在?
  • RQ5在额外的结构假设下,对模型预测的影响如何进一步改进基于相似性的界?

主要发现

  • ImageNet和CIFAR-10模型的预测一致率显著高于其准确率所暗示的水平,在某些情况下,平均成对相似性达到97.5%。
  • 在CIFAR-10的随机超参数搜索中,模型检查点保持高度相似,其相似性水平远超随机巧合。
  • 神经架构搜索的模型在表现最佳的配置中,平均相似性达到97.6%,表明存在强烈的结构收敛。
  • 所提出的基于相似性的泛化界相比标准联合界,使安全测试集重用次数最多提升12倍。
  • 在额外建模假设下,该界相比基线可将安全重用次数提升最多达34,000倍。
  • 即使在高准确率区域,模型相似性仍允许进行远超以往的测试集评估而不会导致过拟合,从而解释了ImageNet等基准测试的持久有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。