Skip to main content
QUICK REVIEW

[论文解读] Sequential algorithmic modification with test data reuse

Jean Feng, Gene Pennello|arXiv (Cornell University)|Mar 21, 2022
Machine Learning and Data Classification被引用 5
一句话总结

本文提出了一种新颖的顺序拒绝图形程序(SRGP),用于在重用测试数据的情况下对顺序修改的机器学习算法进行检验,通过利用 alpha 回收和相关性感知的误差控制来提高统计功效。该方法在保持族错误率控制的同时,显著提高了有益修改的批准率,尤其适用于小样本医学场景。

ABSTRACT

After initial release of a machine learning algorithm, the model can be fine-tuned by retraining on subsequently gathered data, adding newly discovered features, or more. Each modification introduces a risk of deteriorating performance and must be validated on a test dataset. It may not always be practical to assemble a new dataset for testing each modification, especially when most modifications are minor or are implemented in rapid succession. Recent works have shown how one can repeatedly test modifications on the same dataset and protect against overfitting by (i) discretizing test results along a grid and (ii) applying a Bonferroni correction to adjust for the total number of modifications considered by an adaptive developer. However, the standard Bonferroni correction is overly conservative when most modifications are beneficial and/or highly correlated. This work investigates more powerful approaches using alpha-recycling and sequentially-rejective graphical procedures (SRGPs). We introduce novel extensions that account for correlation between adaptively chosen algorithmic modifications. In empirical analyses, the SRGPs control the error rate of approving unacceptable modifications and approve a substantially higher number of beneficial modifications than previous approaches.

研究动机与目标

  • 解决在重用单一测试数据集时验证顺序机器学习算法修改的挑战,因为这可能导致过拟合和 I 类错误率膨胀。
  • 在现有方法(如 Bonferroni 校正)过于保守于相关或有益修改的情况下,提高统计功效。
  • 开发有效的假设检验程序,以考虑自适应选择的算法修改之间的相关性,而无需观察反事实假设。
  • 在小样本领域(如医学人工智能)中实现实际的高功效测试,因为这些领域大型测试数据集稀缺。
  • 设计对自适应开发具有鲁棒性的程序,通过 alpha 回收和图形模型结构保持严格的误差率控制。

提出的方法

  • 提出两种新颖的 SRGP——fsSRGP 和 presSRGP,通过在共享测试数据集上顺序测试自适应选择的算法修改,实现 alpha 回收。
  • 使用二元测试结果(通过/拒绝)以限制信息泄露并降低过拟合风险,形成类似树状的假设结构。
  • 在 fsSRGP 中应用固定序列检验程序,以考虑树结构中观察到的假设之间的相关性,从而在功效上优于 Bonferroni。
  • 通过要求开发人员预先指定学习过程来引入 presSRGP;利用自适应修改与预设修改之间的相似性,以增强基于相关性的误差控制。
  • 设计一致的、封闭式检验程序,其显著性阈值可在不观察树中未测试(反事实)假设的情况下计算得出。
  • 利用假设的图形模型表示,以高效方式在一系列修改中分配和回收 alpha 水平。

实验结果

研究问题

  • RQ1我们能否设计一种有效的统计框架,在重用单一测试数据集的同时控制族错误率,对多个自适应算法修改进行检验?
  • RQ2当修改之间存在相关性或大多数为有益时,我们如何在标准 Bonferroni 校正的基础上提高统计功效?
  • RQ3在并非所有假设都被观察到的顺序检验框架中,我们能否有效回收 alpha 水平?
  • RQ4在多大程度上可以利用算法修改之间的相关性来提高有益变化的检测能力?
  • RQ5我们能否在不假设模型开发者为对抗性的情况下,维持严格的误差控制?

主要发现

  • 所提出的 SRGP 方法,特别是 presSRGP,在批准有益算法修改方面显著优于现有方法(如 Bonferroni 校正)。
  • fsSRGP 通过考虑树结构中观察到的修改之间的相关性,在功效上优于标准 Bonferroni 校正。
  • presSRGP 程序通过利用自适应修改与预设修改之间的相似性,进一步提高了功效,在实证评估中优于 fsSRGP 和 Bonferroni。
  • 两种 SRGP 方法在自适应开发下均保持了强大的族错误率控制,防止对不可接受修改的错误批准。
  • 这些方法在小样本场景下表现有效,使其适用于现实世界中的医学人工智能应用,因为这些场景中数据收集成本高昂。
  • 该框架通过仅报告二元结果(通过/拒绝)实现了最小的信息泄露,从而降低了过拟合风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。