Skip to main content
QUICK REVIEW

[论文解读] Active Testing: Sample-Efficient Model Evaluation

Jannik Kossen, Sebastian Farquhar|arXiv (Cornell University)|Mar 9, 2021
Machine Learning and Algorithms参考文献 53被引用 14
一句话总结

本文提出主动测试(active testing),一种样本高效的模型评估框架,通过主动选择最具信息量的测试点进行标注,显著减少准确性能估计所需的标签数量。通过推导任务特定的获取函数,并利用 LURE 估计器纠正选择偏差,该方法在小标签预算下,相比随机采样,能更精确地估计测试损失与准确率。

ABSTRACT

We introduce a new framework for sample-efficient model evaluation that we call active testing. While approaches like active learning reduce the number of labels needed for model training, existing literature largely ignores the cost of labeling test data, typically unrealistically assuming large test sets for model evaluation. This creates a disconnect to real applications, where test labels are important and just as expensive, e.g. for optimizing hyperparameters. Active testing addresses this by carefully selecting the test points to label, ensuring model evaluation is sample-efficient. To this end, we derive theoretically-grounded and intuitive acquisition strategies that are specifically tailored to the goals of active testing, noting these are distinct to those of active learning. As actively selecting labels introduces a bias; we further show how to remove this bias while reducing the variance of the estimator at the same time. Active testing is easy to implement and can be applied to any supervised machine learning method. We demonstrate its effectiveness on models including WideResNets and Gaussian processes on datasets including Fashion-MNIST and CIFAR-100.

研究动机与目标

  • 为解决真实世界机器学习应用中测试数据标注成本高昂的问题,其中测试标签的获取成本往往与训练标签相当。
  • 弥合主动学习(用于训练数据)与模型评估(用于测试数据)之间在样本效率上的差距,该问题长期被忽视。
  • 开发一种通用、基于原理的主动测试框架,适用于任何监督学习模型,包括深度神经网络与贝叶斯模型。
  • 纠正因主动选择测试点而引入的偏差,否则该偏差会高估模型误差,尤其在过度自信的模型中更为明显。
  • 证明主动测试能显著减少准确性能估计所需的测试标签数量,其精度可匹配甚至超越使用更大测试集的随机采样方法。

提出的方法

  • 提出主动测试作为框架,用于选择最具信息量的测试点进行标注,以最小化估计模型性能所需的标签数量。
  • 基于预测熵与期望损失,推导适用于分类与回归任务的特定获取函数,其设计目标为评估而非学习。
  • 引入代理模型以提升选择准确性,捕捉原始模型中的不确定性与错误,其中集成方法可增强多样性与保真度。
  • 应用 LURE(损失无偏风险估计器)加权方案以纠正选择偏差,确保性能估计无偏且方差更低。
  • 使用蒙特卡洛采样估算测试损失与其他评估指标,获取策略优先选择最能降低估计器方差的测试点。
  • 采用两阶段方法:首先,利用原始模型或代理模型对候选测试点进行打分;其次,逐步标注并更新代理模型,以优化后续选择。

实验结果

研究问题

  • RQ1主动选择测试数据是否能减少所需标签数量,同时避免引入偏差?
  • RQ2鉴于评估与训练目标不同,主动测试的获取函数与主动学习中的函数有何区别?
  • RQ3与仅依赖原始模型相比,使用代理模型在多大程度上提升了主动测试的准确率与效率?
  • RQ4能否有效校正主动测试中的偏差?该校正是否带来更可靠的性能估计?
  • RQ5在实际应用中,代理模型的保真度与多样性在多大程度上影响主动测试的性能?

主要发现

  • 在 Fashion-MNIST 与 CIFAR-100 数据集上,主动测试相比随机采样,将所需测试标签数量减少高达 50%,同时保持相同的估计精度。
  • 基于预测熵的获取函数在主动测试中优于互信息,因为互信息更适合主动学习,且不直接针对期望损失进行优化。
  • LURE 估计器能有效消除选择偏差,防止对测试损失的高估,尤其在过度自信的模型中表现显著,同时降低估计器方差。
  • 代理模型,特别是深度集成代理模型,显著提升了主动测试性能,其保真度与多样性共同促进了更高的样本效率。
  • 随着新标签的获取,重新训练代理模型可进一步提升性能,但即使不重新训练,其表现也优于仅依赖原始模型不确定性的一般策略。
  • 该框架具有通用性,在多种模型上表现良好,包括 WideResNets、贝叶斯神经网络、高斯过程与随机森林,在分类与回归任务中均有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。