[论文解读] Confidence from Invariance to Image Transformations
本文提出一种黑箱方法,通过测量视觉分类器对自然图像变换的不变性,检测分类错误和新样本。该方法在相同输入的不同变换版本的分类器输出上训练多层感知机,实现了在 STL-10、CIFAR-100 和 ImageNet 数据集上错误检测与新样本检测的最先进性能,包括在 ImageNet 上首次实现错误检测的最先进结果。
We develop a technique for automatically detecting the classification errors of a pre-trained visual classifier. Our method is agnostic to the form of the classifier, requiring access only to classifier responses to a set of inputs. We train a parametric binary classifier (error/correct) on a representation derived from a set of classifier responses generated from multiple copies of the same input, each subject to a different natural image transformation. Thus, we establish a measure of confidence in classifier's decision by analyzing the invariance of its decision under various transformations. In experiments with multiple data sets (STL-10,CIFAR-100,ImageNet) and classifiers, we demonstrate new state of the art for the error detection task. In addition, we apply our technique to novelty detection scenarios, where we also demonstrate state of the art results.
研究动机与目标
- 开发一种通用的错误检测方法,适用于任何预训练的视觉分类器,无需微调或架构修改。
- 通过分析输出在自然图像变换下的稳定性,改进置信度估计,超越最大 Softmax 分数。
- 将该方法扩展至新样本检测,包括分布外和类别外场景,这些场景下标准分类器会失效。
- 在大规模基准(如 ImageNet)上建立错误检测的新最先进水平,这些基准在先前工作中尚未被充分探索。
提出的方法
- 该方法收集同一输入图像在多种变换版本下的分类器响应(例如 Softmax 输出),使用一组多样的自然图像变换。
- 构建分类器在不同变换下输出变化性的表征,捕捉能区分正确与错误预测的不变性模式。
- 训练一个多层感知机(MLP)作为二分类检测器,基于变换后的响应模式预测误分类概率。
- 该方法完全为黑箱:仅需访问分类器在变换输入上的输出,无需其内部结构或梯度信息。
- 对于新样本检测,该方法通过利用相同的不变性信号,被调整以检测来自未知领域或类别的输入。
- 通过在不熟悉领域的数据上进行交叉训练(例如,使用 CIFAR-100 提升 SVHN 检测性能),进一步提升检测器对领域偏移的鲁棒性。
实验结果
研究问题
- RQ1在无法访问模型内部结构的情况下,能否利用分类器输出在自然图像变换下的不变性来检测误分类?
- RQ2通过测量变换下的稳定性,是否能超越仅依赖最大 Softmax 分数的方式,提升错误检测性能?
- RQ3这种基于不变性的方法能否泛化至新样本检测,包括分布外和类别外场景?
- RQ4该方法在大规模基准(如 ImageNet)上是否有效,而此前的最先进方法在这些数据集上表现不佳?
主要发现
- 在 STL-10 错误检测基准上,该方法实现了 0.902 的 AUROC,超越了包括 DBC 和 MC-dropout 在内的先前方法。
- 在使用 ResNet-50 分类器的 ImageNet 上,该方法实现了 0.879 的 AUROC,这是该数据集上错误检测首次报告的最先进结果。
- 在分布外新样本检测(例如,将 SVHN 图像输入到 STL-10 分类器中)中,该方法在跨领域训练后达到 0.860 的 AUROC,显著优于 MSR 及其他基线方法。
- 在检测同一数据集中新类别的场景(例如,将两个类别视为新类别)中,该方法平均 AUROC 达到 0.762,远超 MSR 的 0.715。
- 跨训练变体('Ours, Cross-train')在所有设置中均持续提升性能,证明了领域感知数据增强对检测器泛化能力的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。