[论文解读] DOCTOR: A Simple Method for Detecting Misclassification Errors
Doctor 是一种简单、事后处理的方法,通过利用软标签概率来检测深度神经网络预测中的误分类错误。在无需模型微调或架构修改的情况下,该方法在部分黑箱设置下将误拒率降低了高达4%,优于当前最先进方法。
Deep neural networks (DNNs) have shown to perform very well on large scale object recognition problems and lead to widespread use for real-world applications, including situations where DNN are implemented as "black boxes". A promising approach to secure their use is to accept decisions that are likely to be correct while discarding the others. In this work, we propose DOCTOR, a simple method that aims to identify whether the prediction of a DNN classifier should (or should not) be trusted so that, consequently, it would be possible to accept it or to reject it. Two scenarios are investigated: Totally Black Box (TBB) where only the soft-predictions are available and Partially Black Box (PBB) where gradient-propagation to perform input pre-processing is allowed. Empirically, we show that DOCTOR outperforms all state-of-the-art methods on various well-known images and sentiment analysis datasets. In particular, we observe a reduction of up to $4\%$ of the false rejection rate (FRR) in the PBB scenario. DOCTOR can be applied to any pre-trained model, it does not require prior information about the underlying dataset and is as simple as the simplest available methods in the literature.
研究动机与目标
- 开发一种可靠的方法,用于判断 DNN 预测是否应被信任或拒绝,无论输入是分布内还是分布外。
- 解决 DNN 在错误预测中表现出的过度自信问题,尤其是在可解释性有限的真实世界‘黑箱’部署中。
- 提出一种可应用于预训练模型的方法,无需访问梯度、权重或额外训练数据。
- 通过最小化预测的误拒率和误接受率,提升 DNN 在安全关键应用中的可靠性。
- 提供一种简单但有效的解决方案,在完全黑箱和部分黑箱场景下均优于现有方法。
提出的方法
- Doctor 利用完整的软概率分布(而非仅最大值)来评估预测置信度,从而更有效地区分正确与错误预测。
- 提出两种检测场景:完全黑箱(TBB),仅可访问模型输出;部分黑箱(PBB),可通过基于梯度的预处理对输入进行扰动。
- 该方法基于类型 I(误拒)与类型 II(误接受)错误之间的理论权衡,提出基于 Softmax 概率的最优判别器。
- 在 PBB 设置下,Doctor 使用温度缩放和小 ε 扰动对输入进行扰动,类似于 ODIN,但采用基于整个概率向量的新型决策规则。
- 核心检测机制通过完整软标签分布计算置信度分数,使拒绝决策比仅依赖最大概率的方法更具细微区分能力。
- 该方法与模型无关,可应用于任何预训练分类器,无需微调或架构修改。
实验结果
研究问题
- RQ1一种简单、事后处理的方法是否能在不访问模型权重或梯度的情况下检测 DNN 中的误分类错误?
- RQ2与仅依赖最大概率的方法相比,利用完整的软标签分布在多大程度上能提升检测性能?
- RQ3与最先进方法相比,Doctor 在 TBB 和 PBB 设置下能将误拒率(FRR)降低多少?
- RQ4Doctor 是否能泛化到 OOD 检测任务,而无需为此目的进行显式优化?
- RQ5当 OOD 样本与分布内数据相似时(这是现有检测器的挑战性场景),Doctor 的表现如何?
主要发现
- 与最先进方法相比,Doctor 在部分黑箱(PBB)场景下将误拒率(FRR)降低了最多 4%。
- 在 TBB 设置下,Doctor 表现具有竞争力,其在 CIFAR-10 和 CIFAR-100 上的 AUROC 分数在各种架构下均稳定高于 95%。
- 在 LSUN(crop)数据集上,Doctor 在纯 OOD 检测中相比基线方法 ODIN 将 FRR 提高了 3.3%,展现出强大的泛化能力。
- 当 OOD 样本与分布内数据相似时(如 CIFAR100 与 CIFAR10),Doctor(PBB)的 AUROC 达到 76.8%,FRR 为 64.2%,优于 ODIN(AUROC 70.5%,FRR 79.5%)。
- 在白箱场景下,基于马氏距离的方法(MHLNB)表现较差(在 CIFAR10 上 AUROC 为 49.5%),凸显了 Doctor 方法在实际场景中的优势。
- Doctor 在无需任何模型微调或额外训练的情况下实现优异性能,仅依赖推理时的软预测和极少的输入扰动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。