[论文解读] No True State-of-the-Art? OOD Detection Methods are Inconsistent across Datasets
本文表明,即使在标准化训练和评估条件下,也没有任何一种分布外(OOD)检测方法能在所有不同的(分布内,分布外)数据集对上持续优于其他方法。本文提出成对OOD检测(POD),一种基于孪生网络的方法,通过避免昂贵的协方差估计,在低数据场景下优于马氏距离(Mahalanobis)和最大 softmax 概率(MSP)方法,强调了构建更系统化OOD检测基准的必要性。
Out-of-distribution detection is an important component of reliable ML systems. Prior literature has proposed various methods (e.g., MSP (Hendrycks & Gimpel, 2017), ODIN (Liang et al., 2018), Mahalanobis (Lee et al., 2018)), claiming they are state-of-the-art by showing they outperform previous methods on a selected set of in-distribution (ID) and out-of-distribution (OOD) datasets. In this work, we show that none of these methods are inherently better at OOD detection than others on a standardized set of 16 (ID, OOD) pairs. We give possible explanations for these inconsistencies with simple toy datasets where whether one method outperforms another depends on the structure of the ID and OOD datasets in question. Finally, we show that a method outperforming another on a certain (ID, OOD) pair may not do so in a low-data regime. In the low-data regime, we propose a distance-based method, Pairwise OOD detection (POD), which is based on Siamese networks and improves over Mahalanobis by sidestepping the expensive covariance estimation step. Our results suggest that the OOD detection problem may be too broad, and we should consider more specific structures for leverage.
研究动机与目标
- 评估最先进OOD检测方法在16对标准化(ID, OOD)数据集对上的表现一致性。
- 探究为何在方法标准化的情况下,OOD检测性能在不同数据集组合间仍存在显著差异。
- 探究分布内训练数据量对方法性能的影响,特别是在低数据场景下的表现。
- 提出一种新方法——成对OOD检测(POD),通过避免昂贵的协方差估计,在低数据设置下提升性能。
- 主张OOD检测问题过于宽泛,未来工作应考虑更具体、结构化的设置,以实现可靠评估与开发。
提出的方法
- 在16对(ID, OOD)数据集对上,使用完整和10%大小的分布内训练集,对三种成熟OOD检测方法(MSP、ODIN、Mahalanobis)进行标准化训练与评估。
- 设计两个简单的二维小样本数据集,以证明基于预测得分的方法(如MSP)与基于距离的方法(如Mahalanobis)的相对性能,从根本上取决于分布内与分布外分布的结构。
- 提出成对OOD检测(POD),一种基于孪生网络的方法,通过直接比较输入样本而不估计高维协方差矩阵,实现性能提升。
- POD利用孪生结构学习一个成对相似性函数,以区分分布内与分布外样本,从而实现在低数据场景下高效推理与更强鲁棒性。
- 在两种设置下评估方法:训练/超参数调优时不使用OOD数据,以及使用OOD数据进行调优,以评估对数据可用性的敏感性。
- 主要采用AUROC与FNR@95作为评估指标,结果通过三次随机种子取平均以确保稳定性。
实验结果
研究问题
- RQ1是否存在一种OOD检测方法,能在所有标准化条件下的多样化(ID, OOD)数据集对上持续优于其他所有方法?
- RQ2MSP、ODIN与Mahalanobis的相对性能如何随分布内与分布外数据集的具体结构而变化?
- RQ3当分布内训练集规模缩减至10%时,OOD检测方法的性能排名是否仍保持一致?
- RQ4能否设计一种新方法,在避免计算成本高昂的协方差估计步骤的前提下,提升低数据场景下的性能?
- RQ5分布内分类准确率与OOD检测性能之间的相关性有多大?
主要发现
- 在全部16对(ID, OOD)数据集对中,没有一种OOD检测方法能始终优于其他所有方法:对每种方法而言,至少有3种、最多有13种其他方法在不同数据对上表现更优。
- 在全数据设置下,Mahalanobis在16对中的12对上优于ODIN;但在低数据设置(10%训练数据)下,这一比例下降至仅3对,表明在数据稀缺时性能出现反转。
- 在低数据设置下,POD在16对中的13对上优于MSP,在10对上优于Mahalanobis,证明其在数据稀缺场景下的有效性。
- 基于预测得分(如MSP)与基于距离(如Mahalanobis)的方法的相对性能,从根本上取决于数据分布结构,这一点通过二维小样本示例得到验证:在某些情况下,一种方法可达到完美性能,而另一种则完全失败。
- 分布内分类准确率与OOD检测AUROC之间无显著相关性:增加训练轮数可提升ID准确率,但超过200轮后OOD AUROC反而下降,且OOD性能方差增大。
- 即使在可访问OOD数据用于超参数调优的情况下,方法排名在低数据设置下仍发生反转——例如,ODIN在低数据设置下的16对中有10对优于Mahalanobis,而在全数据设置下仅在5对中占优——凸显了方法选择的不稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。