[论文解读] MOS: Towards Scaling Out-of-distribution Detection for Large Semantic Space
本文提出 MOS(最小其他分数),一种基于群体的分布外(OOD)检测框架,通过将大规模语义空间分解为语义相似的组来简化决策边界。通过使用带有专用“其他”类别的群体softmax,并计算所有组中的最小置信度,MOS 在 ImageNet-1k 上相比先前方法实现了 SOTA 性能,平均 FPR95 降低 14.33%,推理速度提升 6 倍。
Detecting out-of-distribution (OOD) inputs is a central challenge for safely deploying machine learning models in the real world. Existing solutions are mainly driven by small datasets, with low resolution and very few class labels (e.g., CIFAR). As a result, OOD detection for large-scale image classification tasks remains largely unexplored. In this paper, we bridge this critical gap by proposing a group-based OOD detection framework, along with a novel OOD scoring function termed MOS. Our key idea is to decompose the large semantic space into smaller groups with similar concepts, which allows simplifying the decision boundaries between in- vs. out-of-distribution data for effective OOD detection. Our method scales substantially better for high-dimensional class space than previous approaches. We evaluate models trained on ImageNet against four carefully curated OOD datasets, spanning diverse semantics. MOS establishes state-of-the-art performance, reducing the average FPR95 by 14.33% while achieving 6x speedup in inference compared to the previous best method.
研究动机与目标
- 解决大规模图像分类中分布外检测的关键空白,现有方法在 CIFAR 等小型数据集之外大多未经测试。
- 开发一种可扩展的 OOD 检测框架,有效处理包含数千个语义类别的高维类别空间。
- 通过将语义相似的概念分组来简化决策边界,降低 OOD 检测中的不确定性。
- 在不依赖辅助异常数据的情况下,提升大规模设置下的检测性能和推理效率。
- 整理多样、高分辨率的 OOD 评估数据集,以支持未来大规模 OOD 检测研究的现实基准测试。
提出的方法
- 基于概念相似性,将大规模语义空间分解为更小、语义一致的组,以降低决策边界复杂度。
- 引入群体 softmax,为每组计算概率分布,包括一个专用的“其他”类别以表示每组的 OOD 可能性。
- 将最小其他分数(MOS)定义为所有组中“其他”类别下的最小置信度,作为最终的 OOD 分数。
- 利用 MOS 分数区分 OOD 输入(在所有组中对“其他”类别均具有高置信度)与分布内输入(其真实组对“其他”类别的置信度较低)。
- 仅微调预训练 BiT-S 模型的顶层全连接层,以在保持 OOD 检测性能的同时提升效率。
- 将该框架应用于在 ImageNet-1k 上训练的模型,并在四个经过精心筛选、高分辨率的 OOD 数据集上进行评估。

实验结果
研究问题
- RQ1与专为小型基准设计的现有方法相比,MOS 是否能在 1,000 个以上类别的大规模图像分类中显著提升 OOD 检测性能?
- RQ2将语义相似的类别分组是否能简化 OOD 决策边界,并降低高维语义空间中的不确定性?
- RQ3与 MSP、ODIN 和 KL 匹配等现有 OOD 检测方法相比,MOS 分数函数在准确率和推理速度方面表现如何?
- RQ4不同的分组策略、模型架构和微调配置对大规模设置下 OOD 检测性能有何影响?
- RQ5该基于群体的框架是否能在不依赖辅助异常数据或复杂训练过程的情况下实现 SOTA 性能?
主要发现
- 与之前最佳方法相比,MOS 在四个语义多样的 OOD 数据集上实现了平均 FPR95 降低 14.33%,证明了其卓越的检测性能。
- 该方法在保持或提升检测准确率的同时,实现推理时间 6 倍的加速,使其在实际部署中极具效率。
- 仅微调顶层全连接层的策略比微调深层网络表现更优,表明其降低了标签过拟合的风险。
- 群体方法显著优于 MSP 和 KL 匹配等基线方法,尤其当类别数从 50 增加到 1,000 时优势更加明显。
- 来自真实世界高分辨率数据库的精心筛选 OOD 评估数据集,相比合成或简化的基准,为大规模 OOD 检测提供了更真实的评估标准。
![Figure 2 : OOD detection performance of a common baseline MSP [ 16 ] decreases rapidly as the number of ImageNet-1k classes increases ( left : AUROC; right : FPR95).](https://ar5iv.labs.arxiv.org/html/2105.01879/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。