[论文解读] Training OOD Detectors in their Natural Habitats
该论文提出 WOODS,一种新颖的约束优化框架,通过使用未标注的‘野生’数据(即分布内与分布外样本的自然混合)来训练分布外(OOD)检测器,而无需依赖辅助异常值数据。通过使用增广拉格朗日法将问题转化为可处理的优化问题,WOODS 实现了最先进的 OOD 检测性能,在 CIFAR-100 上的 FPR95 比基线方法提升 48.10%,在 Outlier Exposure 方法上提升 7.36%。
Out-of-distribution (OOD) detection is important for machine learning models deployed in the wild. Recent methods use auxiliary outlier data to regularize the model for improved OOD detection. However, these approaches make a strong distributional assumption that the auxiliary outlier data is completely separable from the in-distribution (ID) data. In this paper, we propose a novel framework that leverages wild mixture data, which naturally consists of both ID and OOD samples. Such wild data is abundant and arises freely upon deploying a machine learning classifier in their natural habitats. Our key idea is to formulate a constrained optimization problem and to show how to tractably solve it. Our learning objective maximizes the OOD detection rate, subject to constraints on the classification error of ID data and on the OOD error rate of ID examples. We extensively evaluate our approach on common OOD detection tasks and demonstrate superior performance.
研究动机与目标
- 解决现有 OOD 检测方法依赖于人工收集的、干净的辅助异常值数据集所带来的局限性。
- 在实际部署过程中,利用大量未标注的‘野生’数据——即自然发生的分布内与分布外样本的混合——进行训练。
- 开发一种约束优化框架,在保持高分布内分类准确率的同时,最小化在分布内数据上的误判为 OOD 的情况。
- 为深度神经网络提供一种可处理的、端到端的训练流程,基于增广拉格朗日法。
提出的方法
- 将 OOD 检测建模为一个约束优化问题:在限制分布内误分类和在分布内样本上 OOD 错误率的前提下,最大化 OOD 检测率。
- 使用增广拉格朗日法(ALM)求解带有不等式约束的约束优化问题,支持通过随机梯度下降实现端到端训练。
- 采用可微的 Sigmoid 损失函数进行 OOD 检测,与深度学习兼容,不同于以往使用难以处理的 0-1 损失的工作。
- 仅使用标注的分布内数据和未标注的野生数据,将分布内分类与 OOD 检测目标统一到一个联合训练目标中。
- 将 ALM 适配至深度神经网络,以处理非线性不等式约束,确保强理论保证。
- 采用对偶上升策略,强制执行对分布内错误率和在分布内数据上 OOD 错误率的约束,从而保持基线分类准确率。
实验结果
研究问题
- RQ1能否仅使用未标注的野生数据训练 OOD 检测器,而无需访问干净的异常值数据集?
- RQ2如何将约束优化方法适配到深度神经网络中,以联合优化分布内分类与 OOD 检测?
- RQ3利用自然发生的样本混合数据是否能比离线的辅助异常值数据更好地泛化到真实世界中的测试时分布?
- RQ4野生数据中分布内与 OOD 样本混合比例的变化对 OOD 检测性能有何影响?
- RQ5与使用辅助异常值数据的强基线方法相比,所提方法在 FPR95 和检测准确率方面的表现如何?
主要发现
- 在 CIFAR-100 上,WOODS 相较于仅使用分布内数据训练的强基线方法,FPR95 提升了 48.10%。
- 与 Outlier Exposure(OE)相比,WOODS 在 FPR95 上提升了 7.36%,证明了野生数据优于人工整理的辅助异常值数据。
- 该框架在保持接近最优的分布内分类准确率的同时,显著提升了 OOD 检测性能,即使野生数据中混合比例严重失衡也表现稳健。
- 消融实验表明,该方法在多种数据集上以及在野生数据中分布内与 OOD 数据比例多变的情况下均表现出稳健性能。
- 理论与实证分析证实,约束优化框架中 Sigmoid 损失的选择能有效实现 OOD 检测。
- 增广拉格朗日法实现了稳定且可处理的训练过程,并具备强收敛保证,优于基于正则化的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。