[论文解读] ATOM: Robustifying Out-of-distribution Detection Using Outlier Mining
ATOM 提出了一种新颖的训练框架,通过结合对抗训练与信息性异常样本挖掘,增强了分布外(OOD)检测在对抗性攻击下的鲁棒性。通过选择性地使用低OOD分数的辅助数据,ATOM 显著改善了决策边界的泛化能力,在CIFAR-10上面对对抗性OOD攻击时,FPR降低了高达57.99%,并在多种OOD评估任务中达到了最先进性能。
Detecting out-of-distribution (OOD) inputs is critical for safely deploying deep learning models in an open-world setting. However, existing OOD detection solutions can be brittle in the open world, facing various types of adversarial OOD inputs. While methods leveraging auxiliary OOD data have emerged, our analysis on illuminative examples reveals a key insight that the majority of auxiliary OOD examples may not meaningfully improve or even hurt the decision boundary of the OOD detector, which is also observed in empirical results on real data. In this paper, we provide a theoretically motivated method, Adversarial Training with informative Outlier Mining (ATOM), which improves the robustness of OOD detection. We show that, by mining informative auxiliary OOD data, one can significantly improve OOD detection performance, and somewhat surprisingly, generalize to unseen adversarial attacks. ATOM achieves state-of-the-art performance under a broad family of classic and adversarial OOD evaluation tasks. For example, on the CIFAR-10 in-distribution dataset, ATOM reduces the FPR (at TPR 95%) by up to 57.99% under adversarial OOD inputs, surpassing the previous best baseline by a large margin.
研究动机与目标
- 为解决现有OOD检测方法在对抗性OOD输入下表现脆弱的问题,这些方法可能将受扰动的OOD样本误分类为分布内样本。
- 探究并验证是否以及如何更有效地利用辅助OOD数据以提升OOD检测器的鲁棒性。
- 开发一种方法,通过挖掘信息性异常样本而非随机或启发式采样,实现对未见对抗性攻击的泛化能力。
- 为异常样本挖掘在构建更紧密、更鲁棒的OOD决策边界方面的有效性提供理论依据。
提出的方法
- ATOM 引入了两阶段训练流程:首先,从大量辅助OOD数据中基于低OOD检测分数识别并选择信息性异常样本。
- 对所选的信息性异常样本应用对抗训练,以增强OOD检测器对扰动的鲁棒性,从而提升在对抗性OOD输入下的泛化能力。
- 采用基于置信度的准则优先选择靠近决策边界的异常样本,确保其对边界优化有实质性贡献。
- 整合为OOD检测器专门设计的对抗样本(而非分类器),聚焦于检测器的决策边界,以提升其鲁棒性。
- 将异常样本挖掘与对抗训练相结合,联合正则化OOD检测器,避免因无信息或噪声异常样本导致的性能退化。
- 理论分析表明,挖掘信息性异常样本可实现更优的决策边界正则化,为OOD检测中硬负样本挖掘的直观有效性提供了形式化依据。
实验结果
研究问题
- RQ1从辅助OOD数据中挖掘信息性异常样本,是否能显著提升OOD检测在对抗性扰动下的鲁棒性?
- RQ2在挖掘的异常样本上应用对抗训练,是否能泛化到训练分布之外的未见对抗攻击类型?
- RQ3为何随机或启发式采样辅助OOD数据通常无法提升甚至会降低OOD检测性能?
- RQ4异常样本挖掘如何促进形成更紧密、更鲁棒的分布内与分布外数据之间的决策边界?
- RQ5为异常样本挖掘在OOD检测中的有效性可提供哪些理论保证?
主要发现
- 在CIFAR-10上,ATOM在对抗性 $L_∞$ OOD攻击下,将95%真正率(TPR)下的假正例率(FPR)降低了高达57.99%,显著优于先前最佳基线方法。
- 在 $L_∞$ OOD任务中,与最佳先前方法ACET相比,ATOM在CIFAR-10上将FPR降低了53.9%。
- 在CIFAR-100数据集上使用DenseNet时,ATOM在所有四种OOD评估类型(自然、损坏、$L_∞$扰动、组合型OOD输入)中均达到最先进性能。
- 在CIFAR-10自然OOD设置下,ATOM实现6.30%的FPR(在95% TPR下),优于OE(11.08%)和ACET(18.63%)。
- 消融实验确认,对抗训练与异常样本挖掘均不可或缺:移除任一组件均导致性能显著下降。
- 理论分析表明,挖掘信息性异常样本可实现更优的决策边界正则化,为该方法的成功提供了形式化理论支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。