[论文解读] Improving Out-of-Distribution Detection via Epistemic Uncertainty Adversarial Training
本文提出不确定性对抗训练(UAT),通过对抗性攻击dropout集成模型的主观不确定性估计,提升分布外(OOD)检测性能。通过使模型对不确定性针对性攻击具备鲁棒性,UAT在干净OOD数据上将${\rm AUC}_{ \scriptscriptstyle{\rm FPR}<1\%}$提升至≥0.75,并在对抗性扰动下保持高鲁棒性,显著优于基线方法在低误报率下的表现。
The quantification of uncertainty is important for the adoption of machine learning, especially to reject out-of-distribution (OOD) data back to human experts for review. Yet progress has been slow, as a balance must be struck between computational efficiency and the quality of uncertainty estimates. For this reason many use deep ensembles of neural networks or Monte Carlo dropout for reasonable uncertainty estimates at relatively minimal compute and memory. Surprisingly, when we focus on the real-world applicable constraint of $\leq 1\%$ false positive rate (FPR), prior methods fail to reliably detect OOD samples as such. Notably, even Gaussian random noise fails to trigger these popular OOD techniques. We help to alleviate this problem by devising a simple adversarial training scheme that incorporates an attack of the epistemic uncertainty predicted by the dropout ensemble. We demonstrate this method improves OOD detection performance on standard data (i.e., not adversarially crafted), and improves the standardized partial AUC from near-random guessing performance to $\geq 0.75$.
研究动机与目标
- 探究现有基于不确定性的OOD检测方法在低误报率(≤1%)下的失效原因,特别是对高斯噪声等简单OOD样本的检测能力。
- 识别dropout集成模型中主观不确定性估计对降低OOD输入不确定性之针对性攻击的脆弱性。
- 提出一种新颖的对抗性训练方案,以同时提升干净OOD检测性能与对不确定性针对性攻击的鲁棒性。
- 证明在不牺牲干净准确率的前提下,实现低误报率下OOD检测性能的提升,打破典型的准确率-鲁棒性权衡。
提出的方法
- 该方法针对dropout集成模型预测的主观不确定性(以互信息衡量)引入针对性对抗攻击。
- 该攻击称为不确定性FGSM(UFGSM),生成的扰动可最小化OOD样本上的主观不确定性,模拟OOD输入看似高度自信的场景。
- 随后使用这些不确定性针对性扰动对模型进行对抗性训练,以提升推理阶段的鲁棒性。
- 训练过程中结合蒙特卡洛dropout与集成平均方法估计主观不确定性,以预测结果之间的互信息作为不确定性度量。
- 该方法在标准训练过程中应用,损失函数被正则化以在对抗性扰动下保持OOD数据上的低不确定性。
- 该方法在多个数据集(MNIST、FMNIST、CIFAR-10、SVHN、ImageNet)和多种OOD数据类型(真实、伪造、噪声、对抗性攻击样本)上进行了评估。
实验结果
研究问题
- RQ1现有基于不确定性的OOD检测方法是否能在误报率≤1%的条件下可靠检测OOD样本,这是实际部署的关键阈值?
- RQ2dropout集成模型的主观不确定性估计对降低OOD输入不确定性的针对性攻击有多脆弱?
- RQ3使用不确定性针对性攻击的对抗性训练能否同时提升干净OOD检测性能与对这类攻击的鲁棒性?
- RQ4所提方法是否打破了OOD检测中典型的准确率与鲁棒性之间的权衡?
主要发现
- 基线方法(包括深度集成和蒙特卡洛dropout)在≤1%误报率下无法检测OOD样本,${\rm AUC}_{\scriptscriptstyle{\rm FPR}<1\%}$得分接近随机猜测(≈0.5),即使在高斯噪声上亦然。
- UFGSM攻击成功降低了OOD样本上的主观不确定性,使其表现得像分布内样本,导致假阴性增加。
- UAT训练的模型在所有评估数据集的干净OOD数据上均实现${\rm AUC}_{\scriptscriptstyle{\rm FPR}<1\%}$ ≥0.75,显著优于基线方法。
- UAT方法在UFGSM攻击下保持高鲁棒性,攻击后OOD样本的${\rm AUC}_{\scriptscriptstyle{\rm FPR}<1\%}$得分达0.91–1.00,而基线方法性能退化至接近随机水平。
- UAT方法在不降低干净准确率的前提下提升了OOD检测性能,证明了在不确定性感知模型中鲁棒性与准确率可共存。
- 该方法在多种OOD数据类型上均表现出一致的性能提升,包括自然图像数据集、合成伪造数据及对抗性扰动样本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。