[论文解读] Provably Robust Detection of Out-of-distribution Data (almost) for free
本文提出 ProoD,一种可证明对抗鲁棒的分布外(OOD)检测方法,在不损害模型可靠性的情况下,实现了高干净准确率和强 OOD 检测性能。通过修改分类器架构以引入可学习偏置偏移,并在训练过程中应用区间边界传播(IBP),ProoD 为在 $l_∞$-扰动下 OOD 样本的置信度提供了数学上保证的上界,确保了鲁棒性,同时不降低分布内准确率。
The application of machine learning in safety-critical systems requires a reliable assessment of uncertainty. However, deep neural networks are known to produce highly overconfident predictions on out-of-distribution (OOD) data. Even if trained to be non-confident on OOD data, one can still adversarially manipulate OOD data so that the classifier again assigns high confidence to the manipulated samples. We show that two previously published defenses can be broken by better adapted attacks, highlighting the importance of robustness guarantees around OOD data. Since the existing method for this task is hard to train and significantly limits accuracy, we construct a classifier that can simultaneously achieve provably adversarially robust OOD detection and high clean accuracy. Moreover, by slightly modifying the classifier's architecture our method provably avoids the asymptotic overconfidence problem of standard neural networks. We provide code for all our experiments.
研究动机与目标
- 解决 OOD 检测方法对可人为提高分类器在分布外输入上置信度的对抗扰动的脆弱性。
- 开发一种方法,在 $l_\infty$-有界对抗攻击下,为 OOD 置信度提供可证明保证,确保鲁棒性的同时不损害干净准确率。
- 通过架构和训练方式的修改,可证明地消除标准神经网络在远离训练数据分布时的渐近过度自信问题。
- 结合高分布内准确率与 OOD 检测的认证鲁棒性,使方法可实际部署于安全关键系统中。
提出的方法
- 通过引入可学习偏置偏移 $\Delta$ 修改分类器架构,以防止渐近过度自信。
- 在训练过程中应用区间边界传播(IBP),以计算在 $l_\infty$-邻域内 OOD 样本置信度的认证上界。
- 训练目标是最小化 OOD 数据的置信度认证上界,从而确保在对抗扰动下的鲁棒性。
- 该方法与标准 OOD 检测基线兼容,可与已训练的鲁棒模型结合使用,无需重新训练。
- 该方法使用二元判别器头,基于置信度阈值将输入分类为分布内或分布外。
- 为每个 OOD 样本提供逐点证书,数学上保证任何 $l_\infty$-扰动都无法使置信度超过认证上界。
实验结果
研究问题
- RQ1能否在保持高干净准确率的同时,使 OOD 检测对 $l_\infty$-对抗攻击具有可证明鲁棒性?
- RQ2能否通过架构和训练方式的修改,可证明地消除标准神经网络在 OOD 数据上的渐近过度自信?
- RQ3能否在不重新训练或损害分布内数据性能的前提下,实现 OOD 检测的认证鲁棒性?
- RQ4所提方法在实验和理论上与现有 OOD 检测及对抗鲁棒方法相比表现如何?
- RQ5该方法能否与已训练的、分布内鲁棒模型组合使用,以增强 OOD 鲁棒性且不造成性能损失?
主要发现
- ProoD 在 CIFAR-10 上实现了 95.6% 的高干净准确率,与 OE 等最先进方法相当,同时提供认证鲁棒性。
- 在 CIFAR-100 分布外基准上,当 $\Delta=3$ 时,ProoD 在 $\epsilon=0.01$ 的 $l_\infty$-扰动下实现了 48.6% 的认证 GAUC,显著优于非鲁棒基线。
- 即使对于远离训练分布的 OOD 数据,该方法仍能提供非零 GAUC 和认证置信度上界,而标准模型则会表现出渐近过度自信。
- 当与 RobustBench 中的鲁棒 ResNet-18 结合时,ProoD 在所有数据集上均保持或提升了 OOD 检测性能,且干净准确率和鲁棒准确率均无下降。
- 五次运行的误差条显示方差极小,证实了方法的稳定性及其性能的一致性。
- ProoD-Disc 的变体(采用离散偏置偏移)在 CIFAR-100 上实现了 67.7% 的 AUC 和 61.6% 的 GAUC,表现出强大的经验鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。