[论文解读] Certifiably Adversarially Robust Detection of Out-of-Distribution Data
本文提出 GOOD(Guaranteed Out-of-distribution Detection),一种可认证地确保在任意 OOD 样本周围半径为 ε 的 l∞-球内,分类器对分布外(OOD)数据保持低置信度的方法。通过利用区间边界传播(IBP)在训练过程中最小化此类球体内最大置信度的上界,GOOD 在不显著降低分布内任务准确率的前提下,实现了对对抗性 OOD 扰动的可证明鲁棒性。
Deep neural networks are known to be overconfident when applied to out-of-distribution (OOD) inputs which clearly do not belong to any class. This is a problem in safety-critical applications since a reliable assessment of the uncertainty of a classifier is a key property, allowing the system to trigger human intervention or to transfer into a safe state. In this paper, we aim for certifiable worst case guarantees for OOD detection by enforcing not only low confidence at the OOD point but also in an $l_\infty$-ball around it. For this purpose, we use interval bound propagation (IBP) to upper bound the maximal confidence in the $l_\infty$-ball and minimize this upper bound during training time. We show that non-trivial bounds on the confidence for OOD data generalizing beyond the OOD dataset seen at training time are possible. Moreover, in contrast to certified adversarial robustness which typically comes with significant loss in prediction performance, certified guarantees for worst case OOD detection are possible without much loss in accuracy.
研究动机与目标
- 提供可证明的、最坏情况下的保证,即深度神经网络分类器在面对对抗性扰动时,对分布外(OOD)数据仍能保持低置信度。
- 将可认证鲁棒性从分布内对抗样本扩展到 OOD 输入,尽管 OOD 输入在安全关键场景中常被忽视。
- 开发一种训练方案,使 OOD 检测的保证能够泛化至训练期间未见过的 OOD 数据集,例如在 MNIST 数字上训练时对 EMNIST 字母的泛化。
- 在不显著影响分布内分类任务性能的前提下,实现可认证的 OOD 鲁棒性,这与传统可认证对抗鲁棒性方法不同。
提出的方法
- 使用区间边界传播(IBP)计算任意给定 OOD 样本周围半径为 ε 的 l∞-球内分类器最大置信度的可认证上界。
- 通过一种新型目标函数在训练过程中最小化该 IBP 导出的上界,确保模型无法对 OOD 输入周围 ε-球内的任意点赋予高置信度。
- 提出 GOOD(Guaranteed Out-of-distribution Detection)训练方案,明确优化最坏情况下的 OOD 置信度边界。
- 在训练期间对多样化 OOD 数据应用可认证边界最小化,从而实现对相关但未见过的 OOD 数据集的泛化。
- 采用 IBP 边界的可微分松弛,以支持使用标准反向传播进行端到端训练。
- 通过在多个数据集和 ε 值下使用 AAUC 和 GAUC 指标验证可认证保证,证明了其在训练 OOD 分布之外的泛化能力。
实验结果
研究问题
- RQ1我们能否为深度神经网络提供可证明的保证,使其在 l∞-范数下对分布外输入的对抗性扰动仍能保持低置信度?
- RQ2通过 IBP 训练实现 OOD 鲁棒性认证是否会在分布内分类任务上带来显著的准确率损失,如在对抗鲁棒性中所见?
- RQ3可认证的 OOD 检测保证能否泛化至训练期间未出现的 OOD 数据集,例如在 MNIST 上训练时对 EMNIST 字母的泛化?
- RQ4GOOD 在可认证鲁棒性和对更大扰动半径的泛化能力方面,与当前最先进的 OOD 检测方法(如 Outlier Exposure(OE)、ACET 和 CCU)相比表现如何?
- RQ5我们能否在接近分布内流形的 OOD 点周围 l∞-球上实现有意义的最坏情况置信度边界,而现有方法在此类区域失效?
主要发现
- GOOD 实现了 OOD 检测的可认证最坏情况置信度边界:当 ε = 0.01 时,模型在 CIFAR-100 中一只黑猩猩图像周围 l∞-球内所有类别上均保证置信度 < 22.7%。
- GOOD 在保持接近 SOTA 的分布内准确率(例如在 CIFAR-10 上 ε = 0.03 时为 99.1%)的同时,提供了可认证的 OOD 鲁棒性,而传统对抗鲁棒性方法则会带来显著的准确率下降。
- 在 MNIST → EMNIST 字母 OOD 检测任务中,GOOD 在 ε = 0.08 时达到 84.5% GAUC,优于 ACET(52.1%)和 OE(63.6%),并实现了对未见 OOD 数据的泛化。
- GOOD 在更大的 ε 值上泛化良好:当 ε = 0.1 时,在 MNIST 上训练的模型于 CIFAR-10 上达到 77.3% GAUC,显著优于 ACET(52.1%)和 OE(63.6%)的泛化性能。
- GOOD 在所有评估的数据集和 ε 值下均达到 SOTA 的 AAUC 和 GAUC,证明了其在训练时威胁模型之外的可认证 OOD 鲁棒性泛化能力。
- GOOD 的可认证边界具有实质性意义:例如,它保证在一只黑猩猩图像周围 l∞-球内置信度 < 22.7%,尽管模型从未在该类图像上进行过训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。