[论文解读] Provable Worst Case Guarantees for the Detection of Out-of-Distribution Data.
本文提出一种方法,通过在分布外(OOD)样本点及其周围 $l_\infty$-球内均强制保持低置信度,为深度神经网络提供可证明的最坏情况OOD检测保证。利用区间边界传播(IBP),该方法在训练过程中最小化这些球内置信度的上界,从而在几乎不损失准确率的情况下实现可认证的OOD检测。
Deep neural networks are known to be overconfident when applied to out-of-distribution (OOD) inputs which clearly do not belong to any class. This is a problem in safety-critical applications since a reliable assessment of the uncertainty of a classifier is a key property, allowing to trigger human intervention or to transfer into a safe state. In this paper, we are aiming for certifiable worst case guarantees for OOD detection by enforcing not only low confidence at the OOD point but also in an $l_\infty$-ball around it. For this purpose, we use interval bound propagation (IBP) to upper bound the maximal confidence in the $l_\infty$-ball and minimize this upper bound during training time. We show that non-trivial bounds on the confidence for OOD data generalizing beyond the OOD dataset seen at training time are possible. Moreover, in contrast to certified adversarial robustness which typically comes with significant loss in prediction performance, certified guarantees for worst case OOD detection are possible without much loss in accuracy.
研究动机与目标
- 为解决深度神经网络在分布外(OOD)输入上过度自信的问题,这在安全关键应用中具有危险性。
- 提供可证明的最坏情况保证,即分类器不会对OOD数据分配高置信度,即使在这些点的邻域内也是如此。
- 将通常用于对抗样本的可认证鲁棒性概念扩展到OOD检测,确保在训练OOD分布之外的可靠性。
- 在保持高分布内准确率的同时实现强大的OOD检测保证,避免在对抗鲁棒性中常见的典型准确率下降问题。
提出的方法
- 该方法使用区间边界传播(IBP)计算神经网络在给定OOD点周围 $l_\infty$-球内任意输入可能分配的最大置信度的上界。
- 在训练过程中,模型被优化以最小化该上界,从而确保网络对OOD输入及其局部邻域保持不确定。
- 该方法不仅在OOD点上强制置信度保持低位,还在一个鲁棒邻域内实现,从而提供针对OOD输入的最坏情况保证。
- 该方法可推广至训练期间未见的OOD数据,提供对未见OOD分布的边界保证。
- 训练目标结合了标准交叉熵损失与基于IBP推导出的置信度上界正则化项。
实验结果
研究问题
- RQ1我们能否提供可证明的最坏情况保证,确保深度神经网络不会对分布外输入过度自信?
- RQ2是否可能不仅在OOD点上,而且在这些点周围的 $l_\infty$-球内也实现低置信度的认证?
- RQ3这种可认证的OOD检测是否可以在不显著降低标准分布内准确率的情况下实现?
- RQ4这些认证边界在训练期间未见的OOD数据上泛化效果如何?
主要发现
- 该方法成功为OOD数据提供了非平凡且可证明的置信度上界,即使在训练期间见过的具体OOD样本之外也成立。
- 可认证的OOD检测可在分布内数据上实现极小的性能下降,这与对抗鲁棒性中通常出现的显著准确率下降形成鲜明对比。
- 使用区间边界传播可高效且可扩展地计算OOD点周围 $l_\infty$-球内置信度上界。
- 该方法可推广至未见的OOD分布,提供不局限于训练OOD集合的鲁棒性保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。