Skip to main content
QUICK REVIEW

[论文解读] Towards neural networks that provably know when they don't know

Alexander Meinke, Matthias Hein|arXiv (Cornell University)|Sep 26, 2019
Adversarial Robustness in Machine Learning参考文献 19被引用 9
一句话总结

本文提出Certified Certain Uncertainty (CCU),一种通过使用高斯混合模型作为生成先验,对ReLU神经网络进行修改的方法,可证明地在远离训练数据时产生低置信度预测。CCU首次为分布外(OOD)点整个邻域内的低置信度提供了数学证明,其在最坏情况OOD检测中表现优于最先进方法,同时保持了高分布内分类准确率和OOD性能。

ABSTRACT

It has recently been shown that ReLU networks produce arbitrarily over-confident predictions far away from the training data. Thus, ReLU networks do not know when they don't know. However, this is a highly important property in safety critical applications. In the context of out-of-distribution detection (OOD) there have been a number of proposals to mitigate this problem but none of them are able to make any mathematical guarantees. In this paper we propose a new approach to OOD which overcomes both problems. Our approach can be used with ReLU networks and provides provably low confidence predictions far away from the training data as well as the first certificates for low confidence predictions in a neighborhood of an out-distribution point. In the experiments we show that state-of-the-art methods fail in this worst-case setting whereas our model can guarantee its performance while retaining state-of-the-art OOD performance.

研究动机与目标

  • 为解决ReLU神经网络在远离训练数据时产生任意高置信度预测的问题,该问题会损害安全关键应用中的可靠性。
  • 开发一种方法,不仅在孤立点上,而且在分布外输入的整个邻域上,提供低置信度预测的数学保证。
  • 在不牺牲准确率的前提下,保持在分布内分类和分布外检测任务上的最先进性能。
  • 克服现有OOD检测方法的局限性,这些方法缺乏鲁棒性保证,且可能被分布外输入邻域中的最坏情况对抗扰动欺骗。
  • 将贝叶斯框架与生成建模(高斯混合模型)相结合,以在深度网络中实现可证明的不确定性估计。

提出的方法

  • 该方法采用贝叶斯框架,分别对分布内和分布外数据建模,其中分布外数据建模为高斯混合模型(GMM)。
  • 将训练表述为最大似然估计问题,直接优化分布内准确率和可证明的OOD不确定性。
  • 基于GMM的密度估计器可计算任意分布外点周围整个邻域上预测置信度的可证明上界。
  • 该方法将GMM集成到神经网络架构中,使模型能够学习支持可证明不确定性量化的联合表示。
  • 通过区间分析和ReLU网络的Lipschitz性质推导出可证明的置信度边界,确保对输入空间中微小扰动的鲁棒性。
  • 该方法与标准ReLU网络兼容,除引入GMM先验外无需进行架构修改。

实验结果

研究问题

  • RQ1ReLU神经网络能否被修改,以在远离训练分布时可证明地产生低置信度预测?
  • RQ2我们能否为分布外点整个邻域提供数学证明,表明置信度保持在低位,而不仅仅是孤立点?
  • RQ3现有最先进OOD检测方法在分布外输入邻域的最坏情况对抗扰动下是否会失效?
  • RQ4我们能否在提供正式保证的同时,实现高分布内准确率和强OOD检测性能?
  • RQ5是否可能将生成建模集成到标准深度网络中,以实现可证明的不确定性估计?

主要发现

  • CCU在所有评估数据集(包括CIFAR-10、CIFAR-100、SVHN和ImageNet)上均达到最先进分布内准确率,性能与基线模型相当或更优。
  • 在OOD检测方面,CCU与ODIN-ensemble(OE)在AUC得分上表现最高,且在所有数据集上均优于其他方法,包括在使用均匀噪声作为OOD的CIFAR-10上达到97.8%的AUC。
  • 所有最先进OOD方法(包括ODIN、MCD和Mahalanobis)在噪声输入邻域的最坏情况扰动下均失效,而CCU在整个区域内均保持低置信度。
  • 该方法可为整个邻域提供可证明的置信度边界,其证明为:在噪声图像周围小球内的任何对抗扰动均无法使模型置信度超过已认证的上界。
  • 即使在LSUN-CC和ImageNet-Noise等具有挑战性的OOD基准上,CCU仍保持高性能,LSUN-CC上AUC达98.6%,ImageNet-Noise上达97.0%。
  • 使用高斯混合模型作为密度估计器,使这些正式保证成为可能,而这是标准VAE或GAN无法实现的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。