Skip to main content
QUICK REVIEW

[论文解读] The Peril of Popular Deep Learning Uncertainty Estimation Methods

Yehao Liu, Matteo Pagliardini|arXiv (Cornell University)|Dec 9, 2021
Gaussian Processes and Bayesian Inference被引用 11
一句话总结

本文揭示了主流深度学习不确定性估计方法中的一个关键缺陷:蒙特卡洛丢弃(MCDropout)和贝叶斯神经网络(BNNs)通常对分布外(OOD)样本赋予低不确定性,这与预期行为相反。相比之下,高斯过程(GPs)能正确地以高不确定性识别此类样本。该研究通过二维玩具数据和真实数据集(如MNIST和CIFAR-10)的实证分析表明,MCDropout和BNNs无法检测OOD输入,而GPs则因基于核函数的距离感知能力而表现优异。

ABSTRACT

Uncertainty estimation (UE) techniques -- such as the Gaussian process (GP), Bayesian neural networks (BNN), Monte Carlo dropout (MCDropout) -- aim to improve the interpretability of machine learning models by assigning an estimated uncertainty value to each of their prediction outputs. However, since too high uncertainty estimates can have fatal consequences in practice, this paper analyzes the above techniques. Firstly, we show that GP methods always yield high uncertainty estimates on out of distribution (OOD) data. Secondly, we show on a 2D toy example that both BNNs and MCDropout do not give high uncertainty estimates on OOD samples. Finally, we show empirically that this pitfall of BNNs and MCDropout holds on real world datasets as well. Our insights (i) raise awareness for the more cautious use of currently popular UE methods in Deep Learning, (ii) encourage the development of UE methods that approximate GP-based methods -- instead of BNNs and MCDropout, and (iii) our empirical setups can be used for verifying the OOD performances of any other UE method. The source code is available at https://github.com/epfml/uncertainity-estimation.

研究动机与目标

  • 调查广泛使用的不确定性估计(UE)方法——MCDropout和BNNs——在检测分布外(OOD)样本方面的可靠性。
  • 将它们的表现与作为金标准的高斯过程(GPs)进行比较,后者以准确的OOD检测著称。
  • 通过实证方法证明,MCDropout和BNNs在真实场景中无法为OOD输入分配高不确定性。
  • 为基于核函数的相似性建模使GP方法在OOD检测中更具鲁棒性的原因,提供理论与实证依据。

提出的方法

  • 本研究使用二维玩具数据集,对GP、MCDropout和BNNs在分布内与分布外区域的不确定性估计进行可视化和定量比较。
  • 在真实世界评估中,论文在CIFAR-10上训练ResNet-18,并将训练期间未见的CIFAR-100样本用作OOD数据,通过输出熵来度量不确定性。
  • BNNs采用平均场变分推断(MFVI)和哈密顿蒙特卡洛(HMC)两种方法进行训练,以评估推断方法对不确定性估计的影响。
  • GP模型使用拉普拉斯近似进行分类,预测不确定性来源于函数值后验分布的方差。
  • 不确定性通过预测类别分布的熵来量化:$\mathcal{H}({\bm{x}},{\bm{\omega}}) = -\sum_{c\in C}\hat{{\bm{y}}}_{c}\log\hat{{\bm{y}}}_{c}$。
  • 理论分析表明,当测试点与训练点之间的核向量$\mathbf{k}_{\star}$较小时(即测试点远离训练数据),GP的不确定性趋近于最大值(二分类中熵≈1),从而确保对OOD输入赋予高不确定性。

实验结果

研究问题

  • RQ1MCDropout和BNNs是否能可靠地为分布外(OOD)样本分配高不确定性,以满足安全部署的要求?
  • RQ2为何MCDropout和BNNs无法检测OOD输入,而高斯过程(GPs)能够成功检测?
  • RQ3MCDropout和BNNs的失败是理论局限性,还是特定架构或训练过程的产物?
  • RQ4GPs基于核函数的距离感知能力能否与它们在OOD检测中的优越性能建立正式关联?
  • RQ5在MNIST和CIFAR-10等真实数据集上,MCDropout和BNNs的不确定性估计与GPs相比如何?

主要发现

  • 在二维玩具数据集中,MCDropout和BNNs对OOD样本赋予低不确定性,而高斯过程(GPs)则赋予高不确定性,正确识别出其为分布外样本。
  • 在MNIST数据集中,当模型在数字0和1上进行训练,而测试集为数字2–9时,MCDropout和BNNs对数字2–9的平均不确定性较低,表明其OOD检测能力差。
  • 在CIFAR-10数据集中,当在CIFAR-10上训练ResNet-18,并使用训练集中未出现的CIFAR-100样本作为测试集时,MCDropout和BNNs再次赋予低不确定性,未能检测出OOD输入。
  • 理论分析证实,当核向量$\mathbf{k}_{\star}$变小时,GP对OOD点赋予高不确定性,因为预测方差趋近于$k(\mathbf{x}_{\star},\mathbf{x}_{\star})$,熵趋近于1。
  • MCDropout和BNNs的失败并非由于训练不佳或超参数选择不当,因为即使在BNNs中使用HMC推断,或在MCDropout中使用多轮MC采样,该问题依然存在。
  • 结果表明,当前的UE方法应被类似GP的方法所取代,这些方法通过核函数显式建模输入相似性,而非依赖BNNs的权重空间不确定性或Dropout机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。