Skip to main content
QUICK REVIEW

[论文解读] Towards Principled Uncertainty Estimation for Deep Neural Networks

Richard Harang, Ethan M. Rudd|arXiv (Cornell University)|Oct 29, 2018
Gaussian Processes and Bayesian Inference参考文献 21被引用 4
一句话总结

本文提出了一种统一的分层深度神经网络,通过结合贝叶斯推断、可逆归一化流和判别分类,联合估计三种类型的不确定性——模型容量、内在数据和开放集不确定性。该模型实现了高效的端到端逐样本不确定性估计,计算开销极小,并在高斯潜在空间假设下可证明地界定了开放集风险。

ABSTRACT

When the cost of misclassifying a sample is high, it is useful to have an accurate estimate of uncertainty in the prediction for that sample. There are also multiple types of uncertainty which are best estimated in different ways, for example, uncertainty that is intrinsic to the training set may be well-handled by a Bayesian approach, while uncertainty introduced by shifts between training and query distributions may be better-addressed by density/support estimation. In this paper, we examine three types of uncertainty: model capacity uncertainty, intrinsic data uncertainty, and open set uncertainty, and review techniques that have been derived to address each one. We then introduce a unified hierarchical model, which combines methods from Bayesian inference, invertible latent density inference, and discriminative classification in a single end-to-end deep neural network topology to yield efficient per-sample uncertainty estimation in a detection context. This approach addresses all three uncertainty types and can readily accommodate prior/base rates for binary detection. We then discuss how to extend this model to a more generic multiclass recognition context.

研究动机与目标

  • 解决现有不确定性估计方法无法区分深度神经网络中不同类型不确定性的问题。
  • 开发一种可扩展的、端到端的深度学习架构,同时建模模型容量、内在数据和开放集不确定性。
  • 为每个样本提供原则性且校准良好的不确定性估计,以支持在高风险应用中的实际部署。
  • 在二元检测任务中自然地整合先验/基础概率。
  • 将该框架扩展至多类识别任务,在多项式噪声模型下使用狄利克雷先验。

提出的方法

  • 该模型在共享的深度神经网络架构中,将基于贝叶斯启发的概率头与基于归一化流的密度估计器相结合。
  • 利用可逆潜在密度推断,在解耦的潜在空间中建模输入的似然性,从而通过密度估计实现不确定性量化。
  • 判别交叉熵头确保了准确的分类,同时潜在空间被正则化以分离特定类别的分布。
  • 通过联合目标函数(结合分类损失和似然最大化)进行端到端训练,以实现不确定性估计。
  • 在潜在空间中使用类特定的高斯输出来建模类内支持,降低类间聚类区域之间高密度区域的风险。
  • 该框架自然地容纳了二元检测任务中的先验概率和基础率,并在潜在密度收敛到高斯分布的假设下,为开放集风险提供了理论边界。

实验结果

研究问题

  • RQ1如何通过单一深度学习模型同时有效估计多种不同的不确定性类型——模型容量、内在数据和开放集不确定性?
  • RQ2结合贝叶斯推断、归一化流和判别学习的统一架构,能否实现校准良好的不确定性估计且推理成本低?
  • RQ3在分布偏移或分布外输入下,该模型的不确定性估计性能如何?
  • RQ4使用类特定潜在高斯分布与单一共享高斯分布相比,对密度估计和不确定性校准有何影响?
  • RQ5如何在二元检测任务中将先验知识和基础率自然地整合到不确定性估计过程中?

主要发现

  • 该模型仅需一次前向传播即可实现高效的逐样本不确定性估计,适用于实时应用。
  • 在字符识别任务上的实证评估表明,17%的假阳性是由于小写'l'被误分类为'1',12%是由于大写'I'被误分类为'1'。
  • 该模型能够区分合理的误判(如'O'被误认为'0','S'被误认为'5')与明显错误,从而改善对密度估计器质量的评估。
  • 使用类特定潜在高斯分布可缓解单高斯流模型中类间聚类区域之间出现虚假高密度区域的问题,这是已知的局限性。
  • 在潜在密度收敛至高斯分布的假设下,该框架可证明地界定了开放集风险,为不确定性校准提供了理论基础。
  • 该模型可自然扩展至多项式噪声模型下的多类识别任务,使用狄利克雷共轭先验,尽管该场景下的形式化不确定性量化仍是未来工作的方向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。