Skip to main content
QUICK REVIEW

[论文解读] Deterministic Neural Networks with Inductive Biases Capture Epistemic and Aleatoric Uncertainty

Jishnu Mukhoti, Andreas Kirsch|arXiv (Cornell University)|Feb 23, 2021
Adversarial Robustness in Machine Learning参考文献 51被引用 16
一句话总结

该论文提出一种具有归纳偏置的确定性神经网络,通过结合高斯判别分析的特征空间密度与Softmax熵,同时捕捉认知不确定性(epistemic)和随机不确定性(aleatoric)。该方法在无需微调的情况下,于CIFAR-10与SVHN的分布外(OoD)检测任务中实现了98%的AUROC,达到SOTA性能,优于深度集成(Deep Ensembles)及其他单前向传播方法。其优势源于通过结构化归纳偏置可靠建模不确定性,而非依赖集成平均。

ABSTRACT

We show that a single softmax neural net with minimal changes can beat the uncertainty predictions of Deep Ensembles and other more complex single-forward-pass uncertainty approaches. Standard softmax neural nets suffer from feature collapse and extrapolate arbitrarily for OoD points. This results in arbitrary softmax entropies for OoD points which can have high entropy, low, or anything in between, thus cannot capture epistemic uncertainty reliably. We prove that this failure lies at the core of why Deep Ensemble Uncertainty works well. Instead of using softmax entropy, we show that with appropriate inductive biases softmax neural nets trained with maximum likelihood reliably capture epistemic uncertainty through their feature-space density. This density is obtained using simple Gaussian Discriminant Analysis, but it cannot represent aleatoric uncertainty reliably. We show that it is necessary to combine feature-space density with softmax entropy to disentangle uncertainties well. We evaluate the epistemic uncertainty quality on active learning and OoD detection, achieving SOTA ~98 AUROC on CIFAR-10 vs SVHN without fine-tuning on OoD data.

研究动机与目标

  • 解决标准Softmax网络因特征坍塌和对分布外(OoD)输入的任意外推而导致无法可靠建模认知不确定性的缺陷。
  • 识别出深度集成(Deep Ensemble)不确定性成功的关键在于其对特征空间密度的隐式建模,而非仅依赖Softmax熵。
  • 提出一种方法,通过高斯判别分析(Gaussian Discriminant Analysis)显式建模特征空间密度,以在单次前向传播中捕捉认知不确定性。
  • 通过结合特征空间密度与Softmax熵,实现对认知不确定性与随机不确定性的有效解耦,从而提升不确定性校准性能。
  • 在主动学习与OoD检测基准上实现SOTA性能,且无需对OoD数据进行微调。

提出的方法

  • 训练一个标准的Softmax神经网络,采用最大似然方法,以保留防止特征坍塌的归纳偏置,从而实现稳定的特征空间密度估计。
  • 利用来自高斯判别分析(GDA)的特征空间密度估计认知不确定性,该方法对最终隐藏层的类条件密度进行建模。
  • 将随机不确定性计算为网络最终层预测的Softmax熵。
  • 将两种不确定性分量——特征空间密度与Softmax熵——合并为统一的不确定性得分,以实现对认知与随机不确定性来源的有效解耦。
  • 将合并后的不确定性得分用于主动学习与OoD检测,避免使用集成平均或OoD微调。
  • 利用GDA-based密度对OoD输入具有鲁棒性,而Softmax熵可捕捉数据不确定性,从而实现可靠的不确定性量化。

实验结果

研究问题

  • RQ1为何标准Softmax网络在处理OoD输入时无法可靠建模认知不确定性?
  • RQ2能否通过显式建模特征空间密度,使单次前向传播方法在不确定性估计上超越深度集成(Deep Ensembles)?
  • RQ3如何在不依赖集成平均的前提下,有效解耦确定性神经网络中的认知与随机不确定性?
  • RQ4高斯判别分析在多大程度上能提升标准神经网络架构的不确定性校准性能?
  • RQ5能否在不微调OoD数据的情况下,使确定性网络实现SOTA的OoD检测性能?

主要发现

  • 标准Softmax网络因特征坍塌和对OoD输入的任意外推,无法可靠捕捉认知不确定性,导致OoD输入下Softmax熵不一致。
  • 深度集成(Deep Ensemble)不确定性成功的关键在于其对特征空间密度的隐式建模,而非仅依赖Softmax熵。
  • 通过高斯判别分析(GDA)显式建模特征空间密度,可在单次前向传播中实现可靠的认知不确定性估计。
  • 将特征空间密度与Softmax熵结合,能有效解耦认知与随机不确定性,显著提升不确定性校准性能。
  • 所提方法在CIFAR-10与SVHN的OoD检测任务中达到98% AUROC,创下新SOTA,且无需任何OoD微调。
  • 该方法在主动学习与OoD检测基准中,均优于深度集成(Deep Ensembles)及其他单前向传播不确定性方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。