[论文解读] Quantification of Uncertainty with Adversarial Models
本文提出了对抗性模型的不确定性量化(QUAM)框架,这是一种新颖的方法,通过识别对抗性模型——即后验概率高但预测结果与参考模型显著不同的模型——来改进深度学习中的认知不确定性估计。QUAM通过聚焦于后验概率和差异性均较高的区域,减少了定义认知不确定性的积分近似误差,在视觉基准测试中优于深度集成网络(Deep Ensembles)和MC正则化(MC dropout)。
Quantifying uncertainty is important for actionable predictions in real-world applications. A crucial part of predictive uncertainty quantification is the estimation of epistemic uncertainty, which is defined as an integral of the product between a divergence function and the posterior. Current methods such as Deep Ensembles or MC dropout underperform at estimating the epistemic uncertainty, since they primarily consider the posterior when sampling models. We suggest Quantification of Uncertainty with Adversarial Models (QUAM) to better estimate the epistemic uncertainty. QUAM identifies regions where the whole product under the integral is large, not just the posterior. Consequently, QUAM has lower approximation error of the epistemic uncertainty compared to previous methods. Models for which the product is large correspond to adversarial models (not adversarial examples!). Adversarial models have both a high posterior as well as a high divergence between their predictions and that of a reference model. Our experiments show that QUAM excels in capturing epistemic uncertainty for deep learning models and outperforms previous methods on challenging tasks in the vision domain.
研究动机与目标
- 为了在高风险应用场景中改进深度学习模型的认知不确定性量化。
- 为解决现有方法(如深度集成网络和MC正则化)的局限性,这些方法仅关注后验采样,导致认知不确定性估计不佳。
- 提出对抗性模型的新概念——即后验概率高但与参考模型预测显著不同的模型——以捕捉认知不确定性估计中被积函数较大的区域。
- 实现对预选外部模型的不确定性量化,尤其适用于真实世界部署场景。
提出的方法
- QUAM将对抗性模型定义为在给定测试点处具有高后验概率且与参考模型预测差异显著的模型。
- 它将认知不确定性形式化为一个涉及差异函数和后验概率的积分,并聚焦于被积函数较大的区域。
- 通过优化方法识别对抗性模型,该方法最大化差异与后验概率的乘积,采用基于梯度的搜索策略。
- 该方法利用这些对抗性模型作为关键样本,以减少积分估计器的近似误差。
- 它使用一个参考模型,并搜索那些在训练数据上表现相当但对测试输入预测不同的模型。
- 该框架在MNIST和ImageNet等视觉任务上进行了评估,与深度集成网络、MC正则化和SG-HMC进行了比较。

实验结果
研究问题
- RQ1如何在深度神经网络中更准确地估计认知不确定性,尤其是在现有方法(如深度集成网络和MC正则化)失效的情况下?
- RQ2什么特征定义了一个对认知不确定性积分有显著贡献的模型,以及如何系统性地识别此类模型?
- RQ3对抗性模型(定义为后验概率高且差异性大)是否能改善认知不确定性积分的近似?
- RQ4在不确定性校准和分布外(OOD)检测方面,QUAM与现有不确定性量化基线相比表现如何?
主要发现
- QUAM通过聚焦于高被积函数区域而非仅高后验模式,显著降低了认知不确定性估计的近似误差。
- QUAM识别出的对抗性模型在特征使用和预测空间中表现出高度多样性,如对Softmax输出进行主成分分析(PCA)所显示。
- 对抗性模型的集成在预测空间中展现出比深度集成网络更宽的凸包,表明其预测多样性更高。
- 在MNIST上,QUAM约需120 GPU小时(每样本约4 GPU秒);在ImageNet上约需100 GPU小时(每样本约45 GPU秒)。
- QUAM在具有挑战性的视觉任务中优于深度集成网络和MC正则化,尤其在检测分布外样本方面表现更优。
- 该方法在对预选模型进行不确定性捕捉方面表现出色,适用于使用外部基础模型的真实世界部署场景。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。