Skip to main content
QUICK REVIEW

[论文解读] Predictive Uncertainty Quantification with Compound Density Networks

Agustinus Kristiadi, Däubener, Sina|arXiv (Cornell University)|Feb 4, 2019
Adversarial Robustness in Machine Learning参考文献 42被引用 11
一句话总结

本文提出复合密度网络(CDNs),一种连续的、输入相关的混合模型,通过神经网络参数化组件分布及在不可数多个组件上自适应的、与输入相关的混合权重,对混合密度网络进行了推广。与贝叶斯神经网络和深度集成相比,CDNs在对抗性样本(尤其是FGSM攻击)下表现出更优的不确定性量化能力和鲁棒性,变分贝叶斯训练使模型能够通过预测熵增加来检测分布外(OOD)和对抗性输入。

ABSTRACT

Despite the huge success of deep neural networks (NNs), finding good mechanisms for quantifying their prediction uncertainty is still an open problem. Bayesian neural networks are one of the most popular approaches to uncertainty quantification. On the other hand, it was recently shown that ensembles of NNs, which belong to the class of mixture models, can be used to quantify prediction uncertainty. In this paper, we build upon these two approaches. First, we increase the mixture model's flexibility by replacing the fixed mixing weights by an adaptive, input-dependent distribution (specifying the probability of each component) represented by NNs, and by considering uncountably many mixture components. The resulting class of models can be seen as the continuous counterpart to mixture density networks and is therefore referred to as compound density networks (CDNs). We employ both maximum likelihood and variational Bayesian inference to train CDNs, and empirically show that they yield better uncertainty estimates on out-of-distribution data and are more robust to adversarial examples than the previous approaches.

研究动机与目标

  • 为解决深度神经网络中可靠预测不确定性量化的挑战,特别是针对分布外(OOD)和对抗性输入。
  • 通过引入更灵活的连续混合模型架构,超越现有的贝叶斯神经网络和深度集成方法。
  • 构建一个框架,通过连续的、输入相关的预测分布混合,同时捕捉认知不确定性与偶然不确定性。
  • 评估不确定性估计在对抗性攻击下的鲁棒性,并与最先进基线方法进行性能比较。

提出的方法

  • CDNs将预测分布建模为不可数个组件分布的连续混合,其参数由一个神经超网络输出的模型参数分布来参数化。
  • 混合分布为输入相关,通过神经网络建模,实现基于输入上下文的自适应组件加权。
  • 通过在CDN框架下优化预测分布的对数似然,执行最大似然训练。
  • 应用变分贝叶斯推断以学习CDN参数的后验分布,从而实现对模型权重和预测的不确定性量化。
  • 该方法使用超网络生成预测网络的参数(例如均值和方差),并基于输入条件生成,从而实现灵活的、与输入相关的不确定性估计。
  • 该框架应用于前馈网络,并在MNIST、Fashion-MNIST和CIFAR-10上进行评估,使用FGSM对抗性样本和OOD数据。

实验结果

研究问题

  • RQ1与离散混合模型和贝叶斯基线相比,连续的、输入相关的混合模型是否能提升深度神经网络中的不确定性量化?
  • RQ2CDNs在通过预测熵增加来检测分布外输入方面表现如何?
  • RQ3CDNs在对抗性样本攻击下,尤其是FGSM攻击下,增强了多大程度的鲁棒性?
  • RQ4CDNs的变分贝叶斯训练是否能带来更好的认知不确定性估计,并提升对分布偏移的检测能力?

主要发现

  • 在扰动强度高达1.0的对抗性MNIST样本上,ML-CDN的准确率显著高于所有基线模型,同时预测熵持续上升。
  • VB-CDN在MNIST和Fashion-MNIST上与深度概率网络(DPN)基线的不确定性估计相当或更优,同时准确率更高,且训练期间无需额外的OOD数据。
  • ML-CDN和VB-CDN均表现出对对抗性攻击的强鲁棒性:在每轮训练迭代中使用10次梯度更新时,ML-CDN在强FGSM扰动下仍保持超过70%的准确率。
  • 当通过多次前向-反向传播生成对抗性样本(更强攻击)时,CDNs的性能仅轻微下降,表明其具有高度鲁棒性。
  • 在CIFAR-10上,VB-CDN实现了具有竞争力的性能,证明了该方法在更复杂视觉基准上的可扩展性。
  • CDNs能有效捕捉分布外数据的不确定性,对分布外样本表现出高熵,同时对分布内输入仍保持高置信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。