Skip to main content
QUICK REVIEW

[论文解读] Bayesian Autoencoders: Analysing and Fixing the Bernoulli likelihood for Out-of-Distribution Detection

Bang Xiang Yong, Tim Pearce|arXiv (Cornell University)|Jul 28, 2021
Anomaly Detection Techniques and Applications参考文献 15被引用 5
一句话总结

本文指出变分自编码器中的伯努利似然函数是导致分布外(OOD)检测不可靠的关键原因,这是由于图像中高比例零像素造成的混淆。本文提出两种解决方案:通过贝叶斯自编码器(BAE)估计对数似然估计的主观不确定性,以及改用高斯似然函数。这两种方法在MNIST与FashionMNIST数据集上的AUROC均超过0.98,优于标准似然函数方法。

ABSTRACT

After an autoencoder (AE) has learnt to reconstruct one dataset, it might be expected that the likelihood on an out-of-distribution (OOD) input would be low. This has been studied as an approach to detect OOD inputs. Recent work showed this intuitive approach can fail for the dataset pairs FashionMNIST vs MNIST. This paper suggests this is due to the use of Bernoulli likelihood and analyses why this is the case, proposing two fixes: 1) Compute the uncertainty of likelihood estimate by using a Bayesian version of the AE. 2) Use alternative distributions to model the likelihood.

研究动机与目标

  • 调查为何标准变分自编码器在MNIST与FashionMNIST等图像数据集上无法实现OOD检测。
  • 识别伯努利似然函数为根本原因,因其与像素数据分布不兼容,尤其是高比例零像素的情况。
  • 提出两种实用解决方案:估计对数似然估计的主观不确定性,以及使用替代似然函数(如高斯分布)。
  • 评估贝叶斯推理方法(如MC-Dropout、Bayes-by-Backprop、锚定集成)在自编码器中不确定性估计的性能。
  • 证明将不确定性估计与似然估计相结合可显著提升OOD检测的AUROC表现。

提出的方法

  • 通过将贝叶斯规则应用于自编码器参数,提出贝叶斯自编码器(BAE),实现对权重的后验推断。
  • 采用近似推断技术——MC-Dropout、Bayes-by-Backprop、SGHMC以及锚定集成——从后验分布中采样。
  • 引入对数似然估计的不确定性,即Var_θ(LL),作为新的OOD评分,通过从后验权重中进行蒙特卡洛采样计算。
  • 将伯努利似然替换为高斯似然(N(𝐱̂*,1))和连续伯努利(C-Ber),以测试对像素域不匹配的鲁棒性。
  • 利用单个模型的重要性采样估计主观不确定性,避免使用集成模型的需求。
  • 在标准基准数据集(MNIST与FashionMNIST,SVHN与CIFAR10)上,使用AUROC评估OOD检测性能。

实验结果

研究问题

  • RQ1为何伯努利似然函数在自编码器中对OOD检测失效,尤其是在MNIST与FashionMNIST上?
  • RQ2图像中零像素的比例是否会导致伯努利似然函数难以区分分布内与分布外样本?
  • RQ3对数似然估计的主观不确定性(Var_θ(LL))能否作为可靠的OOD检测评分?
  • RQ4即使其支持不匹配像素值,改用高斯似然是否能提升OOD检测性能?
  • RQ5通过贝叶斯推理方法(如锚定集成)进行不确定性估计,是否能优于标准似然函数方法?

主要发现

  • 伯努利似然函数在MNIST与FashionMNIST上的OOD检测中失效,AUROC < 0.5,这是由于图像中高比例零像素造成的混淆。
  • 连续伯努利似然函数也无法解决此问题,表现相似差(AUROC ≈ 0.31)。
  • 改用高斯似然函数后,所有模型的AUROC从~0.30提升至0.98,即使存在领域不匹配,也表现出显著鲁棒性。
  • 对数似然估计的不确定性Var_θ(LL)在所有模型上均实现AUROC > 0.98,包括使用伯努利似然的模型,显著优于均值似然𝔼_θ(LL)。
  • 锚定集成与Var_θ(LL)结合在MNIST与FashionMNIST上的AUROC达到最高值0.995,显著优于标准似然函数方法。
  • 从单个模型进行重要性采样已足够估计主观不确定性,使该方法在无需完整集成的情况下仍具备可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。