Skip to main content
QUICK REVIEW

[论文解读] Hierarchical VAEs Know What They Don't Know

Jakob D. Havtorn, Jes Frellsen|arXiv (Cornell University)|Feb 16, 2021
Generative Adversarial Networks and Image Synthesis参考文献 49被引用 8
一句话总结

本文指出,层次化 VAE 在分布外(OOD)检测中失败的原因在于低层次特征(例如边缘)在不同数据集间具有泛化性,从而主导了似然估计,导致 OOD 数据的似然值过高。为解决此问题,本文提出一种新颖的、完全无监督的似然比评分方法,强制在所有层次的特征上保持分布内激活,从而在多个基准测试中实现了最先进的 OOD 检测性能。

ABSTRACT

Deep generative models have been demonstrated as state-of-the-art density estimators. Yet, recent work has found that they often assign a higher likelihood to data from outside the training distribution. This seemingly paradoxical behavior has caused concerns over the quality of the attained density estimates. In the context of hierarchical variational autoencoders, we provide evidence to explain this behavior by out-of-distribution data having in-distribution low-level features. We argue that this is both expected and desirable behavior. With this insight in hand, we develop a fast, scalable and fully unsupervised likelihood-ratio score for OOD detection that requires data to be in-distribution across all feature-levels. We benchmark the method on a vast set of data and model combinations and achieve state-of-the-art results on out-of-distribution detection.

研究动机与目标

  • 探究深度生成模型(尤其是层次化 VAE)为何在仅在单一分布上进行训练的情况下,仍会为分布外(OOD)数据分配比分布内数据更高的似然值。
  • 识别此失败的根本原因,特别是跨不同数据分布共享的泛化性低层次特征(例如边缘)所起的作用。
  • 开发一种快速、可扩展且完全无监督的 OOD 检测方法,避免依赖低层次特征主导似然估计。
  • 通过所提出的似然比评分,在多种数据与模型组合下,展示最先进的 OOD 检测性能。

提出的方法

  • 该方法引入一种似然比评分 $LLR^{>l}$,用于比较样本在模型完整后验下的似然值与其在每一层次 $l$ 的条件先验下的似然值。
  • 该评分确保样本在从顶层到底层 $l$ 的每一层次上都必须为分布内激活,从而防止低层次特征误导似然估计。
  • 该方法使用 1000 个样本的重要性采样来计算似然值,实现了稳定且可扩展的 OOD 检测,且无需使用标注的 OOD 数据。
  • 模型采用具有多层潜在变量的层次化 VAE 架构,其中每一层的后验分布均依赖于高层潜在变量,且先验在各层之间是可分解的。
  • 该方法使用标准指标(AUROC、AUPRC 和 FPR80)在多个数据集(包括 MNIST、FashionMNIST、CIFAR10 和 Omniglot)上评估 OOD 检测性能。

实验结果

研究问题

  • RQ1为何层次化 VAE 即使仅在单一分布上训练,仍会为分布外数据分配比分布内数据更高的似然值?
  • RQ2低层次特征(例如边缘)在多大程度上在不同数据集中具有泛化性,并主导层次化 VAE 中的似然估计?
  • RQ3一种强制在所有层次特征上实现分布内激活的似然比评分,能否提升 OOD 检测性能?
  • RQ4所提出的方法是否在完全无监督设置下实现了最先进的 OOD 检测性能,且无需使用 OOD 标签或样本?

主要发现

  • 在 FashionMNIST 上训练的 $LLR^{>1}$ 在 notMNIST 数据集上实现了 0.998 的 AUROC,优于标准似然值。
  • 在 MNIST 上训练的 $LLR^{>2}$ 在 Omniglot28x28 数据集上实现了完美的 AUROC(1.000)和 AUPRC(1.000),表明检测性能接近完美。
  • 对于在 CIFAR10 上训练的 HVAE,$LLR^{>1}$ 在 CIFAR100 OOD 集上实现了 0.835 的 AUROC 和 0.835 的 AUPRC,显著优于标准似然 $\mathcal{L}^{>1}$ 的 0.479 AUROC。
  • 在具有挑战性的 Omniglot28x28Inverted 数据集上,$LLR^{>1}$ 实现了 0.944 的 AUROC 和 0.953 的 AUPRC,而标准似然 $\mathcal{L}^{>1}$ 仅得 0.450 AUROC,表明该方法对分布偏移具有强鲁棒性。
  • 该方法在所有测试数据集和模型组合中均实现了最先进的性能,AUROC 分数在大多数基准上均高于 0.95,包括 KMNIST 上的 0.999 和 SmallNORB28x28 上的 1.000。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。