Skip to main content
QUICK REVIEW

[论文解读] Density of States Estimation for Out-of-Distribution Detection

Warren R. Morningstar, Cusuh Ham|arXiv (Cornell University)|Jun 16, 2020
Anomaly Detection Techniques and Applications参考文献 31被引用 14
一句话总结

本文提出了一种名为DoSE的新方法,这是一种无监督的分布外(OOD)检测方法,利用统计物理中的态密度(density of states)概念来评估模型统计量的典型性,而非依赖于似然度。通过在预训练模型的汇总统计量上使用非参数密度估计器,DoSE在无需标注数据或OOD样本的情况下,实现了OOD基准上的最先进性能。

ABSTRACT

Perhaps surprisingly, recent studies have shown probabilistic model likelihoods have poor specificity for out-of-distribution (OOD) detection and often assign higher likelihoods to OOD data than in-distribution data. To ameliorate this issue we propose DoSE, the density of states estimator. Drawing on the statistical physics notion of ``density of states,'' the DoSE decision rule avoids direct comparison of model probabilities, and instead utilizes the ``probability of the model probability,'' or indeed the frequency of any reasonable statistic. The frequency is calculated using nonparametric density estimators (e.g., KDE and one-class SVM) which measure the typicality of various model statistics given the training data and from which we can flag test points with low typicality as anomalous. Unlike many other methods, DoSE requires neither labeled data nor OOD examples. DoSE is modular and can be trivially applied to any existing, trained model. We demonstrate DoSE's state-of-the-art performance against other unsupervised OOD detectors on previously established ``hard'' benchmarks.

研究动机与目标

  • 解决基于似然度的方法在OOD检测中失效的问题,即分布外输入有时会被赋予比分布内数据更高的似然度。
  • 开发一种方法,通过使用多种汇总统计量来衡量测试样本相对于训练数据的典型性,避免直接比较似然度。
  • 构建一个模块化、无监督的OOD检测框架,可适用于任何预训练生成模型,且无需微调或超参数调优。
  • 证明:通过训练分布中统计量的频率来衡量的典型性,作为OOD指标比模型似然度更可靠。

提出的方法

  • DoSE使用非参数密度估计器(如核密度估计,KDE)和单类SVM,对分布内数据的各种汇总统计量估计态密度(DOS)。
  • 通过测量测试样本在估计的DOS下统计量的典型性来评估其表现,将低支持区域的点标记为OOD。
  • 该方法具有模块化特性,可通过提取模型统计量(如潜在表示、对数似然或分量统计量)应用于任何预训练生成模型(如β-VAEs和Glow)。
  • 通过关注观测统计量在训练集中的频率,避免了直接比较似然度,与统计物理中的典型性概念一致。
  • 使用多种统计量(如范数、第一维坐标、最大坐标)以提高鲁棒性,并检测那些似然度高但典型性低的OOD输入。
  • 该方法无需标注数据或访问OOD样本,因此适用于真实场景中此类数据不可用的情况。

实验结果

研究问题

  • RQ1训练分布中模型统计量的频率能否作为比模型似然度更可靠的OOD检测信号?
  • RQ2为何基于似然度的方法在OOD检测中会失效,特别是在OOD数据被赋予比分布内数据更高似然度时?
  • RQ3基于典型性(通过统计量的非参数密度估计测量)的方法能否在OOD检测中超越基于似然度的基线方法?
  • RQ4所提出的DoSE方法在多样化的数据集配对中(包括CIFAR-10与SVHN或CelebA与CIFARs等挑战性基准)是否具有鲁棒性?
  • RQ5DoSE能否在无需OOD样本或类别标签的情况下,实现无监督OOD检测方法中的最先进性能?

主要发现

  • 在标准基准上,DoSE在无监督OOD检测方法中实现了最先进性能,优于基于似然度的基线方法(如TT和WAIC)。
  • 在具有挑战性的CIFAR-10 → SVHN和CelebA → CIFARs基准上,DoSE保持了高AUROC分数,而TT因仅依赖似然度导致AUROC ≈ 0.6而失败。
  • DoSE成功识别出那些似然度异常高但统计特征不典型的OOD样本,例如高对比度色彩或不规则纹理的图像。
  • 该方法在多样化数据集配对中表现出鲁棒性,且不受基于似然度方法的根本性限制影响,后者可能将高似然度的OOD数据误判为分布内数据。
  • 定性分析表明,DoSE会将高对比度或异常色彩模式的图像标记为OOD,表明其对有意义的统计偏差具有敏感性。
  • 尽管完全无监督且无需OOD样本或标签,DoSE的性能仍可与最先进的监督方法相媲美。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。