Skip to main content
QUICK REVIEW

[论文解读] Energy-based Out-of-distribution Detection

Weitang Liu, Xiaoyun Wang|arXiv (Cornell University)|Oct 8, 2020
Adversarial Robustness in Machine Learning参考文献 48被引用 430
一句话总结

本文提出了一种用于 OOD 检测的能量分数,它在性能上优于基于 softmax 的方法,并展示了如何在推理阶段将能量用作评分函数,或将其作为可训练目标来塑造能量分布,从而更好地区分分布内数据与 OOD 数据。

ABSTRACT

Determining whether inputs are out-of-distribution (OOD) is an essential building block for safely deploying machine learning models in the open world. However, previous methods relying on the softmax confidence score suffer from overconfident posterior distributions for OOD data. We propose a unified framework for OOD detection that uses an energy score. We show that energy scores better distinguish in- and out-of-distribution samples than the traditional approach using the softmax scores. Unlike softmax confidence scores, energy scores are theoretically aligned with the probability density of the inputs and are less susceptible to the overconfidence issue. Within this framework, energy can be flexibly used as a scoring function for any pre-trained neural classifier as well as a trainable cost function to shape the energy surface explicitly for OOD detection. On a CIFAR-10 pre-trained WideResNet, using the energy score reduces the average FPR (at TPR 95%) by 18.03% compared to the softmax confidence score. With energy-based training, our method outperforms the state-of-the-art on common benchmarks.

研究动机与目标

  • 在开放世界部署中阐明对可靠 OOD 检测的需求。
  • 提出一个与输入密度相关联、用于区分分布内数据与 OOD 数据的基于能量的框架。
  • 展示如何在不重新训练的情况下将能量分数用于预训练分类器,以及如何训练模型以增大分布内与 OOD 数据之间的能量差距。
  • 在 CIFAR-10/CIFAR-100 上使用 WideResNet 展示比 softmax 基分数更优的 OOD 检测性能。
  • 就参数选择提供实际指导,并与现有方法(包括 Outlier Exposure 和基于 JEM 的方法)进行比较。

提出的方法

  • 定义一个能量函数 E(x;f) = -T log sum_i e^{f_i(x)/T},它源自一个判别分类器 f。
  • 使用 -E(x;f) 作为评分函数,通过对能量设定阈值来检测 OOD。
  • 证明对数 softmax 置信度是自由能的一个特例,解释为什么能量在 OOD 检测中可能优于 softmax。
  • 提供一个能量有界的学习目标,联合最小化标准交叉熵和基于铰链的能量正则项,以在分布内和 OOD 能量之间创建差距。
  • 使用具有边际 m_in 和 m_out 的两个铰链项,在带标签的 OOD 数据之外对未标记 OOD 数据进行微调,以使分布内能量低于 m_in,OOD 能量高于 m_out。
  • 证明在推理阶段能量基评分在参数上是无参数的(T=1),并比较有无微调情况下的推理时使用。

实验结果

研究问题

  • RQ1能量基分数是否能为 OOD 检测提供一个理论上有据、在实践中也更优的替代方案,相对于 softmax 置信度?
  • RQ2在不重新训练的情况下,使用预训练模型时,能量分数与 softmax 分数在标准 OOD 基准上的对比?
  • RQ3使用离群数据进行基于能量的微调是否在不牺牲分布内准确性的前提下改善 OOD 检测?
  • RQ4温度缩放与能量边际参数对 OOD 检测性能的影响是怎样的?
  • RQ5基于能量的 OOD 检测在性能和训练稳定性方面,与基于生成模型的和混合方法相比如何?

主要发现

  • 在 CIFAR-10 上使用 WideResNet 时,能量分数在 OOD 检测上的表现优于 softmax 置信度,且在未微调的情况下平均将 FPR95 降低约 18.03%。
  • 使用未标记的离群数据进行基于能量的微调进一步改善 OOD 指标,在 CIFAR-10/CIFAR-100 上比 Outlier Exposure 下降最多 10.55% 的 FPR95,同时保持准确性。
  • 负能量分数相较于 softmax 分数,在分布内数据与 OOD 数据之间提供更易区分的分离,如能量分布更平滑所示。
  • 在多个 OOD 基准(iSUN、Places365、Texture、SVHN、LSUN 变体)上,基于能量的方法在 AUROC 和 AUPR 上与基线相比具有竞争力甚至更优,涵盖判别式 OOD 检测器和一些生成模型方法。
  • 温度缩放(T>1)会降低基于能量的 OOD 检测性能,表明 T=1 更适合该方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。