Skip to main content
QUICK REVIEW

[论文解读] How Useful are Gradients for OOD Detection Really?

Conor Igoe, Youngseog Chung|arXiv (Cornell University)|May 20, 2022
Anomaly Detection Techniques and Applications被引用 7
一句话总结

本文挑战了梯度在分布外(OOD)检测中不可或缺的假设,表明基于梯度的方法表现良好主要归因于特征嵌入的幅值和预测类别概率,而非梯度信息本身。本文提出了一种非梯度的OOD检测框架,通过融合这两个分量,在准确率和效率上均优于现有方法。

ABSTRACT

One critical challenge in deploying highly performant machine learning models in real-life applications is out of distribution (OOD) detection. Given a predictive model which is accurate on in distribution (ID) data, an OOD detection system will further equip the model with the option to defer prediction when the input is novel and the model has little confidence in prediction. There has been some recent interest in utilizing the gradient information in pre-trained models for OOD detection. While these methods have shown competitive performance, there are misconceptions about the true mechanism underlying them, which conflate their performance with the necessity of gradients. In this work, we provide an in-depth analysis and comparison of gradient based methods and elucidate the key components that warrant their OOD detection performance. We further propose a general, non-gradient based method of OOD detection which improves over previous baselines in both performance and computational efficiency.

研究动机与目标

  • 探究梯度是否在深度学习模型中真正必要于有效的OOD检测。
  • 识别现有基于梯度的OOD检测方法性能背后的实际驱动因素。
  • 开发一种非梯度的OOD检测框架,以提升性能和计算效率。
  • 挑战关于基于梯度的方法为何有效的主流直觉,特别是梯度幅值在检测OOD输入中的作用。
  • 提供实证和理论证据,证明特征嵌入幅值和输出概率分布是OOD检测性能的关键驱动因素。

提出的方法

  • 作者将多种基于梯度的OOD检测方法进行分析与简化,转化为可解释的形式,揭示其性能源于最后一层特征嵌入的幅值和预测类别概率。
  • 提出一种通用的评分函数框架,结合最后一层特征的L2范数(U项)和预测类别概率分布(V项),完全不依赖梯度信息。
  • 所提出的方法名为BatchGrad,其损失函数基于最后一层梯度的范数来优化评分函数,但作者证明该机制对性能并非必需。
  • 在多个基准数据集上评估该框架,包括MNIST、CIFAR-10、SVHN和ImageNet,以AUROC为主要指标。
  • 在深度和浅层网络变体中进行测试,以隔离梯度计算的贡献,结果表明浅层梯度(仅最后一层)优于深层梯度。
  • 通过消融研究和与最先进基线方法(包括ExGrad、MSP和GradNorm)的对比,验证了该框架的有效性。

实验结果

研究问题

  • RQ1基于梯度的OOD检测器的性能是否真正源于梯度信息,还是其他分量更具影响力?
  • RQ2能否通过融合特征嵌入幅值和预测概率分布,实现一种非梯度的OOD检测方法并取得更优性能?
  • RQ3如果梯度空间不包含OOD检测所必需的独特或关键信息,为何基于梯度的方法仍表现良好?
  • RQ4与深层梯度相比,最后一层梯度是否为OOD检测提供了更具信息量的信号?
  • RQ5模型容量和任务难度在多大程度上影响是否需要同时使用特征嵌入和输出概率以实现有效的OOD检测?

主要发现

  • 仅计算最后一层梯度的浅层BatchGrad在小规模基准上达到0.925 ± 0.044的AUROC,优于深层BatchGrad(0.787 ± 0.224)。
  • 基于梯度的方法的性能主要由最后一层特征嵌入的幅值和预测类别概率驱动,而非梯度信息本身。
  • 一种不依赖梯度、融合最后一层特征L2范数与预测类别概率的检测方法,在多个OOD检测基准上达到最先进性能。
  • 研究发现,对于较简单任务(如MNIST、CIFAR-10),仅依赖预测概率分布(V项)已足够;而对于更复杂任务(如ImageNet),则需要同时使用特征嵌入和输出概率。
  • 结果否定了梯度对OOD检测必不可少的假设,表明梯度计算并非必需,可被更简单、更高效的组件替代。
  • 作者证明GradNorm的成功并非源于梯度利用,而是其对特征编码与输出分布信息的融合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。