Skip to main content
QUICK REVIEW

[论文解读] Average of Pruning: Improving Performance and Stability of Out-of-Distribution Detection

Zhen Cheng, Fei Zhu|arXiv (Cornell University)|Mar 2, 2023
Anomaly Detection Techniques and Applications被引用 6
一句话总结

本文提出了一种名为剪枝平均(Average of Pruning, AoP)的简单而有效的方法,通过结合模型平均与结构化剪枝,提升深度神经网络在分布外(OOD)检测中的稳定性和性能。通过模型平均平滑损失曲面,并通过剪枝减少过拟合,AoP在多种架构和数据集上均实现了稳定提升,AUROC显著提高,且对模型选择具有更强鲁棒性。

ABSTRACT

Detecting Out-of-distribution (OOD) inputs have been a critical issue for neural networks in the open world. However, the unstable behavior of OOD detection along the optimization trajectory during training has not been explored clearly. In this paper, we first find the performance of OOD detection suffers from overfitting and instability during training: 1) the performance could decrease when the training error is near zero, and 2) the performance would vary sharply in the final stage of training. Based on our findings, we propose Average of Pruning (AoP), consisting of model averaging and pruning, to mitigate the unstable behaviors. Specifically, model averaging can help achieve a stable performance by smoothing the landscape, and pruning is certified to eliminate the overfitting by eliminating redundant features. Comprehensive experiments on various datasets and architectures are conducted to verify the effectiveness of our method.

研究动机与目标

  • 研究深度神经网络在训练轨迹中OOD检测性能的不稳定性和过拟合问题。
  • 发现即使训练误差接近零,AUROC仍会出现过拟合和不稳定性,尤其是在训练后期。
  • 通过模型平均平滑损失曲面,降低对小权重扰动的敏感性,从而缓解不稳定性。
  • 通过剪枝消除分布内与分布外数据中常见的冗余和噪声特征,减轻过拟合。
  • 开发一种即插即用的模块AoP,无需修改现有检测头或训练流程即可增强OOD检测性能。

提出的方法

  • 在最终训练检查点上应用模型平均,使用在线模型权重的移动平均生成更平坦、更稳定的权重配置。
  • 在训练后应用剪枝,基于彩票假说(Lottery Ticket Hypothesis, LTH)并结合权重回溯,强制实现全局稀疏性,以去除冗余特征。
  • 将平均与剪枝相结合形成AoP,一种可应用于任意OOD检测方法的模块化增强方法。
  • 该方法基于理论分析,将L1正则化(通过LASSO实现)与减少过拟合相关联,从而支持将剪枝作为诱导稀疏性的机制。
  • 通过特征可视化和指标追踪(AUROC、AURC、FPR95)评估AoP对表征学习和检测性能的影响。
  • 在多个数据集(如CIFAR-10、LSUN)和架构(ResNet-18、VGG-16、WideResNet、MobileNet)上进行实验,以验证其泛化能力。

实验结果

研究问题

  • RQ1在深度神经网络的训练轨迹中,OOD检测性能(以AUROC衡量)如何演变?
  • RQ2为何当测试误差保持较低时,AUROC仍会显著下降或剧烈波动,尤其是在训练末期?
  • RQ3模型平均在多大程度上通过平滑损失曲面来稳定OOD检测性能?
  • RQ4剪枝如何通过消除分布内与分布外数据中共享的噪声特征来减少OOD检测中的过拟合?
  • RQ5像AoP这样简单且模块化的方法,是否能在多种架构和数据集上持续提升OOD检测性能?

主要发现

  • 即使测试误差稳定,OOD检测的AUROC在训练末期仍表现出不稳定性,表明模型选择不可靠。
  • 当训练在接近零训练误差后继续进行时,会发生OOD检测的过拟合,导致模型记忆分布内与分布外数据中共享的噪声特征。
  • 模型平均显著提升稳定性,降低对小权重扰动的敏感性,使最终检查点更具可靠性。
  • 通过LTH结合权重回溯的剪枝在迭代剪枝策略中表现最佳,优于随机剪枝和微调。
  • AoP在ResNet-18(CIFAR-10)上将AUROC提升0.72点,在WideResNet-40-2上提升0.40点,且在所有评估架构中均实现一致增益。
  • AoP还提升了误分类检测性能,将WideResNet-40-2的AUROC从93.58%提升至93.98%,并将FPR95从40.03%降低至36.07%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。