Skip to main content
QUICK REVIEW

[论文解读] Out-of-distribution Detection via Frequency-regularized Generative Models

Mu Cai, Yixuan Li|arXiv (Cornell University)|Aug 18, 2022
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文提出频率正则化学习(FRL),一种即插即用的框架,通过在训练过程中引入高频图像分量,提升深度生成模型在分布外(OOD)检测中的性能。通过正则化模型关注语义细节而非背景纹理,FRL在VAE、GLOW和PixelCNN++等架构中均显著提升OOD检测表现,在CelebA数据集上实现SOTA的AUROC结果,较Likelihood Regret基线提升10.7%,且推理速度提升147倍。

ABSTRACT

Modern deep generative models can assign high likelihood to inputs drawn from outside the training distribution, posing threats to models in open-world deployments. While much research attention has been placed on defining new test-time measures of OOD uncertainty, these methods do not fundamentally change how deep generative models are regularized and optimized in training. In particular, generative models are shown to overly rely on the background information to estimate the likelihood. To address the issue, we propose a novel frequency-regularized learning FRL framework for OOD detection, which incorporates high-frequency information into training and guides the model to focus on semantically relevant features. FRL effectively improves performance on a wide range of generative architectures, including variational auto-encoder, GLOW, and PixelCNN++. On a new large-scale evaluation task, FRL achieves the state-of-the-art performance, outperforming a strong baseline Likelihood Regret by 10.7% (AUROC) while achieving 147$ imes$ faster inference speed. Extensive ablations show that FRL improves the OOD detection performance while preserving the image generation quality. Code is available at https://github.com/mu-cai/FRL.

研究动机与目标

  • 为解决深度生成模型对分布外(OOD)样本赋予高似然值的问题,尤其是因过度依赖背景特征所致。
  • 通过在频率域进行正则化以根本性地改变模型训练方式,而不改变推理时的测试流程,从而提升OOD检测性能。
  • 在不牺牲图像生成质量的前提下,通过最小化、可泛化的训练修改,提升OOD检测性能。
  • 在CIFAR-10等标准基准之外的大规模、高分辨率数据集上,验证基于频率的正则化方法的有效性。

提出的方法

  • FRL框架在训练过程中向输入图像添加一个额外的高频通道,该通道通过原始图像的傅里叶变换与高通滤波生成。
  • 该高频分量作为正则化项,促使生成模型关注物体轮廓与语义细节,而非低频背景模式。
  • 该方法与模型架构无关,可轻松应用于VAE、基于流的模型(如GLOW)以及自回归模型(如PixelCNN++),仅需修改输入通道数,改动极小。
  • 推理时,将原始图像与其中的高频表示拼接,模型基于组合输入计算似然,生成OOD得分。
  • 该方法基于经典信号处理原理:高频分量编码结构与语义内容,而不仅是噪声或背景。
  • 基础生成模型的训练目标保持不变;FRL仅添加基于频率的正则化项,不修改似然目标,也无需在推理时进行在线优化。

实验结果

研究问题

  • RQ1通过在训练中引入高频图像分量对深度生成模型进行正则化,能否提升其区分分布内与分布外样本的能力?
  • RQ2强调高频特征是否能减少模型对背景纹理的过度依赖,从而降低OOD数据的似然值?
  • RQ3一种简单、即插即用的频率正则化技术,能否在多种生成架构中实现SOTA的OOD检测性能?
  • RQ4FRL框架在提升OOD检测性能的同时,是否仍能保持高质量的图像生成能力?
  • RQ5FRL能否在高分辨率、大规模数据集(如CelebA)上有效扩展,克服以往方法在计算瓶颈上的限制?

主要发现

  • 在CelebA数据集上,FRL的AUROC较强基线Likelihood Regret高出10.7%,在OOD检测任务中达到SOTA性能。
  • FRL的推理速度较Likelihood Regret快147倍,后者需在推理时进行在线优化,因此FRL更适合实时应用场景。
  • 在GLOW模型上,FRL在CIFAR-10上的AUROC较最佳基线Input Complexity提升7.5%,在多个OOD基准测试中表现优异。
  • 消融实验表明,高频正则化对性能提升至关重要,若移除该组件,OOD检测准确率显著下降。
  • 该方法在标准度量下保持了高保真度的图像生成质量,表明生成能力未受影响。
  • FRL是首个在高分辨率数据集(如CelebA)上实现优异OOD检测性能的方法,突破了以往主要局限于CIFAR-10和Fashion-MNIST等基准的局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。