Skip to main content
QUICK REVIEW

[论文解读] Anomaly scores for generative models

Václav Šmídl, Jan Bím|arXiv (Cornell University)|May 28, 2019
Anomaly Detection Techniques and Applications参考文献 38被引用 5
一句话总结

本文通过使用重参数化似然将数据分解为流形和残差分量,为生成模型(特别是变分自编码器(VAEs)和生成对抗网络(GANs))提出了一种理论基础坚实的异常分数。该方法将重建误差与潜在空间概率结合,形成一种计算高效的分数,在多个数据集上,无论是在有监督还是无监督的超参数选择中,其性能均优于标准的重建误差。

ABSTRACT

Reconstruction error is a prevalent score used to identify anomalous samples when data are modeled by generative models, such as (variational) auto-encoders or generative adversarial networks. This score relies on the assumption that normal samples are located on a manifold and all anomalous samples are located outside. Since the manifold can be learned only where the training data lie, there are no guarantees how the reconstruction error behaves elsewhere and the score, therefore, seems to be ill-defined. This work defines an anomaly score that is theoretically compatible with generative models, and very natural for (variational) auto-encoders as they seem to be prevalent. The new score can be also used to select hyper-parameters and models. Finally, we explain why reconstruction error delivers good experimental results despite weak theoretical justification.

研究动机与目标

  • 解决生成模型中将重建误差作为异常分数缺乏理论依据的问题。
  • 开发一种将重建误差与潜在空间概率统一的分数,且与VAEs和GANs兼容。
  • 在异常检测中实现可靠的超参数与模型选择,尤其在无标签异常的无监督设置下。
  • 提供一种计算上可行的替代方案,避免精确似然评估所需的高维积分。

提出的方法

  • 采用流形-残差分解重新表述生成模型,其中数据被建模为潜在空间的投影加上噪声。
  • 利用变量变换公式推导精确似然,实现异常分数的精确计算,且无需归一化常数。
  • 使用参数化编码器 $ g_{\phi} $ 和生成器 $ f_{\theta} $,其中 $ g_{\phi} $ 近似 $ f_{\theta} $ 的伪逆。
  • 通过利用相同的似然框架,将该分数应用于VAEs和GANs,避免仅依赖重建误差。
  • 通过似然最大化实现模型选择,即使在训练过程中未标注异常,也能实现。
  • 提出一种通过在潜在码 $ z' $ 上优化来改进归一化常数近似的方法,从而提升分数的准确性。

实验结果

研究问题

  • RQ1能否为生成模型推导出一种理论合理的异常分数,该分数结合了重建误差与潜在概率?
  • RQ2尽管理论基础薄弱,为何重建误差在实践中表现良好?
  • RQ3所提出的分数能否在无标签异常不可用的无监督异常检测中提升超参数选择性能?
  • RQ4该分数是否在有监督和无监督的模型选择场景中均优于重建误差?
  • RQ5低维流形假设是否有利于异常检测,其对性能有何影响?

主要发现

  • 当使用有标签异常选择超参数时,所提出的异常分数在所有测试问题中均显著优于重建误差的AUC表现。
  • 在无标签异常的无监督设置下,所提出的分数在十项问题中的九项上获得了高于重建误差的AUC。
  • 基于所提分数的异常检测性能在4至6个潜在维度时达到峰值,表明低维流形有利于建模。
  • 重建误差分数对潜在维度不敏感,而所提分数显示出明确的最优范围,支持流形假设。
  • 本文表明,重建误差在实践中表现优异,可能源于数据分布的有利对齐,而非理论稳健性。
  • 该方法即使在无标签异常的情况下,也能通过提供可靠的分数用于超参数调优,实现准确的模型选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。