Skip to main content
QUICK REVIEW

[论文解读] Latent space conditioning for improved classification and anomaly detection

Erik Norlander, Alexandros Sopasakis|arXiv (Cornell University)|Nov 24, 2019
Anomaly Detection Techniques and Applications参考文献 26被引用 13
一句话总结

本文提出条件潜在空间变分自编码器(CL-VAE),通过在已知类别标签上条件化 VAE 的潜在空间,并使用每类的高斯混合模型(GMM)先验,提升了聚类与异常检测性能。在 MNIST 和真实交易数据上,该方法在类别不平衡或数据噪声较大的无监督设置下,优于标准 VAE 及既有的异常检测方法。

ABSTRACT

We propose a new type of variational autoencoder to perform improved pre-processing for clustering and anomaly detection on data with a given label. Anomalies however are not known or labeled. We call our method conditional latent space variational autonencoder since it separates the latent space by conditioning on information within the data. The method fits one prior distribution to each class in the dataset, effectively expanding the prior distribution to include a Gaussian mixture model. Our approach is compared against the capabilities of a typical variational autoencoder by measuring their V-score during cluster formation with respect to the k-means and EM algorithms. For anomaly detection, we use a new metric composed of the mass-volume and excess-mass curves which can work in an unsupervised setting. We compare the results between established methods such as as isolation forest, local outlier factor and one-class support vector machine.

研究动机与目标

  • 解决现实数据中类别不平衡、缺失值、误标及类别重叠带来的聚类与异常检测挑战。
  • 通过在已知类别标签上条件化 VAE 的潜在空间,提升无监督性能,实现更优的数据分布分离。
  • 开发一种在降维的同时保留关系特征信息的方法,以支持下游分析。
  • 使用新型指标(如无监督设置下的 EM-MV 异常检测指标与 V-score 聚类指标)对方法进行评估。
  • 在包含 MNIST 与具有固有数据质量问题的真实交易数据等多样化、真实数据集上展示方法的有效性。

提出的方法

  • 通过为每类拟合独立的先验分布(高斯分布),实现对潜在空间的类别条件化,形成高斯混合模型(GMM)先验。
  • 修改标准 VAE 损失函数,引入类别特定的 KL 散度正则化,确保每类的潜在表示符合其指定的先验。
  • 编码器将输入数据映射为潜在向量,解码器则从潜在码重建输入,以最小化重建误差。
  • 采用类别条件先验分布,使模型能够在不假设单一共享先验的前提下,学习每类独立的潜在流形。
  • 在条件化后的潜在空间上应用 k-means 与 EM 聚类算法,通过 V-score 指标评估聚类性能。
  • 针对异常检测,提出 EM-MV 指标,结合质量-体积曲线与超额质量曲线,用于评估无监督设置下的性能。

实验结果

研究问题

  • RQ1在已知类别标签上条件化 VAE 潜在空间是否能相比标准 VAE 提升聚类性能?
  • RQ2在无监督设置下,CL-VAE 是否优于 Isolation Forest、LOF 与 One-Class SVM 等成熟异常检测方法?
  • RQ3所提出的 EM-MV 指标在无标签异常的情况下,评估异常检测性能的有效性如何?
  • RQ4在现实应用中,CL-VAE 对类别不平衡、误标与缺失特征等问题的处理能力如何?
  • RQ5当潜在空间被降维至二维以用于可视化与分析时,CL-VAE 是否能保持或提升性能?

主要发现

  • 与标准 VAE 相比,CL-VAE 在 MNIST 与真实交易数据上使用 k-means 与 EM 算法时,V-score 指标显著提升了聚类性能。
  • 在 MNIST 数据集上,CL-VAE 的 V-score 高于基线 VAE,表明聚类分离性与纯度更优。
  • EM-MV 指标在无监督设置下表现出色,能有效检测异常,在真实交易数据集上优于 Isolation Forest、LOF 与 One-Class SVM。
  • 该方法能有效应对类别不平衡与误标问题,在现实应用中表现出强鲁棒性。
  • 潜在空间的条件化有助于更好地解耦类别特异性特征,从而提升下游聚类与异常检测性能。
  • 使用类别特定的 GMM 先验使模型能比单一高斯先验更有效地捕捉复杂、多模态的数据分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。