Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Anomaly Detection via Deep Metric Learning with End-to-End Optimization

Selim F. Yilmaz, Süleyman S. Kozat|arXiv (Cornell University)|May 12, 2020
Anomaly Detection Techniques and Applications被引用 4
一句话总结

本文提出了一种用于无监督异常检测的端到端深度度量学习框架,通过联合优化数据投影与度量学习,提升异常数据与正常数据的分离效果。通过引入自监督数据蒸馏和困难正样本挖掘,该方法在14个真实世界数据集上实现了SOTA性能,AUC绝对提升达4.44%至11.74%,同时保持O(1)的推理复杂度。

ABSTRACT

We investigate unsupervised anomaly detection for high-dimensional data and introduce a deep metric learning (DML) based framework. In particular, we learn a distance metric through a deep neural network. Through this metric, we project the data into the metric space that better separates the anomalies from the normal data and reduces the effect of the curse of dimensionality for high-dimensional data. We present a novel data distillation method through self-supervision to remedy the conventional practice of assuming all data as normal. We also employ the hard mining technique from the DML literature. We show these components improve the performance of our model and significantly reduce the running time. Through an extensive set of experiments on the 14 real-world datasets, our method demonstrates significant performance gains compared to the state-of-the-art unsupervised anomaly detection methods, e.g., an absolute improvement between 4.44% and 11.74% on the average over the 14 datasets. Furthermore, we share the source code of our method on Github to facilitate further research.

研究动机与目标

  • 解决在高维数据中无监督异常检测的挑战,其中标注异常样本成本高昂或不可用。
  • 克服先前两阶段方法中解耦的降维与建模步骤导致的次优性能。
  • 通过学习一种能更好分离异常与正常实例的度量空间,减少误报并提高鲁棒性。
  • 通过距离中心评分函数实现O(1)时间与内存复杂度,支持高效推理。
  • 提供一种通用且可适应的框架,通过模块化神经网络架构支持多种数据类型。

提出的方法

  • 该方法采用深度神经网络将输入数据投影到学习到的度量空间,使正常实例彼此更接近。
  • 使用基于相似性的损失函数,最小化相似实例间的距离,同时最大化不相似实例间的距离,实现端到端优化。
  • 提出一种新颖的自监督数据蒸馏技术,每轮训练仅选择模型置信度最高的正常实例进行训练,提升对异常值的鲁棒性。
  • 通过聚焦于距离度量空间中心最远的最具挑战性的正常实例,实施困难正样本挖掘,以增强判别能力。
  • 异常得分通过计算每个实例到蒸馏后正常数据质心的L2距离获得,实现O(1)推理时间与内存复杂度。
  • 该框架可适配不同数据模态:图像使用CNN,时间序列使用RNN,其他架构通过模块化设计实现。

实验结果

研究问题

  • RQ1与传统两阶段方法相比,端到端深度度量学习能否提升无监督异常检测的性能?
  • RQ2当训练数据中包含未知异常时,自监督数据蒸馏如何增强模型的鲁棒性?
  • RQ3在无标签条件下,困难正样本挖掘对模型泛化能力与性能有何影响?
  • RQ4所提方法是否在多种数据类型上均保持O(1)的推理复杂度,实现高效率?
  • RQ5该方法在异常率与数据分布各异的数据集上,泛化能力如何?

主要发现

  • 与SOTA无监督异常检测方法相比,该方法在14个真实世界数据集上的平均AUC绝对提升达4.44%至11.74%。
  • 该方法在所有设置(已见、未见、单类)下均表现稳健,当ρⁿ > 0.5时对数据蒸馏比例ρⁿ的敏感度极低,表明超参数敏感度低。
  • 当ρʰ < 0.35时,困难正样本挖掘在已见与未见设置下带来轻微性能提升,并减少运行时间,兼具高效与有效。
  • 即使真实正常率高达0.9375,模型仍保持高性能,最优性能在ρⁿ ≈ 0.5时实现,得益于自监督蒸馏。
  • 在Letter数据集上,所有ρⁿ与ρʰ取值下,该方法均优于所有基线模型,证实其在多样化设置下的持续优越性。
  • O(1)评分函数支持实时推理,使该方法适用于对时间敏感的异常检测应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。