Skip to main content
QUICK REVIEW

[论文解读] Comparison of Outlier Detection Techniques for Structured Data

Amulya Agarwal, Nitin Gupta|arXiv (Cornell University)|Jun 16, 2021
Anomaly Detection Techniques and Applications参考文献 35被引用 6
一句话总结

本文在结构化表格数据上对15种异常检测技术(涵盖邻近性、线性模型、集成和概率模型类别)进行了比较。通过在14个数据集上使用精确率、召回率和分类准确率评估其对机器学习模型性能的影响,发现不存在 universally 最优的方法,但识别出ABOD和OCSVM在去除异常值后对模型性能提升最为一致。

ABSTRACT

An outlier is an observation or a data point that is far from rest of the data points in a given dataset or we can be said that an outlier is away from the center of mass of observations. Presence of outliers can skew statistical measures and data distributions which can lead to misleading representation of the underlying data and relationships. It is seen that the removal of outliers from the training dataset before modeling can give better predictions. With the advancement of machine learning, the outlier detection models are also advancing at a good pace. The goal of this work is to highlight and compare some of the existing outlier detection techniques for the data scientists to use that information for outlier algorithm selection while building a machine learning model.

研究动机与目标

  • 为结构化表格数据集中的15种异常检测技术提供全面比较。
  • 评估通过每种方法检测到的异常值被移除后对下游机器学习模型性能的影响。
  • 根据在多样化数据集上的实证性能,为数据科学家选择合适的异常检测算法提供指导。
  • 识别出在多种分类器和数据集上持续提升模型准确率和鲁棒性的异常检测技术。

提出的方法

  • 评估了15种异常检测算法:LOF、KNN、CBLOF、ABOD、HBOS、MCD、OCSVM、COF、PCA、F.Bagging、孤立森林、SOD、LODA、LSCP、CPOD。
  • 将每种异常检测方法应用于14个基准数据集,然后在训练数据中移除检测到的异常值,再重新训练模型。
  • 以精确率和召回率为每个数据集上异常检测性能的主要评估指标。
  • 在原始数据集和去除异常值后的数据集上训练并评估多种分类器(例如,逻辑回归、随机森林、决策树),以衡量性能变化。
  • 计算所有数据集上的平均精确率和召回率,以对整体异常检测性能进行排序。
  • 进行消融分析,以确定哪种异常检测技术在平均意义上最显著提升了模型准确率。

实验结果

研究问题

  • RQ1在多样化结构化数据集上,哪种异常检测技术在平均精确率和召回率上表现最高?
  • RQ2通过每种方法检测到的异常值被移除后,对下游机器学习模型性能有何影响?
  • RQ3是否存在某些异常检测技术在多种分类器和数据集上始终能提升模型准确率?
  • RQ4哪种异常检测方法在不同数据分布和特征空间中表现出最稳健的性能?
  • RQ5是否存在一种普遍最优的异常检测方法,还是性能显著因数据集和模型类型而异?

主要发现

  • ABOD和OCSVM是在提升下游模型性能方面最有效的异常检测技术,其中ABOD在各类分类器上的平均提升最高。
  • CBLOF在平均异常检测能力上表现最佳,平均精确率为0.46,平均召回率为0.34。
  • 在14个数据集中,所有15种异常检测技术均在至少两个数据集上提升了模型性能,表明其具有广泛的适用性。
  • 对于随机森林,ABOD、HBOS、OCSVM、PCA和LODA在提升模型准确率方面表现最为一致。
  • 对于决策树,ABOD、CBLOF、HBOS、OCSVM、LSCP和LODA在增强模型性能方面优于其他技术。
  • 对于逻辑回归,ABOD、OCSVM、KNN、平均KNN和SOD在去除异常值后带来了最佳的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。