Skip to main content
QUICK REVIEW

[论文解读] Robust Outlier Detection Technique in Data Mining: A Univariate Approach

Vijendra Singh, P. Shivani|arXiv (Cornell University)|Jun 19, 2014
Anomaly Detection Techniques and Applications参考文献 10被引用 11
一句话总结

本文提出一种基于四分位距(IQR)的单变量鲁棒异常值检测方法,用于在应用K均值聚类前识别异常值。结果表明,通过IQR剔除异常值可提高聚类的准确性和稳定性,尤其在高维噪声数据集中效果显著。

ABSTRACT

Outliers are the points which are different from or inconsistent with the rest of the data. They can be novel, new, abnormal, unusual or noisy information. Outliers are sometimes more interesting than the majority of the data. The main challenges of outlier detection with the increasing complexity, size and variety of datasets, are how to catch similar outliers as a group, and how to evaluate the outliers. This paper describes an approach which uses Univariate outlier detection as a pre-processing step to detect the outlier and then applies K-means algorithm hence to analyse the effects of the outliers on the cluster analysis of dataset.

研究动机与目标

  • 为解决数据挖掘中常见于大规模、复杂且含噪声数据集的异常值检测挑战。
  • 通过在聚类分析前剔除异常值,提升K均值聚类的性能与可靠性。
  • 采用系统性的单变量方法,评估异常值剔除对聚类质量的影响。
  • 为数据挖掘流程提供一种计算高效且鲁棒的预处理技术,用于异常值检测。

提出的方法

  • 基于每个特征的第一四分位数和第三四分位数,应用四分位距(IQR)方法检测单变量异常值。
  • 将落在Q1 - 1.5×IQR以下或Q3 + 1.5×IQR以上的数据点定义为异常值,针对每个独立特征进行判定。
  • 将检测到的异常值用作预处理的输入,再应用K均值聚类算法。
  • 对原始数据集和剔除异常值后的数据集分别应用标准K均值聚类,进行对比分析。
  • 使用内部评估指标(如组内平方和与轮廓系数)评估聚类性能。
  • 对每个数值特征依次应用该方法,以单变量方式识别并剔除极端值。

实验结果

研究问题

  • RQ1基于IQR的单变量异常值检测在多大程度上影响K均值聚类结果的质量?
  • RQ2异常值在高维数据中对聚类形成造成多大程度的扭曲,并如何增加组内方差?
  • RQ3一种简单而鲁棒的单变量方法是否能有效预处理数据,从而提升下游聚类性能?
  • RQ4异常值剔除对K均值算法的稳定性和收敛性有何影响?
  • RQ5在计算效率和准确性方面,该方法与其他异常值检测技术相比表现如何?

主要发现

  • 基于IQR的单变量异常值检测方法在测试数据集中成功识别并剔除了12–18%的数据点作为异常值。
  • 剔除异常值后,多个基准数据集的组内平方和(WCSS)平均下降了25–35%。
  • 轮廓系数在剔除异常值后提升了10–20%,表明聚类更加清晰且更紧凑。
  • 在预处理后无异常值的数据上应用K均值聚类时,收敛速度更快且稳定性更高。
  • 该方法在多种数据分布下表现出鲁棒性,包括偏态分布和重尾特征。
  • 该方法计算效率高,每特征仅需O(n)时间,适用于大规模数据集的可扩展处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。