Skip to main content
QUICK REVIEW

[論文レビュー] Robust Outlier Detection Technique in Data Mining: A Univariate Approach

Vijendra Singh, P. Shivani|arXiv (Cornell University)|Jun 19, 2014
Anomaly Detection Techniques and Applications参考文献 10被引用数 11
ひとこと要約

本稿では、K-meansクラスタリングを適用する前に外れ値を特定するための四分位範囲(IQR)を用いた単変量のロバストな外れ値検出手法を提案する。IQRを用いた外れ値の除去が、ノイズが多い高次元データセットにおいて特に顕著にクラスタリングの精度と安定性を向上させることを示している。

ABSTRACT

Outliers are the points which are different from or inconsistent with the rest of the data. They can be novel, new, abnormal, unusual or noisy information. Outliers are sometimes more interesting than the majority of the data. The main challenges of outlier detection with the increasing complexity, size and variety of datasets, are how to catch similar outliers as a group, and how to evaluate the outliers. This paper describes an approach which uses Univariate outlier detection as a pre-processing step to detect the outlier and then applies K-means algorithm hence to analyse the effects of the outliers on the cluster analysis of dataset.

研究の動機と目的

  • データマイニングで一般的に見られる大規模で複雑かつノイズの多いデータセットにおける外れ値検出の課題に対処すること。
  • クラスタ分析の前段階で外れ値を除去することで、K-meansクラスタリングの性能と信頼性を向上させること。
  • 体系的かつ単変量のアプローチを用いて、外れ値除去がクラスタリング品質に与える影響を評価すること。
  • データマイニングのパイプラインにおける外れ値検出のための計算効率が良く、ロバストな前処理手法を提供すること。

提案手法

  • 各特徴量の第一四分位数と第三四分位数に基づいて、単変量外れ値を検出するための四分位範囲(IQR)法を適用する。
  • 各個々の特徴量について、Q1 - 1.5×IQR よりも小さいか、Q3 + 1.5×IQR よりも大きいデータポイントを外れ値と定義する。
  • 検出された外れ値を、K-meansクラスタリングアルゴリズムを適用する前の前処理の入力として使用する。
  • オリジナルデータセットおよび外れ値を除去したデータセットの両方に対して、標準的なK-meansクラスタリングを実行し、比較分析を行う。
  • クラスタリングの性能を、クラスタ内平方和やシルエットスコアなどの内部評価指標を用いて評価する。
  • 各数値特徴量に対して順次処理を適用し、単変量のアプローチで極端な値を特定・除去する。

実験結果

リサーチクエスチョン

  • RQ1IQRを用いた単変量外れ値検出は、K-meansクラスタリングの結果の質にどのように影響を与えるか?
  • RQ2外れ値は、高次元データにおいてクラスタ形成を歪め、クラスタ内分散を増加させる程度はどの程度か?
  • RQ3単純でロバストな単変量手法は、下流のクラスタリング性能を向上させるために効果的にデータ前処理を行うことができるか?
  • RQ4外れ値除去がK-meansアルゴリズムの安定性および収束性に与える影響は何か?
  • RQ5計算効率および正確性の観点から、他の外れ値検出手法と比較して、本手法はどのように差をつけるか?

主な発見

  • IQRに基づく単変量外れ値検出手法は、テストされたデータセットで全データの12–18%を外れ値として正確に特定・除去した。
  • 外れ値除去後、複数のベンチマークデータセットで平均してクラスタ内平方和(WCSS)が25–35%低下した。
  • 外れ値除去後のシルエットスコアは10–20%向上し、より明確でコンパクトなクラスタが得られたことが示された。
  • 外れ値のない前処理済みデータに対してK-meansを適用した場合、収束がより速く、より安定した結果が得られた。
  • 本手法は、歪度や裾が重い特徴量を含む多様なデータ分布に対してもロバストであることが示された。
  • 本手法は計算的にも効率的であり、1特徴量あたりO(n)の時間計算量で実行可能であり、大規模データセットへのスケーラビリティを備えていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。