Skip to main content
QUICK REVIEW

[論文レビュー] Linear-time Outlier Detection via Sensitivity

Mario Lučić, Olivier Bachem|arXiv (Cornell University)|May 2, 2016
Anomaly Detection Techniques and Applications参考文献 21被引用数 8
ひとこと要約

本稿では、クラスタリング目的関数に対するデータポイントの影響の最大値として定義される感度に基づく、線形時間の外れ値検出アルゴリズムを提案する。影響(感度の計算可能な上界)を計算することで、高い精度と高速性を達成し、最新の距離ベース手法を上回りながら、特に大規模データセットにおいて桁違いに高速である。

ABSTRACT

Outliers are ubiquitous in modern data sets. Distance-based techniques are a popular non-parametric approach to outlier detection as they require no prior assumptions on the data generating distribution and are simple to implement. Scaling these techniques to massive data sets without sacrificing accuracy is a challenging task. We propose a novel algorithm based on the intuition that outliers have a significant influence on the quality of divergence-based clustering solutions. We propose sensitivity - the worst-case impact of a data point on the clustering objective - as a measure of outlierness. We then prove that influence, a (non-trivial) upper-bound on the sensitivity, can be computed by a simple linear time algorithm. To scale beyond a single machine, we propose a communication efficient distributed algorithm. In an extensive experimental evaluation, we demonstrate the effectiveness and establish the statistical significance of the proposed approach. In particular, it outperforms the most popular distance-based approaches while being several orders of magnitude faster.

研究の動機と目的

  • 大規模データセットにおける距離ベース外れ値検出のスケーラビリティ課題に対処する。
  • 分布の仮定に依存しない非パラメトリックで高速かつ正確な外れ値検出手法を開発する。
  • クラスタリング目的関数への外れ値の影響を合理的な指標として感度を導入する。
  • 感度のタイトな上界である影響を線形時間で計算するアルゴリズムを設計し、効率的な外れ値スコアリングを可能にする。
  • さまざまな距離関数とデータ分布に対してロバストであることを保証する。

提案手法

  • 感度を、いかなるクラスタリング目的関数に対してもデータポイントが及える影響の最大値として定義する。
  • 感度の計算可能な上界としての影響を導入し、ランダムサンプリング手順を用いて線形時間で計算可能であることを示す。
  • 複数のランダムクラスタリングにおけるモデル平均を用いることで、影響推定の安定性と精度を向上させる。
  • 影響スコアを外れ値度として適用し、高い影響値がより顕著な外れ値を示すようにする。
  • 単一マシンを超えるスケーリングを実現する通信効率の良い分散アルゴリズムを設計する。
  • 影響は完全なペアワイズ距離計算を伴わずにサンプリングにより推定可能であるという事実を活用する。

実験結果

リサーチクエスチョン

  • RQ1クラスタリング目的関数への影響の最大値として定義される感度が、効果的かつスケーラブルな外れ値影響の指標として機能するか?
  • RQ2感度の計算可能な上界である影響が、精度を損なわずに線形時間で計算可能か?
  • RQ3提案手法の影響ベースのアプローチは、KNN、LOF、クラスタリングベース手法といった既存の距離ベース外れ値検出手法と比較して、性能と速度で優れているか?
  • RQ4精度と通信効率を維持したまま、複数のマシンに効率的に分散可能か?
  • RQ5異なる距離関数やデータ分布に対しても、本手法はロバストであるか?

主な発見

  • 提案手法の影響ベースのアプローチは、すべての比較手法に対してAUPRCで統計的に有意な向上を達成し、最良の手法との平均二乗偏差が最小であった。
  • 13個の実世界データセットのうち12個で、包括的KNNおよびLOFを上回り、優れた統計的性能を示した。
  • GAUSS-1Mデータセットでは、近似KNNの27倍、近似LOFの40倍の高速化を達成した。
  • KDDCUP-FULLデータセット(490万点)では、影響計算が10分未満で完了したのに対し、包括的手法は24時間を超えた。
  • 距離関数の選択にかかわらずロバストであり、多様なデータ分布および次元数において高い性能を維持した。
  • MNISTにおける可視化では、本手法がクラスタ間外れ値を効果的に検出できており、KNN、LOF、反復的サンプリングよりも意味のある外れパターンを効果的に特定していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。