Skip to main content
QUICK REVIEW

[論文レビュー] Arrays of (locality-sensitive) Count Estimators (ACE): High-Speed Anomaly Detection via Cache Lookups

Chen Luo, Anshumali Shrivastava|arXiv (Cornell University)|Jun 20, 2017
Anomaly Detection Techniques and Applications参考文献 37被引用数 6
ひとこと要約

ACEは、局所性に敏感なカウンティング推定器のアレイを用いて、ストリーミングデータにおけるリアルタイムの外れ値検出を可能にする、高速かつ超低メモリ消費の異常検知アルゴリズムを提案する。局所性に敏感なハッシュ(LSH)のサンプリングに基づく新規推定器を活用することで、ELKIより60倍の高速化を達成しながら4MB未満のメモリを消費し、高速スループットシステムにおけるキャッシュベースのデプロイに適している。

ABSTRACT

Anomaly detection is one of the frequent and important subroutines deployed in large-scale data processing systems. Even being a well-studied topic, existing techniques for unsupervised anomaly detection require storing significant amounts of data, which is prohibitive from memory and latency perspective. In the big-data world existing methods fail to address the new set of memory and latency constraints. In this paper, we propose ACE (Arrays of (locality-sensitive) Count Estimators) algorithm that can be 60x faster than the ELKI package~\cite{DBLP:conf/ssd/AchtertBKSZ09}, which has the fastest implementation of the unsupervised anomaly detection algorithms. ACE algorithm requires less than $4MB$ memory, to dynamically compress the full data information into a set of count arrays. These tiny $4MB$ arrays of counts are sufficient for unsupervised anomaly detection. At the core of the ACE algorithm, there is a novel statistical estimator which is derived from the sampling view of Locality Sensitive Hashing(LSH). This view is significantly different and efficient than the widely popular view of LSH for near-neighbor search. We show the superiority of ACE algorithm over 11 popular baselines on 3 benchmark datasets, including the KDD-Cup99 data which is the largest available benchmark comprising of more than half a million entries with ground truth anomaly labels.

研究の動機と目的

  • 厳密なメモリ制限と遅延制約を伴う高速で変化するデータストリームにおけるリアルタイム異常検知の課題に対処すること。
  • ビッグデータ環境で高メモリ消費と高遅延を示す既存の非教師あり異常検知手法の限界を克服すること。
  • CPUキャッシュ(2–10MB)に完全に収まるメモリ効率の高いアルゴリズムを設計し、リアルタイムアプリケーションにおける超低遅延推論を可能にすること。
  • 従来の手法では実現不可能なモバイルデバイスやスマートセンサーなどの低電力・低メモリプラットフォームへのデプロイを可能にすること。
  • 高い検知精度を維持しながら計算およびストレージのオーバーヘッドを著しく削減するスケーラブルでキャッシュ最適化されたソリューションを提供すること。

提案手法

  • 各アレイが異なるハッシュ関数を使用してデータポイントの局所的密度を推定する、LSHベースのカウンティング推定器のアレイ(ACE)を採用する。
  • LSHのサンプリング的視点から導出された新規統計推定器を用い、各ハッシュバケットをランダムサンプルとみなして外れ値スコアを推定する。
  • クエリポイント $ q $ の外れ値スコアを、別々のハッシュアレイから得た $ L $ 個の独立推定器の平均として計算する。
  • 各ハッシュ関数ごとに $ O(1) $ のサイズのコンactなカウントアレイを維持し、各ハッシュバケットにマッピングされたデータポイント数のみを格納する。
  • 期待値の線形性を活用して推定器が不偏であることを保証し、$ L $ 個の独立したハッシュアレイでの平均化によって分散を低減する。
  • キャッシュフレンドリーなデータ構造を用いてカウントアレイを格納し、高速なランダムアクセスを実現し、リアルタイム処理におけるメモリ遅延を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1新規のLSHベースのサンプリング推定器は、最小限のメモリフットプリントで高精度な異常検知を達成できるか?
  • RQ2ACEアルゴリズムは、最先端の非教師あり異常検知手法と比較して、速度およびメモリ効率においてどの程度の性能を示すか?
  • RQ3ACEアルゴリズムは、大規模で高次元的かつストリーミング形式のデータセット、特に動的なデータ分布を伴う環境にどの程度スケーラブルに適合できるか?
  • RQ4ACEアルゴリズムはCPUキャッシュ内に完全にデプロイ可能であり、リアルタイムシステムで1ミリ秒未塔の応答時間を達成できるか?
  • RQ5推定器の分散はハッシュアレイ数 $ L $ にどのように依存するか?また、精度とメモリの最適なトレードオフは何か?

主な発見

  • ACEは、非教師あり異常検知アルゴリズムの実装として最も高速であるとされるELKIパッケージよりも60倍の高速化を達成している。
  • アルゴリズムは、全データセットを表現するために4MB未満のメモリを必要とし、完全なキャッシュ内デプロイと超低遅延アクセスを可能にしている。
  • 50万件を超えるエントリと正解ラベルを備えたKDD-Cup99ベンチマークにおいて、ACEは11の代表的ベースラインと比較して速度および精度の両面で優れている。
  • 期待値の線形性のおかげで、データポイント間で指標変数が相関していても、推定器は不偏である。
  • 推定器の分散は $ 1/L $ の割合で減少し、$ L $ が増加するにつれて、最小限のメモリオーバーヘッドで高精度な推定が可能になる。
  • 本手法はデータドリフトに強く、動的データ更新をサポートするため、リアルタイムで高速度のデータ処理環境に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。