Skip to main content
QUICK REVIEW

[論文レビュー] Anomaly detection using data depth: multivariate case

Pavlo Mozharovskyi, Valla, Romain|arXiv (Cornell University)|Oct 6, 2022
Advanced Statistical Methods and Models被引用数 4
ひとこと要約

本稿では、多変量異常検出のためのロバストでアフィン不変な手法としてデータデプスを提案し、低デプス値を示す点を異常と特定する。近似デプス計算、特に最適化されたサンプリング(洗練されたランダムサーチ)を用いることで、高次元データ(最大d=50)においても効率的かつスケーラブルな検出が可能となり、孤立フォレストやオートエンコーダーといった最先端手法と同等の性能を示す。

ABSTRACT

Anomaly detection is a branch of data analysis and machine learning which aims at identifying observations that exhibit abnormal behaviour. Be it measurement errors, disease development, severe weather, production quality default(s) (items) or failed equipment, financial frauds or crisis events, their on-time identification, isolation and explanation constitute an important task in almost any branch of science and industry. By providing a robust ordering, data depth - statistical function that measures belongingness of any point of the space to a data set - becomes a particularly useful tool for detection of anomalies. Already known for its theoretical properties, data depth has undergone substantial computational developments in the last decade and particularly recent years, which has made it applicable for contemporary-sized problems of data analysis and machine learning. In this article, data depth is studied as an efficient anomaly detection tool, assigning abnormality labels to observations with lower depth values, in a multivariate setting. Practical questions of necessity and reasonability of invariances and shape of the depth function, its robustness and computational complexity, choice of the threshold are discussed. Illustrations include use-cases that underline advantageous behaviour of data depth in various settings.

研究の動機と目的

  • 産業的・科学的応用における多変量異常検出の分野で、データデプスを実用的ツールとして確立すること。
  • 高次元および大規模データ環境におけるデータデプスの計算的課題を解決すること。
  • 近似の精度、計算効率、検出性能の間のトレードオフを評価すること。
  • オートエンコーダー、1クラスSVM、孤立フォレストといった既存手法と比較して、データデプスに基づく異常検出の性能を評価すること。
  • サブサンプリングおよび近似アルゴリズムが検出品質と実行時間に与える影響を調査すること。

提案手法

  • 非パラメトリックな中心性の指標としてデータデプスを用い、より異常な点ほど低いデプス値を割り当てる。
  • 主に投影デプスとハーフスペースデプスをコアなデプス関数として採用し、ロバストネスとアフィン不変性を主な特性とする。
  • 高次元における計算コストを削減するため、ランダムサーチ(RS)および洗練されたランダムサーチ(RRS)による近似計算を適用する。
  • 純粋なランダム手法よりも収束性が向上し、分散が低減するよう、深さ近似においてNelder-Mead最適化を用いる。
  • トレーニングデータのサブサンプリングを実装し、メモリおよび計算負荷を軽減しながらも、検出品質を維持する。
  • 合成データ(5%の異常)を用い、50回の繰り返しで式(16)に示される異常検出品質の指標を評価する。

実験結果

リサーチクエスチョン

  • RQ1多変量設定において、データデプスに基づく異常検出は、孤立フォレストや1クラスSVMといった既存手法と比較してどのように性能を発揮するか?
  • RQ2近似手法(例:RS対RRS)が、高次元データにおける検出精度および計算効率に与える影響は何か?
  • RQ3トレーニングセットのサブサンプリングは、計算コストを削減する一方で、異常検出の品質にどのように影響を与えるか?
  • RQ4現実の非楕円分布データにおいて、データデプスはロバストネスとアフィン不変性をどの程度維持できるか?
  • RQ5データデプスは異常検出において解釈可能性を提供できるか?また、オートエンコーダーのようなブラックボックスモデルと比較して、その性能はいかにか?

主な発見

  • データデプスに基づく異常検出は、複雑で非楕円的分布のデータに対しても、孤立フォレストや1クラスSVMといった最先端手法と同等の高い性能を示す。
  • 200本の方向に対してRRSを用いる近似計算では、1コアのApple M1 Maxチップ上でd=10の1,000点のデプス計算を20秒未塔で実行可能であり、高い計算効率を示している。
  • 純粋なランダムサーチ(RS)は次元の呪いに苦しむ。d=10で5,000本の方向に対しては計算時間が500秒にまで増加するが、RRSはより優れたスケーラビリティを維持している。
  • d=20において、トレーニングセットのサブサンプリングは検出品質を急激に低下させず、徐々に低下させる傾向を示しており、速度と精度の妥協可能なトレードオフを示している。
  • d=50においては、距離空間上では異常が認識できなくなるが、データデプスは依然として効果的な検出を可能にする。これは、高次元における異常の隔離にデータデプスが有効であることを示している。
  • 深さ近似においてNelder-Mead最適化を用いることで、特に高次元において、ランダムサーチに比べて性能が向上し、分散が低減され、収束性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。