Skip to main content
QUICK REVIEW

[論文レビュー] Automating Outlier Detection via Meta-Learning

Yue Zhao, Ryan A. Rossi|arXiv (Cornell University)|Sep 22, 2020
Anomaly Detection Techniques and Applications参考文献 51被引用数 12
ひとこと要約

本論文は、ベンチマークデータセット across の歴史的パフォーマンスデータを活用して、異常検出モデル選択を自動化するメタラーニングフレームワーク、MetaODを提案する。特化したメタ特徴量を用いてデータセットの異常特性を定量化し、ラベルなしで高速かつワンショットで最適な検出器とハイパーパramータの選択を可能にし、最小限のオーバーヘッドで最先端の手法やLOFやiForestといった一般的な検出器を上回る性能を発揮する。

ABSTRACT

Given an unsupervised outlier detection (OD) task on a new dataset, how can we automatically select a good outlier detection method and its hyperparameter(s) (collectively called a model)? Thus far, model selection for OD has been a "black art"; as any model evaluation is infeasible due to the lack of (i) hold-out data with labels, and (ii) a universal objective function. In this work, we develop the first principled data-driven approach to model selection for OD, called MetaOD, based on meta-learning. MetaOD capitalizes on the past performances of a large body of detection models on existing outlier detection benchmark datasets, and carries over this prior experience to automatically select an effective model to be employed on a new dataset without using any labels. To capture task similarity, we introduce specialized meta-features that quantify outlying characteristics of a dataset. Through comprehensive experiments, we show the effectiveness of MetaOD in selecting a detection model that significantly outperforms the most popular outlier detectors (e.g., LOF and iForest) as well as various state-of-the-art unsupervised meta-learners while being extremely fast. To foster reproducibility and further research on this new problem, we open-source our entire meta-learning system, benchmark environment, and testbed datasets.

研究の動機と目的

  • ラベルの欠如と普遍的な目的関数の不在により、教師なし異常検出における原理的で整合性のあるモデル選択の欠如に対処すること。
  • ラベルデータを必要とせず反復的評価を伴わずに、新しいデータセットに対して最良の異常検出手法とそのハイパーパramータを自動で選択すること。
  • ベンチマークデータセットにおける過去のモデルパフォーマンスを一般化し、新しいタスクに応用可能なデータ駆動型でメタラーニングに基づくアプローチを確立すること。
  • 異常特性を捉えるドメイン特化型のメタ特徴量を設計し、タスク類似度推定を向上させること。
  • 今後の異常検出の自動化分野における研究を可能にする再現可能でオープンソースのプラットフォームを構築すること。

提案手法

  • MetaODは、異常検出タスクのメタ特徴量が示す異常特性に基づき、新しいタスクを過去のベンチマークデータセットにマッピングするメタラーニングフレームワークを用いる。
  • 密度、次元数、異常分布統計量といったメタ特徴量を計算し、新しいデータセットと歴史的データセット間のタスク類似度を定量化する。
  • 協調フィルタリングにインspiredされた重み付き集約を用いて、類似した歴史的タスクにおける過去のモデルパフォーマンスを統合し、新しいタスクのパフォーマンスを予測する。
  • 各新しいデータセットを新しいユーザー、各検出器をレーティングのないアイテムとして扱う、コールドスタート推薦のアナロジーを採用する。
  • 新しいデータセットからメタ特徴量を抽出し、1回の推論ステップで予測パフォーマンスが最も高いモデルを選択する。
  • この手法は非常に効率的であり、メタ特徴量の計算とパフォーマンス推定は、モデル学習と比較して無視できるほどのランタイムオーバーヘッドにとどまる。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしの環境下で、メタラーニングを効果的に異常検出モデル選択に応用できるか?
  • RQ2どのタイプのメタ特徴量がタスク類似度推定に必要な正確なデータセットの異常特性を最もよく捉えられるか?
  • RQ3MetaODは、最先端の教師なしメタラーナーおよび一般的な異常検出器(LOF や iForest)と比較して、パフォーマンスで優れているか?
  • RQ4MetaODは最小限の計算オーバーヘッドで高いパフォーマンスを発揮し、実世界の展開に実用的か?
  • RQ5MetaODは多様なデータセットおよび異常検出シナリオにおいて、どれほど頑健か?

主な発見

  • MetaODは、LOF や iForest といった一般的な検出器を含むすべてのベースラインを、平均平均適合率(MAP)の観点で顕著に上回り、POCベンチマークでMAP 0.3382を達成した。
  • MetaODは全データセットで平均順位6.87を達成し、ペアワイズウィルコクソン符号順位検定において、iForestを除くすべてのベースラインを統計的に有意に上回った。
  • メタ特徴量抽出とモデル選択に起因するランタイムオーバーヘッドは無視できるほど小さく、定数時間で実行可能であり、並列処理が容易である。
  • MetaODは、MetaOD_C や MetaOD_F、RS といった他のメタラーナーと比較して、ほとんどの比較で統計的に有意な改善(p < 0.05)を示した。
  • 異常特性に特化したメタ特徴量の使用により、一般的または非異常特化型の特徴量よりも、より正確なタスク類似度推定が可能になった。
  • MetaODシステムとベンチマークテストベッドのオープンソース化により、今後の自動異常検出分野における研究の再現可能性の基盤が提供された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。